外观
从一批数据到科室结论
本章解决:怎样把一批结算清单或病案数据变成可复核的科室问题清单,而不是直接生成一张“盈亏排名”。
1. 先给结论
- 月报只是输出。上游的工作链是取数、字段理解、清洗、规则版本、分组、指标、异常复核、解释和复跑,任何一环断了,月报都只是一张好看的表。
- 先做数据质量,再做分组;“成功返回”不等于输入可靠。
- 科室、病种、病组和医生分析必须有明确分母、期间和纳入/排除范围。
- 异常筛查用于建立复核队列,不能自动判定违规、编码错误、医疗质量或绩效。
- AI 可以加速清洗、计算、图表和摘要,但口径、复核和行动责任仍要由专业人员确认。
2. 批量分析的八步链
任何一步改变,都要记录批次、版本和影响范围。
3. 先写分析合同
| 项目 | 示例 |
|---|---|
| 决策问题 | 哪些病例需要病案、临床和医保联合复核? |
| 数据期间 | 2026-06-01 至 2026-06-30 |
| 分母 | 期间内符合纳入条件的出院病例 |
| 排除 | 身份字段、取消结算、缺少关键字段且无法修复的记录 |
| 观察层次 | 医院、科室、医生、病组/病种、病例 |
| 规则环境 | 地区、DRG/DIP、版本、执行日期 |
| 输出 | 质量报告、批量结果、异常队列、科室摘要、行动表 |
| 不支持 | 仅凭分组和费用判定诊疗合理性、违规或绩效 |
没有分析合同,临时筛选很容易改变分母。
4. 字段与敏感级别
至少分为:
- 直接标识符:姓名、证件号、手机号、住院号等;公开教学不需要。
- 准标识符:精确日期、年龄、科室、罕见诊断组合等;按任务最小化。
- 分组字段:诊断、操作、位次、性别、年龄、体重、住院日等。
- 费用字段:总费用、医保范围内费用、基金支出、费用构成;名称和单位不能混用。
- 组织字段:科室、医生、机构;先建立标准映射。
- 审计字段:来源批次、行号、执行版本、时间、结果和错误码。
公开示例优先使用合成数据;“去掉姓名”不等于已经充分脱敏。
5. 数据质量闸门
| 维度 | 检查示例 | 产物 |
|---|---|---|
| 完整性 | 主诊断、必要病例属性是否缺失 | 缺失率和不可分组队列 |
| 有效性 | 编码、日期、年龄、费用类型是否有效 | 非法值清单 |
| 一致性 | 编码—名称、年龄—日期、科室映射是否一致 | 冲突清单 |
| 唯一性 | 病例是否重复、主键是否稳定 | 重复与保留规则 |
| 可追溯性 | 来源行、修改记录、版本是否存在 | 批次清单和哈希 |
闸门结果至少写出总行数、通过数、警告数、阻断数和排除原因。
闸门要能挡住"不报错的错"
上面五个维度都在查内容。但还有一类问题发生在读文件那一步,闸门跑之前就已经错了。
真实例子:一份 21,970 行的 CSV,98 行的中文诊断名里含逗号(如 "阴道上皮内肿瘤,Ⅰ级")。文件完全合规——这些字段都正确加了引号。但用 cut -d, 或 split(',') 读,这 98 行的列会整体右移。
不报错,不崩溃,只是给你 98 行错位数据。 而错位之后,诊断列里装的是操作码,费用列里装的是年龄——每一条单独看都"是个值",完整性与有效性检查未必拦得住。
所以闸门的第一项应该是解析层自检:
text
读完之后统计每行字段数 → 全部相等才继续一行代码,能挡住所有分隔符类问题。诊断名、手术名、科室名恰好都是中文文本字段,这类问题在医疗数据里不是小概率。
完整记录见郑州 DIP 版本切换影响测算第 9.1 节。
6. 批量分组怎样验收
不要只看“5/5 成功”:
- 固定城市、类型和版本。
- 保存输入字段映射和原始顺序。
- 记录每行成功、失败、病组/病种和关键返回字段。
- 对成功、失败和边界病例分别抽样。
- 抽取若干病例在单例页面复跑。
- 对上次批次或金标结果做差异比较。
- 将规则变化、数据变化和产品变化分开解释。
辅助合成基线
2026-07-20 的既有可追溯 MCP 实测包含 5 个 预研口径合成病例:
| 编号 | 年龄 | 其他诊断摘要 | 结果 |
|---|---|---|---|
| S-BATCH-001 | 70 | R64.x00 | ES4F|CC |
| S-BATCH-002 | 62 | E77.801 | ES45|无 CC |
| S-BATCH-003 | 45 | E12.100 | ES43|CC |
| S-BATCH-004 | 18 | 无 | ES45|无 CC |
| S-BATCH-005 | 85 | 三条其他诊断 | ES4F|CC |
这组数据只用于演示批量回归和差异队列。它不是网页截图案例,不代表真实科室分布。
7. 从病例到科室的五个层次
| 层次 | 先问什么 | 示例指标 |
|---|---|---|
| 医院 | 总体病例结构和数据质量是否变化? | 病例数、入组率、结构变化 |
| 科室 | 哪些科室贡献了变化? | 病例数、病组/病种谱、异常率 |
| 医生 | 是否需要进一步复核病例组合? | 病例数和结构;需最小样本护栏 |
| 病组/病种 | 哪些组合出现量、费用或版本迁移变化? | 构成、费用、住院日、迁移 |
| 病例 | 哪些记录需要人工处理? | 未入组、字段冲突、异常值、版本差异 |
先从医院到科室定位,再下钻到病例;不要用一张医生排名替代问题诊断。
8. 指标必须带完整定义
每个指标至少写明:
- 名称和业务目的;
- 公式;
- 分子、分母;
- 单位和时间窗口;
- 数据源和字段;
- 纳入、排除;
- 地区和规则版本;
- 缺失值处理;
- 是否为正式规则、分析阈值或经验筛查。
例如:
text
入组率 = 成功进入目标规则结果的病例数 ÷ 符合批量分组输入条件的病例数分母不能静默排除失败病例,否则质量问题会被隐藏。
9. 异常队列而不是异常结论
建议建立以下队列:
- 未入组或返回错误;
- 单例与批量不一致;
- 新旧版本结果迁移;
- 诊断/操作缺失、冲突或位次异常;
- 费用或住院日统计异常;
- 高/低倍率候选;
- 小样本、罕见病例和极端值。
队列应包含 筛查规则、证据、可能原因、复核角色、处理状态。分析阈值必须标明,不得伪装成地方正式规则。
10. 从结论走到行动
| 发现 | 不能直接说 | 可执行行动 |
|---|---|---|
| 某科室未入组率升高 | 科室编码差 | 抽样病例,核对缺失字段、版本和主次顺序 |
| 某病组费用高 | 存在浪费 | 分层比较严重度、住院日和费用构成 |
| 新版迁移病例增加 | 新版导致亏损 | 固定分母,核对规则迁移、支付参数和资源基线 |
| 某医生病例结构不同 | 医疗质量低 | 检查样本量、病种谱、转诊和岗位差异 |
| 支付差额为负 | 科室亏损 | 明确比较费用和成本口径,不将差额等同利润 |
行动表至少包含负责人、完成时间、成功指标和护栏。
让 AI 生成图表时,得替它补上领域常识
AI 做图表很快,但它不知道你的读者是谁。几条实际用过的纠偏指令:
| 指令 | 为什么必须说 |
|---|---|
| MDC 要显示中文科室名,不能只给字母代码 | 临床医生不知道「MDCI」是骨科。给代码等于给了一张没人看的图 |
| 不要依赖外部 CDN,图表库要内联 | 院内网加载不出来会白屏。这一条不说,AI 默认用 CDN |
| 热力图要区分内科与外科 | 不分科的色块堆积看不出政策导向,只是好看 |
| 金额轴标明口径与单位 | 「万元」还是「元」、含不含自费,AI 不会自己想到 |
这类指令与模型无关——换任何模型都要说,因为它们是领域常识,不在模型的训练目标里。
把常用的几条固化成模板,比每次现想要快得多。
11. 复跑与版本管理
保存:
- 原始输入批次和哈希;
- 字段映射与质量报告;
- 规则版本和执行环境;
- 分组结果与错误队列;
- 指标定义版本;
- 报告版本和修改原因;
- 上期/本期差异;
- 复核和关闭记录。
领导临时追问新增一个维度时,应从同一数据合同复跑,不要手工改一张图后失去口径一致性。
12. 读完你应该能
- 决策问题、分母、期间和排除项明确。
- 直接标识符已移除或隔离,准标识符按需最小化。
- 质量闸门有总数、通过、警告、阻断和原因。
- 批量结果抽样回到单例复核。
- 指标含公式、单位、分子、分母、期间和版本。
- 异常只进入复核队列,未自动判定违规或绩效。
- 管理行动有负责人、指标和护栏。
- 复跑可以重现同一结果或解释差异。
- 支付差额未写成利润。
13. 来源
本章不直接引用政策文件条文;涉及的规则口径见各处内链指向的篇目。
本书的实测依据
下面这些不是政策文件,是本书自己跑出来或整理的东西。可以用来理解方法,不要当规则引用——要写进正式材料,回到上面的官方来源。
- 本工作区《数据分析全家桶》内部底稿与数据加工链方法。
- MedGroup MCP 自动化手册《事实核对》《研究与测试矩阵》,合成批量数据与运行证据,2026-07-20。
14. 下一步
- 怎样开展专科研究
- A02|公式与指标速查
- A04|交付前自检清单
- DRG 运营分析报告样例(交付型:一份可复现的报告长什么样)