科学与方法 · 2026年8月19日复核

如何评估医疗 AI 智能体

我们区分产品假设与已证实的医疗获益。每个智能体都应明确用途、用户、数据边界、错误类型、停止标准和专业人员监督。

科学原则

部署前先评估

技术准确率本身不能证明临床获益。评估对象包括数据、模型、界面、工作流以及人机协作团队。

01

用途与边界

明确一项任务、目标用户、允许的操作,以及必须停止或转交人工的情形。

02

预先设定指标

测试前设定完整性、误报、遗漏、耗时、来源质量和必须终止验证的严重错误。

03

人机协作团队

不仅评估模型回答,也评估专业人员如何理解、核查、纠正并使用结果。

04

版本与可推广性

记录模型、提示词、知识库和数据集版本,不把一个人群或机构的结果自动推广到其他场景。

证据阶梯

五个独立阶段

进入每个下一阶段都需要新的方案、批准以及责任专业人员的明确决定。

  1. 01

    产品假设

    描述用户、问题、预期操作和不可接受的伤害。

  2. 02

    合成评估

    使用虚构案例验证来源、拒绝、转人工和界面稳定性。

    当前阶段
  3. 03

    离线验证

    在获准数据上评估预先设定指标、亚组、偏倚和外部适用性。

  4. 04

    早期临床评估

    按方案在小规模真实流程中研究安全性、人因和运行表现。

  5. 05

    比较评估

    与选定对照比较流程或结局影响,并记录意外后果。

研究计划

具体测量什么

01

临床试验导航

检索完整性、标准匹配错误、未知信息比例、协调员复核时间以及向医生转交的质量。

02

ОМС、ВМП 与自费肿瘤路径

官方来源时效性、下一步清晰度、材料完整性,以及是否避免暗中选择治疗或机构。

03

临床副驾驶

有来源的陈述比例、无依据结论、关键遗漏、复核耗时和专业核查质量。

04

运营智能体

遗漏操作、角色间转交质量、人工纠正、周期耗时和新增风险点。

主要与官方来源

方法学基础

Evidence boundary

本页不能证明什么

方法和来源清单不等于项目已完成临床研究、已注册为医疗器械或可处理真实健康数据。这些结论需要单独的证据和批准。