核心观点

内容精讲

大量临床诊断可以仅靠语言访谈完成——这正是医生问诊的价值。但现实中的问诊受制于经济、地理和系统因素,并非人人都能获得。语言模型在精选医疗病例集上已展现不俗的鉴别诊断能力,但既有评估大多依赖精心构造甚至合成的病例小短文,与实际病人的表述方式相去甚远:真实患者医疗素养参差、信息不完整、对话杂乱。模型在真实世界的表现究竟如何,此前缺乏全国规模的证据。

SymptomAI 用一项随机对照研究回答了这个问题。13,917 名同意参与研究的受试者被随机分配,与 5 种 SymptomAI Agent(均基于 Gemini Flash 2.0)之一对话:描述症状、Agent 追问、最终产出鉴别诊断清单(DDx)和下一步建议。研究明确所有诊断仅供研究分析,不构成临床确诊。受试者随后正常就医,两周后通过问卷报告医生给出的诊断,作为对照的「金标准」。

**评估设计比模型更讲究。** 研究者做了两件事确保结论可信。一是临床专家标注研究:由三名认证临床医生盲审对话记录,各自独立给出自己的鉴别诊断,再在不知道来源的情况下对 SymptomAI 的 DDx 和其他医生的 DDx 一起排序。二是可穿戴生物信号交叉验证:把 SymptomAI 的鉴别诊断与受试者对话前 Fitbit 设备的生理数据对照,从第三方信号寻找一致性证据。

**结果一:专家更喜欢 AI 的鉴别诊断。** 临床医生在超过 50% 的案例中更偏好 SymptomAI 生成的 DDx,且 SymptomAI 的 DDx 更常被临床评分者评为总体质量最优。用 top-5 准确率(真实诊断是否出现在 DDx 的 5 个候选里)衡量,SymptomAI 同样更常命中受试者就医后获得的真实诊断。

**结果二:主动追问显著提升表现。** 研究设计了 5 种病史采集策略作为对照臂:Dynamic Live 和 Dynamic Final 拥有完全自由,可提任意追问;Fixed Canonical 和 Flexible Canonical 从医学院教授的标准病史问题集中提问;Base 则是无提示的裸模型,完全由用户主导——这正是当前主流聊天机器人的真实使用形态。结论很明确:所有 Agent 驱动的主动提问策略都显著优于 Base 条件。信息是诊断的燃料,主动引导病史采集能实打实提升鉴别准确率。

**结果三:生物信号侧面印证。** 感染性疾病病因是研究中可验证性最强的类别之一。数据显示,SymptomAI 对话后诊断为感染性疾病病因的案例,其 Fitbit 生理趋势与免疫应答的常见信号相吻合。作为随机双盲之外的第三方证据,这为模型诊断的合理性提供了独立支撑。

研究也划清了边界:所有诊断仅供研究分析;对话交互的真实性、受试者的自我报告偏差、可穿戴数据的间接性都是已知局限。它回答的不是「AI 能否替代医生」,而是「在真实问诊场景里,对话式 Agent 能提供多大诊断价值」——答案是远超此前小样本、合成病例研究所能显示的,尤其当 Agent 被允许主动追问时。

阅读价值

对医疗 AI 从业者,这是一份少见的真实世界大规模对照数据,5 种问诊策略的设计可直接复用;对关心大模型落地边界的读者,它展示了 Agent 主动交互如何改写诊断流程,以及验证模型表现的多重证据手段。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://research.google/blog/symptomai-towards-a-conversational-ai-agent-for-everyday-symptom-assessment/