急诊AI分诊基准测试:基于临床知识库的方案漏诊率显著低于通用大模型
一项发表于medRxiv的预印本研究提出名为“MTS-Bench”的曼彻斯特分诊系统安全性基准,测试了通用大语言模型GPT-5.1与两款基于策划式临床知识库的AI分诊辅助工具。结果显示,GPT-5.1的漏诊率达44.2%,并出现6例危险漏诊;而两款专用方案漏诊率均为11.5%,且无危险漏诊。当输入中加入生命体征等客观临床数据后,启用分诊系统检索的配置漏诊率进一步降至3.8%。
近期发表于medRxiv的一项预印本研究提出名为“MTS-Bench”的曼彻斯特分诊系统(MTS)安全性基准,用于评估AI在急诊分诊场景中的可靠性。研究团队沿用并改写了此前发表的39个急诊临床病例,覆盖MTS全部五个优先级等级,并设置“含/不含客观临床数据”两种输入变体,叠加“是否前置误导性全科医生转诊陈述”作为锚定变量,每个系统测试312条提示。
结果显示,OpenAI GPT-5.1的整体漏诊率为44.2%,在最高优先级的红色病例中漏诊率达75.0%,橙色病例漏诊率为73.4%,并出现6例(3.8%)被认定为“危险漏诊”的案例。而两款基于策划式临床知识库的DR. INFO配置漏诊率均为11.5%,且未出现危险漏诊,与GPT-5.1的差异具有统计学显著性(Fisher精确检验 p = 1.0×10⁻¹⁰)。在引入客观临床数据(生命体征、检查结果、实验室数据)后,启用MTS检索的DR. INFO配置漏诊率由19.2%下降至3.8%。
研究还发现,当输入被加入误导性转诊陈述作为锚定时,GPT-5.1对全部8例红色病例均出现漏诊,而两款DR. INFO配置仍未发生漏诊,提示通用模型存在显著的锚定从众倾向。研究者认为,结果支持在临床高风险决策场景中谨慎使用未经验证的通用大语言模型。
【空音视角】 该研究再次提示,通用大语言模型在高风险医疗决策中存在明显的锚定偏倚与系统性低估紧急程度的倾向,这是临床安全防线最不能容忍的失效模式。从WiFi感知与非接触监测的视角看,“加入客观临床数据可将漏诊率由19.2%降至3.8%”这一发现颇具启发——结构化、连续、可验证的生命体征数据恰恰是非接触式监测最擅长提供的输入。如何把这类高质量客观数据无缝嵌入临床决策链路,可能是辅助AI分诊与远程监护走向规模落地的关键拼图。
—— 本文基于公开报道由空音编辑部 AI 辅助改写 来源:medRxiv 预印本 原文链接:https://www.medrxiv.org/content/10.64898/2026.08.04.26359651v1?rss=1
来源:medRxiv 预印本(查看原文)