游乐游手机版
首页/AI热点日报/热点详情

普林斯顿大学研究:医生与AI大模型协同临床诊断新范式

类型:热点整理2026-07-21
先说几个核心判断:医疗AI当前确实炙手可热,但“人类 vs 机器”这种对立叙事,可能从一开始就偏离了正确方向。普林斯顿大学最新发布的一项研究,给出了一个更务实的答案——1+1>2。具体来说,就是医生与AI大模型联合诊断,准确率明显优于任何一方单独作战。这不是空喊口号,背后有扎实的数据支撑。 摘要 高

先说几个核心判断:医疗AI当前确实炙手可热,但“人类 vs 机器”这种对立叙事,可能从一开始就偏离了正确方向。普林斯顿大学最新发布的一项研究,给出了一个更务实的答案——1+1>2。具体来说,就是医生与AI大模型联合诊断,准确率明显优于任何一方单独作战。这不是空喊口号,背后有扎实的数据支撑。

医生 + AI大模型 = 诊断 “黄金搭档”?普林斯顿大学最新研究揭示人机协同医疗临床决策新范式

摘要

高风险的医疗临床决策,容不得丝毫马虎。大型语言模型(LLMs)虽然强大,但存在“幻觉”、缺乏常识、带有偏见等问题;人类医生呢?同样有经验的局限和知识覆盖面的不足。这项研究提出的思路叫作混合集体智能(Hybrid Collective Intelligence, HCI),通俗点说,就是把医生的临床推理与LLM的信息处理能力深度融合。研究涉及2,133个真实感病例,包括40,762份医生诊断和5个最先进LLM的诊断结果。最终结论非常明确:混合集体在所有专业和经验层级下的诊断准确率,都显著优于人类单独、AI单独以及各自原先的“集体形式”。

背景

数据有些触目惊心:每年美国大约有79.5万例死亡或永久伤残与诊断错误直接相关。LLM虽然在自然语言处理和医学问答上表现亮眼,但内在的结构性问题——比如幻觉、偏见、缺乏常识——让它在临床高风险场景下,只能充当辅助角色,无法独当一面。

那么“集体智能”能做什么?原理很简单:把多个独立判断组合起来,整体准确性就会提升。这项研究玩了一个新花样,把人类专家和多个LLM一起拉到“同台评审”的位置上,利用各自的优势和互补性来构建一个全新的混合体。

为什么说1+1>2?关键在于错误类型的差异性:

  • 当AI漏诊时,医生往往能给出正确答案(尤其是在复杂病例中)
  • 当医生判断失误时,AI可能恰好捕捉到那些被忽略的细节
  • 混合团队的诊断“容错率”显著更高

举个例子感受一下:一个“俄亥俄州建筑工人胸痛”的病例,AI更倾向于联想到当地高发的真菌感染,医生则可能优先考虑职业相关的肺部疾病。两者一结合,最终锁定“组织胞浆菌病”。这就是互补的魅力所在。

研究方法

数据来源

  • Human Diagnosis Project (Human Dx) 平台
  • 2,133 个由执业医生审核过的文本病例
  • 诊断来源横跨不同层级:1,370 名主治医师、139 名专科培训医师、2,160 名住院医师(外加1,037名医学生用于补充分析)

LLM 选择

  1. Anthropic Claude 3 Opus
  2. Google Gemini Pro 1.0
  3. Meta LLaMA 2 70B
  4. Mistral Large
  5. OpenAI GPT-4
    每个模型都被要求输出前五个可能性最高的诊断。

融合流程

  1. 标准化处理
    将所有人类和LLM的原始诊断,映射到SNOMED CT这个国际标准编码库,处理掉同义词、缩写、英式美式拼写等差异,确保数据能够精准对齐。
  2. 加权多数投票
    根据训练集的表现给每个LLM分配权重;所有医生共用一个权重值。使用1/r规则按诊断排名赋分,最后通过加权多数投票合成最终列表。
  3. 交叉验证
    重复10次五折交叉验证,确保模型的泛化性能稳定可靠。

性能指标

  • Top-1 / Top-3 / Top-5 准确率
  • 平均倒数排名(MRR)

主要研究结果

1. 多模型集成优于单模型

把多个LLM组合成“AI集体”,无论是在Top-5还是Top-3准确率上,都碾压任何一个单一LLM。而且这一优势在多个专科领域都保持稳定。

2. 人机混合集体全线胜出

  • 向医生的集体中加入一个LLM,能直接超越纯医生组的表现
  • 反过来,向LLM集体中加入一位医生,也能提升整体准确率
  • 哪怕加入的是表现最差的LLM,也带来了轻微提升

3. 错误互补性是核心

  • 46%–51%的病例中,医生和LLM对正确诊断的排名是不同的
  • 当LLM完全漏掉正确答案时,医生在30%–38%的病例中能把它补回来,而且大部分排在第一位
  • 这种低相关错误模式,让加权投票机制更容易把正确答案推上去

主要创新点

  1. 开放性答案的自动标准化
    基于SNOMED CT的全文匹配和向量搜索匹配,有效处理了同义词、拼写差异和缩写问题,实现精准对齐。
  2. 权重化人机投票机制
    通过WMVE(加权多数投票)方式,按历史表现给每个模型分配权重,表现越好,话语权越大。
  3. 跨模态可迁移性
    这套方法依赖的是结构化的知识体系,理论上可以迁移到气候政策等其他开放性、高风险领域。

未来研究方向

  • 临床实地验证:目前还是在病例小故事测试阶段,下一步需要转化到真实的临床环境
  • 治疗影响评估:诊断准确率提升了,后续的治疗方案是否能因此优化?
  • 偏见与公平性:混合集体是否真的能减少AI和人类共有的偏见?
  • Prompt 工程优化:结合Tree-of-Thought、自一致性等方法,或许能进一步提升表现
  • 多模态融合:把影像、声音等数据也纳入诊断流程,将是更大的突破
  • 决策支持系统化:如何在临床工作流中把这一切整合好,既要防止自动化偏见,也要避免算法厌恶

结论

混合集体智能的最终目标,不是取代医生,而是通过人类临床洞察和AI信息整合能力的互补,让医疗诊断变得更加精准、安全、公平。


主要标签:人机协作诊断、混合集体智能、大型语言模型、医疗诊断准确率提升、错误互补性、混合智能、AI医生、人机协同
来源:https://www.53ai.com/news/LargeLanguageModel/2025081845613.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。