首页 游戏 软件 资讯 排行榜 专题
首页
AI
百舸M3+Plus首创证据锚定:医疗AI严区间禁锢,幻象率2.6%

百舸M3+Plus首创证据锚定:医疗AI严区间禁锢,幻象率2.6%

热心网友
61
转载
2026-01-23

衡宇 发自 凹非寺
量子位 | 公众号 QbitAI

免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈

谁还没拿自己日常的小病小痛问过AI?

就是这种日常场景,让AI悄悄成为很多人就医流程里的前置入口。

寻医问诊时,咱普通人可以拿DeepSeek、ChatGPT的回答作参考,医生却不能。但在严肃的医疗领域,不准确的建议甚至比没有建议更危险。

但我们注意到,随着AI智能越发涌现,很多医生,尤其是年轻医生已经开始尝试拥抱AI。

All in医疗AI的百川智能告诉我们,他们的专业版模型已有约10万医生用户,而且年轻人偏多,“用我们模型的用户画像和喝瑞幸的用户画像高度重合”。



不过年龄只是影响因素之一,医疗界对AI大势的判断并不存在根本分歧。

只是在严肃医疗领域,AI想要真正进临床,必须翻过两座大山:信任与成本。

百川智能最新发布的循证增强医疗大模型Baichuan-M3 Plus给出了极具诚意的答案。

凭借百川智能独创的六源循证技术,结合Baichuan-M3基座,Baichuan-M3 Plus幻觉率降低至2.6%,处于目前公开评测中的全球最低水平。

借用这个模型,百川希望在严肃医疗场景下,正面回答“如何让AI真正成为医生可信赖的助手,最终惠及每一位患者”这个问题。

全球最低幻觉率

Baichuan-M3 Plus(以下简称M3 Plus)是一个循证增强医疗大模型,幻觉率全球最低,不到3%。

“循证增强医疗大模型”是百川如今的模型主线。

循证是个医学概念,旨在将最佳研究证据、专业经验以及当事人的意愿三者相结合,以做出更科学、可靠的决策。



就在10天前,百川医疗大模型迭代至M3版本,在OpenAI发布的医疗评测集HealthBench上夺得全球第一,反超GPT-5.2 High。

登顶背后最核心的技术杀手锏是Fact-Aware RL(事实感知强化学习)。

传统的强化学习(RLHF)往往只关注人类的偏好,Fact-Aware RL技术通过在奖励模型(Reward Model)中引入医学事实的硬性约束,让模型在训练阶段就形成了对幻觉的过敏反应。

在训练过程中,百川还特别引入了Citation Reward Model,专门惩罚错误引用。

具体到HealthBench的评测表现上,M3在无工具辅助的原始设定下,将幻觉率压低到了3.5%,水平是当时的行业天花板。

此次最新发布的M3 Plus,正是由M3模型和日臻成熟的六源循证深度融合而来。

这种结构让M3 Plus的幻觉率再创新低,来到2.6%。



这个幻觉率水平,已经低于目前业内公认的标杆产品水平,也低于部分人类医生在复杂医学问题上的平均误判率区间。

“如果模型幻觉低能力强,但成本太高,医生和医院也会难以真正用起来。”调用成本下不来,谈严肃落地就没有意义。

为此,M3 Plus在工程层面进行了多轮极致优化。

M3 Plus 在系统层面进行了全面的工程重构,通过 MoE 架构优化、模型量化以及 Gated Eagle-3 投机解码等关键技术,在严格保证模型能力与可靠性的前提下,实现了 API 调用成本较上一代降低 70%。

根据百川给出的数据,相同配置下,Gated Eagle-3相较原始Eagle-3可带来约15%的推理吞吐量提升,从而直接压低单位请求的推理成本。

好一个一边让严肃性提上去,一边把价格打下来。

既有助于消解医学界对AI时代来临想用又不敢用的情绪,又让大家都用得起。

首创“证据锚定”,模型说的每一句都是据实回答

此前的医疗大模型虽然大多支持标注“文献引用”,但在实际使用中,医生经常遇到两个头疼的痛点。

一种是“张冠李戴”。

模型给出了引用角标,但点开发现引用的文献里压根儿没有那句话。

另一种是“内容冲突”。

也是标明了有引用,但其实是AI瞎凑瞎引的,索引的文献并不能支持AI得出的结论。

据统计,目前医疗行业常见的引用准确率区间是40%到50%,也就是一半左右的引用在语义或事实上站不住脚。

沟通会上,百川智能模型技术负责人鞠强现场提供了一个真实案例素材——

在肿瘤药物不良反应的测试中,某些看起来非常专业的回答,标明引用汇总了权威协会共识、专家指南和说明书,从形式上看几乎无可挑剔。

但逐条核对后发现,约90%的引用内容与结论本身没有直接关系,有的甚至给出的引用里,连药物都不是询问模型的那一个。

一个看起来有据可查的答案,背后隐藏着不可接受的严肃错误。但因为看上去高度专业,有经验的医生不留神都可能踩坑,更别提还有许多初出茅庐的那些医生可能面对这样的答案了。

这成了百川在M3 Plus中试图解决的核心问题。

针对这一痛点,百川在M3 Plus中引入了证据锚定(Evidence Anchoring),将循证从理念变成模型必须遵守的结构性约束。

与传统“标明引用”的方式不同,证据锚定并不是要求模型多列几篇文献,它反过来约束模型:如果一句医学结论找不到能与之精确对应的原始证据段落,这句话就不应该被说出来。

具体实现上,M3 Plus在生成答案时,不仅需要标注文献来源,还必须将每一句关键医学判断,逐条锚定到原始论文、指南或共识中的具体段落。

每一个结论,都需要能在原文中找到明确对应。

说得通俗易懂一点,使用M3 Plus的医生可以直接核查AI说的每一句话是否真的有原文支持,判断其是否真正支持当前结论。

引用内容丰富,包括但不限于药品说明书:



中英文文献:



以及专家共识等:



在训练层面,百川将“证据是否准确锚定”作为独立目标进行建模,通过Citation Reward Model,显式惩罚“张冠李戴”“内容冲突”等情况。

鞠强解释,没有证据锚定,大多数大模型就不能真正理解证据与结论之间的逻辑关系。

所谓的引用文献往往发生在生成之后,是对输出结果的补充,并不是推理过程的一部分。

模型只学会了怎么“像医生一样说有证据的话”,却没有学会如何“像医生一样查证”。

但模型有幻觉这件事目前还没有完美解法。百川团队也反复强调,在医学问题中,不确定性本身就是客观存在的事实。

真正重要的是让错误尽可能提前暴露,让使用者能够尽早识别风险。

百川M3 Plus之前,业内少有把“引用准确性”本身当成模型核心能力来重新定义的尝试。

M3 Plus用证据锚定技术,把“引用”这件事量化成了可审计的技术指标,并且提升了模型自己的引用准确率——从行业普遍约75%的水平提升至95%以上。

面向医疗服务,推出“海纳百川”免费计划

为了让这套“证据锚定”技术真正跑在医院的电脑和医生的手机里,百川一边M3 Plus的API降价70%之外,一边同步开启了 “海纳百川计划”。

该计划中,M3 Plus将以API形式永久免费开放,不限Token数量。

唯一要求是产品需在前台展示“Powered by 百川”,且不得对模型输出进行影响准确性的修改。

计划限定对象为服务医务工作者的机构,包括但不限于医疗信息化厂商、医疗教育机构、医学研究项目、垂直创业公司等。



目前,国内有上千家医院和数百亿投入的专项工程正在探索AI。“海纳百川计划”这种技术普惠战略,有助于避免行业在底层技术上重复造轮子,也让医生端和医疗软件厂商可以在真实场景中进行多轮反复验证、持续迭代。

王小川透露,百川智能不是没有算过“海纳百川计划”背后的这笔账。

如果全国500万医学工作者都来使用,百川一年预计投入成本约1亿元,“这是我们能接受的”。

因为账单背后有更昂贵的成本。在医疗领域,技术试错的代价往往最终由具体的生命来承担。

对在诊室外等号的普通人来说,很难感受到幻觉率从3%降到2.6%究竟意味着什么……但对于每一位身处一线、需要应对海量文献和复杂决策的医生与医学生来说,这0.4%的跨越就是更坚实的专业底气。

这种底气不应只停留在实验室的PPT里,应该去往最需要它的地方。

现在,每一位医生和医学生,都可以走进“百小应”去亲身体验 M3 Plus 带来的改变,看看一条结论如何被证据段落精准支撑。

M3 Plus随着免费开放给行业伙伴之后,这种证据锚定的专业能力,会在更多真实临床场景里被实际使用反复检验。

医疗AI的进步,最终会落到走廊里焦急等待的每一个普通人身上。

来源:https://www.163.com/dy/article/KK019G4J0511DSSR.html
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

AI时代下,会员金选的颠覆性革新与锚点策略
科技数码
AI时代下,会员金选的颠覆性革新与锚点策略

AI时代,可流程化的执行力正逐步被智能工具承接。当AI能写代码、能做报表、能审合同,速度比你快一万倍,成本几乎为零——然后你会发现,真正需要你做的,是那些AI做不了的事:在没路的地方,决定往哪走在没

热心网友
03.26
中科创星李浩:锚定长期主义,布局技术爆发与创投新机遇
科技数码
中科创星李浩:锚定长期主义,布局技术爆发与创投新机遇

2025年,是新一轮科技革命的关键节点。我国的“十五五”规划建议与美国的“创世纪计划”,不约而同地将人工智能、光子、量子、商业航天、脑机接口、可控核聚变和合成生物学等前沿技术列为国家发展的核心目标。

热心网友
02.20
百舸M3+Plus首创证据锚定:医疗AI严区间禁锢,幻象率2.6%
AI
百舸M3+Plus首创证据锚定:医疗AI严区间禁锢,幻象率2.6%

衡宇 发自 凹非寺量子位 | 公众号 QbitAI谁还没拿自己日常的小病小痛问过AI?就是这种日常场景,让AI悄悄成为很多人就医流程里的前置入口。寻医问诊时,咱普通人可以拿DeepSeek、Chat

热心网友
01.23
医疗大模型M3+免费开放,百川智能API将幻觉率降至2.6%
科技数码
医疗大模型M3+免费开放,百川智能API将幻觉率降至2.6%

新京报贝壳财经讯(记者张晓慧)1月22日,百川智能正式发布新一代医疗大模型 Baichuan-M3 Plus。据百川智能消息,M3 Plus将幻觉率降低至2 6%,低于 Open Evidence,

热心网友
01.22
黄仁勋与杨元庆对谈:30年老友锚定混合AI新目标
科技数码
黄仁勋与杨元庆对谈:30年老友锚定混合AI新目标

1月3日晚,在联想年度技术创新大会和CES(全球消费电子展)前夕,相识近30年的科技圈老友英伟达创始人兼CEO黄仁勋与联想集团董事长兼CEO杨元庆展开了一段对话,共同勾勒出两家公司对于未来计算和AI

热心网友
01.03

最新APP

凡人传说
凡人传说
角色扮演 03-30
恶魔秘境
恶魔秘境
角色扮演 03-29
猫和老鼠华为
猫和老鼠华为
休闲益智 03-29
暗黑之地
暗黑之地
角色扮演 03-28
你比我猜
你比我猜
休闲益智 03-26

热门推荐

vivo Pad6 Pro发布:首款4K原彩屏配骁龙8,售4499元起
网络安全
vivo Pad6 Pro发布:首款4K原彩屏配骁龙8,售4499元起

3月30日消息,今晚除了手机之外,vivo还发布了全新的旗舰平板——vivo Pad6 Pro。行业首发13 2英寸4K原彩屏,分辨率3840×2160,347PPI,支持1-144Hz LTPS自

热心网友
03.30
WPS表格提取括号内容:3步掌握MID函数实战用法
电脑教程
WPS表格提取括号内容:3步掌握MID函数实战用法

WPS表格中提取括号内容有四种方法:一、单对英文小括号用FIND+MID;二、中英文括号通用需SUBSTITUTE预处理;三、多对括号取最后一对需REVERSESTRING反向查找

热心网友
03.30
聚焦AI文创与跨境,“数智苏豪”新街口OPC社区启幕
科技数码
聚焦AI文创与跨境,“数智苏豪”新街口OPC社区启幕

3月30日,南京新街口核心商圈,苏豪大厦一楼广场上机器人迎宾起舞,充满科技感。由苏豪资产运营集团与南京新街口金融商务区管理委员会(以下简称“新街口管委会”)共同打造的“数智苏豪”新街口OPC社区揭牌

热心网友
03.30
1.9亿年薪背后:又一位车企CEO薪酬为何大幅上涨?
科技数码
1.9亿年薪背后:又一位车企CEO薪酬为何大幅上涨?

电 动 知 家消 息,近日,据外媒报道,据福特汽车日前发布的一份文件,该公司首席执行 官吉姆·法利2025年的总薪酬大幅增长了11%,达到约2752万美元(约1 9亿元人民币),这是其自2020年末

热心网友
03.30
美议员为何急于拉黑中国机器人却暗留后门?
科技数码
美议员为何急于拉黑中国机器人却暗留后门?

白宫里,一台人形机器人缓步走入东厅,与美国“第一夫人”并肩亮相,动作仍带着明显的机械感;仅仅一天后,国会山上,这种“会走路的机器”却被划为潜在安全威胁,写进立法提案。这是上周美国上演的荒诞一幕。两党

热心网友
03.30