百川智能最新开源医疗大模型Baichuan-M2,凭借32B的轻量化参数规模,在权威医疗评测集HealthBench上斩获60.1分,不仅超越OpenAI新近开源的gpt-oss120b(57.6分),更一举击败Qwen3-235B、DeepSeek R1、Kimi K2等所有主流开源模型,登顶全球开源医疗模型榜首。更值得关注的是,该模型仅需一张RTX 4090显卡即可部署,推理成本相比同类方案降低57倍,同时性能显著提升。通过医疗数据强化学习,模型不仅未削弱通用能力,反而在数学、指令遵循、写作等核心维度上实现同步提升。核心看点:1. HealthBench医疗评测全球开源第一,超越OpenAI、DeepSeek、Kimi等顶尖模型2. 极致轻量化设计,RTX4090单卡即可运行,部署成本直降57倍3. 医疗数据强化学习反哺通用能力,一个模型兼顾医疗与通用场景
今天,我们正式发布开源医疗增强大模型Baichuan-M2。
OpenAI于8月6日开源两款大模型,主打超低部署成本与最强医疗能力;仅5天后,我们便以更小尺寸的模型实现了医疗能力的反超,在所有开源模型中,登顶世界第一。
今年1月,百川智能在行业内率先推出“AI患者模拟器”——利用真实医疗数据构建了上万个不同年龄、性别、症状的AI患者,模拟了数百万次诊疗流程。基于这一范式开源的Baichuan-M1,成为行业首个医疗增强模型。7个月后,团队升级了患者模拟器,并引入模型端到端强化学习,由此训练出的Baichuan-M2在HealthBench等评测上取得了更大突破。
碾压全球开源通用大模型,更低成本爆发更强性能
OpenAI自2024年下半年起,将医疗确立为模型能力提升的首要方向,投入了大量人力、算力与资源。今年5月,OpenAI发布了HealthBench——一个权威且贴近真实临床场景的医疗健康评测集。研究团队招募了262位来自60个国家、覆盖26个医学专科、精通49种语言的医生,共同制定了48562条评价标准,其中86%为实例特定标准(针对单个对话由医生撰写),14%为共识标准。
这一包含5000个逼真多轮医疗对话的评测集,彰显了OpenAI在医疗领域重点突破的决心。开源gpt-oss系列模型时,OpenAI首次将医疗作为第一重要的评测标准;发布GPT-5时,唯一受邀到现场的使用者是一位抗癌患者。医疗是大模型最具前景、最具价值的方向,正成为头部企业的共识。
Baichuan-M2在HealthBench上获得60.1的高分,以32B的较小参数规模,不仅反超OpenAI最新开源模型gpt-oss120b(得分57.6),更力压Qwen3-235B、DeepSeek R1、Kimi K2等当前所有世界级开源大模型。
医疗能力大幅增强后,模型的通用能力是否会下降?头部大模型企业主要采用数学和代码数据进行强化学习,而百川智能是首个将医疗数据用于强化学习的中国团队。实践证明,高质量医疗数据对模型通用能力的增长具有显著价值——M2模型在数学、指令遵循、写作等通用核心性能上不降反升,因此该模型同样适用于医疗以外的其他领域。
医疗复杂问题处理能力比肩GPT-5,超越众多顶尖闭源大模型
在大语言模型的发展中,“知识”与“能力”是两条相辅相成但又相对独立的主线。模型在医学考试(如USMLE)上的表现常被视为衡量医疗水平的重要指标,但随着题库逐渐饱和,这类选择题或短回复的评测难以反映模型的临床实用性。医疗AI并非“刷题机器”——分数再高也不意味着在真实医疗场景中好用。
OpenAI从HealthBench整体数据中精选出1000个特别困难的复杂问题作为Hard子集,用于验证模型多维度、全景化解决疑难复杂医学问题的能力。该评测方法标准更高、尺度更严,能更全面地反映模型面对“千奇百怪”复杂条件时的真实表现。今年5月该评测集发布时,所有世界顶尖模型得分均未超过32分,许多前沿模型甚至得分为0。
尽管真实医疗场景中还存在大量HealthBench Hard评测尚未涵盖的因素,但至少已证明:在多数医疗场景的问答质量上,GPT-5和Baichuan-M2已经超越资深医生,特别是在知识更新速度和全面性方面,完全能够为人类医生提供强大支持。
GPT-5发布时既未开源,也未公布参数,无法私有化部署,难以低成本应用。相比之下,Baichuan-M2快速免费开源,成为医疗行业低成本快速部署世界顶尖医疗模型的唯一选择。
AI患者模拟器立功,百川智能开创强化学习新范式
技术团队在大型验证系统(Large Verifier System)、端到端强化学习、AI患者模拟器、多类型医疗数据用于深度推理等四个方面的创新探索,是Baichuan-M2模型取得飞跃式进步的关键。
过去一年,可验证奖励强化学习(RLVR)方法被头部大模型企业广泛使用,在数学、代码领域显著提升了模型性能。百川智能在这一过程中认识到:提高复杂现实问题的可验证性是进一步提升模型性能的关键。由此,团队构建了大型验证系统——在通用验证器之外,还设计了一套全面的医学验证系统。
如果将未经过医疗强化学习的大模型比作一位医学实习生,那么这个系统则像一个要求极高、异常挑剔的医疗专家。它会从医疗正确性、完备性、安全性,以及对患者的友好性等多个维度,细致地评估模型的输出,指出不足并引导模型改进,使其思维方式更贴近专业医生。
基于这个强大的验证系统,团队采用多阶段强化学习策略(Multi-Stage RL),将复杂的强化学习任务分解为几个易于管理的、分层的训练阶段,逐步引导模型能力演变。
人类医生在听取患者描述病情时,很容易分辨其中的逻辑漏洞,从含混不清的表达中辨别出真实病因。现实中患者几乎无法全面准确表达自己的症状,仅基于静态病例、指南等医疗数据训练,模型无法掌握人类医生的这一能力。为了突破这一瓶颈,百川智能升级迭代了今年初首创的AI患者模拟器。该模拟器使用真实病例构建的AI系统,能够模拟千差万别的患者、症状、表达,特别是包含错误噪声的表达,最大程度还原了真实医疗场景。
左右滑动查看对比
国家儿童医学中心专家指出,M2在医学正确性、证据链推理、可操作性上展现出极强的专业性,在风险预警方面的表现尤为突出——关注到患儿有呼吸衰竭、心包填塞等风险,并给出应急方案。此外,它还将患儿既往血管瘤与当前病变联系起来,为医生打开了更广阔的思路。
