最近,在清华大学百川楼的一场“AI医疗新范式”论坛上,百川智能创始人兼CEO王小川提前亮出了底牌:新一代医疗大模型Baichuan-M4,以及搭载其上的AI家庭医生“百小医”。背后站着的合作方,是北京儿童医院、中国医学科学院肿瘤医院、上海交通大学医学院附属瑞金医院三家顶级医院——联合临床研究的成果,不是凭空画饼。
王小川在现场分享了一个核心判断:coding对应创造,video对应快乐,但健康,才是大模型至今没有攻下的堡垒。他直言,通用大模型根本进不了医疗场——不是能力不够,而是方向不对。医疗对模型的刚性要求,总结下来就三条:
第一,低幻觉。医疗容不得编造,一个错误判断就可能危及生命。《BMJ Open》2026年的研究系统评估了主流通用模型的医疗回答,大约50%被评为“有问题”,近20%属于“高度有问题”。这个幻觉率,在严肃医疗场景下完全不可接受。
第二,强循证。临床诊断有严格的循证路径,不是“根据症状猜一个最可能的病”。通用模型缺乏系统性的循证推理能力。《JAMA Network Open》2026年评测了21款主流大模型在29个标准化临床案例中的表现,鉴别诊断阶段的错误率普遍超过80%——不按指南逻辑层层排除,而是过早锁定一个答案。
第三,会提问。任何受过训练的医生都不会在患者说完第一句话时就下结论。牛津大学2026年发表于《Nature Medicine》的研究揭示了一个关键差距:AI读标准化病历时准确率可达94.9%,但真实患者自助使用时骤降至34.5%。问题出在患者描述往往不完整,而通用模型不会像医生一样追问。
三条刚需,通用模型一条都没达标。百川于是选择了另一条路——为医疗场景专门打造M系列大模型。
据百川智能方面透露,新一代Baichuan-M4在HealthBench、HealthBench Hard、HealthBench Professional三大权威医疗榜单中同时占据世界第一,超越了GPT-5.5、Opus 4.7、DeepSeek-V4-Pro等对手。依靠原创的事实性感知强化学习算法,Baichuan-M4将裸模型的事实性幻觉率压到了3.3%。
但话说回来,模型能力再强,不等于患者能直接获益。大脑解决的是能力问题,身体解决的是触达问题。中国医疗的核心矛盾,始终是优质资源供给不足。AI要真正起作用,必须找到对的产品形态。
即将发布的AI家庭医生“百小医”,定位很清晰:“明明白白看医生,安安心心管家人”。值得关注的是,它选择了微信生态作为入口——主动引导用户添加企业微信“百小医@百川家医”,拉入家庭群后自动为每位成员建立独立的健康档案,在对话中捕捉并结构化每个人的身体状态、用药历史和检查数据,甚至能从日常闲聊中识别出高危信号,主动提醒复诊和用药。把AI从工具,变成家里一个会操心的家庭成员。
