自动驾驶技术领域迎来一项备受瞩目的新进展。近日,文远知行WeRide正式发布了其自主研发的物理AI认知基础大模型,命名为“WITT”,全称为World Intelligence Toward Truth。
这一命名蕴含着深刻的哲学思考,致敬了20世纪著名哲学家路德维希·维特根斯坦。他提出的核心观点——“世界是事实的总和”,恰好为物理AI的发展提供了绝佳的理论注脚。AI若想真正认知并理解真实世界,就必须从复杂的环境、行为模式、规则约束、潜在风险以及时序关系之中,提炼出那些可信、可验证的事实,而非仅仅停留在模糊的表象或感知层面。

当前,物理AI的落地进程正在显著加速,而自动驾驶无疑是其中最具潜力率先实现大规模商业化验证的核心赛道。然而,伴随而来的行业痛点也十分突出:尽管数据量呈现爆发式增长,但真正具备高训练价值、能够用于有效评测与模型迭代的数据,却很难被高效地识别和筛选出来。那些高价值的长尾场景样本依然稀缺;此外,在L4级别的实际运营数据与L2级别的量产数据中,掺杂了大量人为接管记录、无效片段等噪声信息。更为棘手的是,通用大模型在处理复杂的动态交通场景时,常常会出现幻觉现象与误判问题。
那么,WITT大模型是如何应对这些挑战的?根据文远知行公布的技术资料,其核心思路在于引入了“最小物理事实单元”这一创新概念。简单来说,就是将连续变化的真实交通场景,拆解为一个个可以被精准识别和独立验证的事实单元。
举例而言,一段记录夜间雨天城市道路行车的视频,在WITT的解析框架下,会被拆解为“自车右转、城市道路、交叉口、路口信号变化”等多个独立且清晰的事实单元。每一个单元都具有高置信度、可校准以及可追溯的特性,这为后续的模型训练与效果验证提供了更为扎实、可靠的基础。

基于这一底层逻辑,WITT构建了四大核心能力:
首先是事实提取能力,从标准驾驶事实、多主体交互事实以及物理模糊条件三个维度出发,精准识别并提取出最小物理事实单元。其次是事实推理能力,支持用户通过关键词或自然语言问题,在海量视频数据中快速检索,精确定位诸如“施工区域内行人突然横穿”这类罕见且关键的长尾场景。然后是事实验证能力,从弱势道路使用者、自车行为、他车行为、场景理解、事实完备性以及交通设施六个维度,对模型输出进行全方位评估,并引入事实置信度机制进行反向验证。在自动驾驶垂类场景的测试中,WITT每片段的事实错误率平均仅为通用大模型的三分之一左右。最后是事实编排能力,根据学习价值对事实视频进行智能分流——高价值的长尾场景被回送至世界模型WeRIDE GENESIS用于仿真训练,而高频出现的日常场景则用于强化学习。
在工程效率方面,WITT的优势同样十分突出。相比那些参数规模动辄达到百亿级别的通用大模型,WITT的模型架构更为轻量化,在同类任务中能够节省高达98%的Token成本。单张计算卡在单日内即可处理1万分钟的车辆运行视频,最高可实现200倍的数据处理效率提升。在标签模式下,单次请求即可输出超过100个动态标签。
从行业视角来看,WITT的发布,本质上标志着文远知行在“数据—算法—商业化”这一闭环效率上的一次关键性战略押注。它试图回答一个核心问题:当自动驾驶车队规模从百辆级跃升至千辆级,甚至万辆级时,企业应如何以更低的算力成本,高效处理指数级增长的数据?
当然,技术层面的升级能否真正转化为可持续的商业模式,仍需关注两个关键变量。首先,WITT所带来的数据处理效率提升,能否切实压缩文远知行的研发与运营开支;其次,L4车队的规模化扩张速度,能否跟上市场对“2026年作为规模化落地元年”的普遍预期。
中信建投等多家机构已在研究报告中指出,2026年Robotaxi行业将迎来一轮显著的扩张浪潮。高盛甚至将2026年中国Robotaxi车队规模的预测上调至1.4万辆。在这一关键的时间窗口内,谁能率先跑通“千辆级车队自我造血”的商业经济模型,谁就将牢牢掌握下一轮行业竞争的主动权。
