小鹏汽车的技术动向,始终是行业关注的重要风向标。今年上半年,该公司密集发布了一系列物理AI技术报告,涵盖多视角生成式世界模型X-World、世界模型推理加速引擎X-Cache、预测式世界模型X-Foresight以及X-Mind技术框架。而近期,他们又推出了一项新成果——TuringViT,这是一款面向VLM/VLA时代的高效视觉编码器。该方案从架构设计、数据范式到训练流程,几乎对视觉编码器进行了系统性重构。

视觉编码器被称为物理AI的“感知入口”——这一说法毫不夸张。无论是场景理解、状态判断还是动作决策,第一步都离不开高质量的视觉特征提取。然而,随着VLM与VLA技术加速落地至真实场景,高分辨率图像、多视角输入、连续视频帧等需求已成为常态。行业对视觉编码器的要求,正在发生本质性的转变。
当前主流技术路线普遍面临三大瓶颈:算力成本高、数据效率低、场景适配难。许多团队仍沿用“复用开源通用ViT”的传统路径,但在智能驾驶、具身机器人等真实场景中,这套方案已越来越难以满足需求。性能、延迟、定制化——这些关键指标,通用模型很难同时兼顾。正是针对这些痛点,小鹏推出了TuringViT,一套完整的系统性解决方案。

从架构、数据到训练,TuringViT三条线同步推进,构建了“线性注意力主导+高质量数据治理+原生动态分辨率”的技术体系。效果、效率、落地性三者同步提升。其中,数据效率尤为突出:TuringViT仅使用0.85B图文对,约为主流模型训练数据规模的十分之一,却在ImageNet-1K等六项零样本分类基准上,平均准确率达到83.6%,直接超越了那些用10B数据训练出的开源基线。在COCO、Flickr30K的图文检索任务中,同样实现了“十分之一数据,效果更优”的突破。
这套编码器的发布,使小鹏全栈自研的物理AI底层技术能力更加完整。其价值不仅局限于智能辅助驾驶,还将辐射至更多物理AI业务场景。
在智能驾驶领域,TuringViT是第二代VLA系统的核心视觉编码器。其近线性延迟特性,使得高分辨率视觉感知能够在车端算力约束下稳定运行。窄路通行、无导航辅助驾驶、复杂路口处理、长尾交通参与者识别——这些功能,体验上将得到显著提升。端侧大模型的性能潜力也能被进一步释放,让驾驶决策既“看得清”,又“反应快”。
智能座舱与驾泊一体化场景同样受益。TuringViT的VLM原生特性,使视觉特征与语言模型的对齐更加高效,识别精度更高,并能适应不同画幅与比例的视觉输入。未来车辆与用户交互的丰富座舱功能,因此拥有了更多想象空间。
在小鹏IRON人形机器人的技术体系中,TuringViT扮演着“视觉视网膜”的角色。它为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。统一的基座架构,使智能驾驶场景积累的海量视觉经验能够快速迁移至机器人场景,大幅降低了跨场景研发成本。
TuringViT的价值不止于小鹏内部业务的落地。它也为行业提供了一条可复现、低成本训练SOTA级视觉Transformer的技术路径。换言之,先进视觉大模型正从“头部团队专属”走向“行业普惠”。
小鹏集团表示,未来将持续扩大高质量图文视频数据规模,深化时序建模与具身视觉方向的技术探索,推动视觉基座与VLM/VLA系统的更深度融合。让先进AI技术真正渗透到每一次出行、每一个交互场景——用科技突破,定义智能出行与具身智能的新高度。
