7月21日,小鹏汽车宣布正式发布TuringViT高效视觉编码器。这项技术的核心在于,从底层重新定义视觉语言模型与视觉语言动作模型时代下视觉编码器的设计思路、数据组织方式及训练范式。简而言之,TuringViT旨在深度赋能智能驾驶、智能座舱以及IRON人形机器人三大核心业务,同时为行业提供一条可复现、低门槛、达到SOTA水准的视觉Transformer训练路径,推动视觉大模型在真实场景中的规模化落地。
那么,TuringViT的核心优势体现在哪里?主要依靠三项关键创新。第一,原创的Turing线性注意力机制,将计算复杂度从指数级降低至近似线性水平。在1536²超高分辨率输入下,推理效率显著超越当前主流基准模型。第二,VISTA-Curation数据治理方法,仅使用10%的训练数据即可实现更优的零样本泛化能力,数据效率惊人。第三,原生动态分辨率训练策略,从预训练初始阶段就匹配下游任务的实际分辨率需求,彻底摆脱传统“预训练-微调”路线中后置适配的繁琐流程。
作为小鹏物理AI全栈技术闭环中的核心视觉基座,TuringViT不仅增强了车载端对高分辨率视觉信息的理解与处理能力,更在深层次上为具身智能系统构建了一个通用、鲁棒、可扩展的视觉感知基础。这将加速先进视觉大模型在真实产业场景中的规模化落地与普惠应用,推动智能驾驶与人形机器人等领域的快速发展。

