7月21日,小鹏集团正式发布TuringViT高效视觉编码器。这并非一次常规升级——它意味着小鹏在视觉大模型训练范式上正试图重塑行业规则,从架构设计、数据范式到训练流程,进行系统性革新。

首先,几个关键判断值得关注。TuringViT的定位清晰明确:全面赋能智能驾驶、智能座舱、IRON人形机器人三大核心业务场景。更值得注意的是,它为行业提供了一条可复现、低成本训练SOTA级视觉Transformer的可行技术路径——这实际上是在推动先进视觉大模型从“头部团队专属”走向“行业普惠”,让更多研发团队能够站在同一起跑线上竞争。
从技术路线分析,TuringViT的突破集中在三个维度:架构设计、数据处理和训练方法。通俗来说,就是“线性注意力机制主导+高质量数据治理+原生动态分辨率”这一组合策略,力求在效果、效率与落地可行性之间取得最佳平衡。
本次发布的TuringViT共推出两个规格版本,满足不同场景需求:
TuringViT-18L包含3组Turing Block(总计15层TLA+3层MHA),专注于动态分辨率条件下的高效部署;TuringViT-24L则包含4组Turing Block(总计20层TLA+4层MHA),在保持线性计算主导优势的同时,进一步强化特征表征能力。
实测数据充分证明了其优势。随着输入分辨率不断提高,TuringViT的延迟增长曲线远低于标准softmax ViT,在高分辨率下的效率优势尤为突出。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,较SigLIP2-ViT-L提升2.16倍。这意味着,在高分辨率感知、多摄像头输入、长时序视频处理等复杂场景中,端侧部署的核心瓶颈已基本被消除。
然而,硬件效率仅仅是冰山一角。真正让TuringViT脱颖而出的,是其在数据策略上的深度思考。
行业普遍的做法是“堆数据规模”——数据量越大越好、越多越好。但TuringViT选择了另一条道路。其打造的VISTA-Curation多模态数据治理流水线,核心思路在于提升每个样本的监督价值,从“追求更多数据”转向“使用更优质的监督信号”。
这个流水线如何实现?简单来说,分为三个步骤:
第一步,过滤掉低分辨率、模糊、纹理稀少等低质量图片;第二步,利用多模型、多提示词生成多样化的候选字幕,并交叉验证其视觉一致性;第三步,在统一对比池中,基于相对图文对齐度、文本信息量、歧义度进行综合评分,筛选出视觉贴合度高、语义信息密度大的优质标注,剔除模糊、泛化、弱对齐的样本。
视频数据同样经过了全流程精细化治理。首先将长视频切分为连续短片段,并均匀采样代表性帧,随后通过语义一致性与运动一致性双重过滤,保留语义连贯、变化信息有效的片段。最后,融合局部帧级细节字幕与全局时序语义字幕,生成具备变换感知能力的视频标注,使模型能够从连续画面中学习更鲁棒的视觉表征。
结果充分印证了其有效性。TuringViT仅使用0.85B图文对——约为SigLIP2-L训练数据规模的10%——便在ImageNet-1K等六项零样本分类基准上取得了83.6%的平均准确率,超越了使用10B数据训练的主流开源基线。在COCO、Flickr30K图文检索任务上同样表现卓越。这无疑是“十分之一数据,更优效果”的突破性成果。
另一个关键设计是:TuringViT采用了四阶段渐进式原生动态分辨率训练范式。从预训练阶段开始就适配下游VLM/VLA的输入特性,彻底摒弃了“固定分辨率预训练+事后适配”的传统模式。这意味着在实际部署时,无需再投入大量精力进行分辨率适配调整。
那么,TuringViT具体应用于哪些场景?主要聚焦三大领域:
在智能驾驶领域,TuringViT作为第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供高质量的视觉token。
面向智能座舱与驾泊一体化场景,TuringViT的VLM原生特性使得视觉特征与语言模型能够实现更高效的对齐,提供更高的识别精度,并支持不同画幅与比例的视觉输入,为未来车辆与用户之间丰富的座舱交互功能奠定坚实基础。
在小鹏IRON人形机器人的技术体系中,TuringViT扮演着“视觉视网膜”的核心角色,为具身智能提供物体细粒度识别、空间关系理解、可操作区域检测、动态环境追踪等基础感知能力。
