外界常调侃腾讯在AI赛道“起大早赶晚集”,但这显然低估了这家科技巨头的战略雄心。事实上,腾讯的布局早已脉络清晰、环环相扣:从底层混元大模型,到中间层的智能体开发平台ADP、具身智能平台Tairos,再到应用层的WorkBuddy、CodeBuddy等产品,一条从底层技术到终端应用的完整落地路径,已清晰展现在行业面前。
其中,具身智能作为腾讯向物理世界延伸的“战略要塞”,由腾讯首席科学家、Robotics X实验室主任、福田实验室主任张正友带队。他们摸索出了一套与行业主流“端到端单模型”截然不同的技术路线,底层逻辑直指具身智能的本质:语言不等于完整认知,真正的智能,必须在“感知、决策、行动”的闭环中形成。
具身智能为何不智能?
张正友用神经科学经典的“裂脑实验”点破了行业通病:当前多数具身方案过度依赖语言模型的逻辑,错把流畅描述任务等同于真正理解了物理世界。事实上,人脑的左脑负责语言与逻辑推理,右脑负责空间感知与图像认知;语言只是智能的对外表达通道,并非认知的全部。
基于这一判断,腾讯构建了三层异构的具身智能架构Apexio,精准对应人脑的认知决策、感知行动、条件反射三个层级:
最上层是认知系统:按需唤醒,调用大模型完成深度推理与任务规划,核心回答“要做什么”。
中间层是感知行动系统:接收视觉等环境信息并快速调整行为,负责“怎么动态调整”。
最底层是反射系统:以更高频率运行,无需经过语言推理,像条件反射一样处理碰撞、失衡等突发状况,具备“即时自保”能力。
在张正友看来,这套分层架构是面向真实场景的长期技术路线,其核心优势在于贴合物理世界的运行规律。相比之下,行业里主流的单一端到端模型,要求感知、决策、执行全链路同频运算:要么为了保障认知精度拉高推理延迟,无法满足实时性要求;要么为了压缩响应速度牺牲深度推理能力,难以处理复杂任务。这导致现有的具身模型普遍存在短板——一类靠文本拆解任务,逻辑清晰却落不了地;一类能生成预测画面,却讲不清规则与边界。
而分层架构让不同能力模块各司其职,既保留了上层的深度思考能力,又满足了底层的实时反应需求,与人脑运行逻辑高度契合,是更具稳定性的长期技术架构。
据虎嗅了解,腾讯发布的RxBrain(腾讯Robotics X联合混元发布并开源的具身世界认知基座模型),实现了两类核心能力的打通:面对复杂任务,它既能用语言拆解执行步骤、明确规则约束,也能同步生成每一步的目标场景图像。这种“先想象目标,再执行动作”的模式,解决了大量文本难以精准描述的场景问题。
举个例子,摆放西餐餐具。用文字定义规则,得写一大段;而一张目标图,就能清晰传递所有要求。执行过程中,机器人还能实时对比当前画面与目标画面,判断执行进度,发现偏差就及时重新规划,显著提升了任务完成效率。
张正友补充说,腾讯自研的HyVLA-0.5模型已实现工业级落地。它依托自研的亚毫米级UMI穿戴式数据采集手套,积累了超过1万小时的人类第一视角操作数据。训练采用双路径模式:一条针对特定机器人本体做精细化微调,保障场景适配精度;另一条通过UMI数据实现跨本体迁移,提升通用适配能力。在部署环节,则通过异步推理与轨迹平滑技术,实现高频闭环控制。
虎嗅沟通发现,这套模型已在日化品工厂产线完成落地实测,作业成功率超过95%,新增品类(SKU)的适配周期不到3天,完全满足工业产线的严苛要求。除了产线落地的成绩,HyVLA-0.5在权威仿真评测中也拿下了综合排名第一,在核心的长时序任务、记忆任务两个维度同样登顶,完成了从实验室指标到真实生产力的跨越。
Tairos:要做具身时代的“大脑”
此前,腾讯始终明确不做机器人硬件,这一度引发外界质疑。对此,张正友用手机行业的格局打了个比方:行业最终会形成两种成熟模式,一种是苹果式的软硬件全闭环,体验最优但生态封闭;另一种是安卓式的底层系统赋能,开放生态、规模化落地。
如今,腾讯选择的正是第二条路。这很大程度上源于,中国机器人本体制造能力已高度成熟,迭代快、稳定性强,腾讯无需重复造轮子。腾讯的核心优势在AI、云与连接能力,因此Tairos的定位,就是做具身智能的“通用大脑”:向上支撑应用开发商,向下赋能机器人本体厂商,让硬件厂商无需从零搭建智能能力,让应用厂商无需适配五花八门的硬件,整体降低行业落地门槛。
据虎嗅了解,落地数据已经验证了这一战略的价值:首次和宇树打磨导览场景时,基础适配花了三个月;而依托标准化接口后,新增场景5天即可落地。给越疆机器狗做系统适配,更是只用了一天就完成部署。
张正友透露,腾讯选择优先绑定越疆、宇树、智元等头部本体厂商,核心逻辑在于:头部厂商的硬件稳定性高、问题少,算法打磨效率更高。“一旦与头部厂商跑通标杆场景,围绕其布局的集成商、生态客户即可快速复制方案,实现做通一个、辐射一片的效果,效率远高于零散对接中小厂商。”
值得强调的是,具身智能的核心瓶颈仍然是数据,这也是当前行业投入成本最高的环节。张正友认为,当前行业普遍依赖的遥操作数据,正处于金字塔顶端,成本高、规模小、泛化性差。腾讯的思路是打通四层数据体系:用底层大规模数据做预训练,提升模型泛化能力;用顶层高精度数据做微调,适配特定场景,最大化数据利用效率。
即便腾讯并非数据采集服务商,但其核心优势在于模型研发与数据生产的联动:模型团队明确数据优化方向,反向指导数据厂商定向采集高价值数据,再通过腾讯云的存储、计算能力,为具身智能企业提供数据存储、处理、训练的一体化解决方案,形成“数据-模型-云”的完整闭环。
算力层面,具身智能的需求正呈爆发式增长。腾讯云异构计算研发总监陈煜东透露,具身智能客户的算力需求年增速达200%-300%,训练规模从百卡级跃升至千卡、万卡级;模型迭代周期缩短至两三天,多模态数据清洗、标注的算力消耗也同步暴涨。
至于国产芯片的适配难题,陈煜东给出了一个高效解法:用AI Agent辅助算子迁移。“过去工程师手动迁移一个算子平均需要5天,如今通过Agent人机协同,一天就能完成精度达标、性能更优的迁移,大幅降低了国产算力的使用门槛。”
当前,具身智能行业同质化严重,本体形态、落地场景都高度扎堆。张正友认为,这是行业早期的正常状态——规模化落地尚未启动,玩家集中探索可行场景并非坏事,充分竞争反而会加速技术迭代。所以在落地节奏上,行业必然遵循“从易到难”的路径:工业场景会率先实现规模化落地,因为环境结构化、物体类别少、任务标准化,数据需求相对可控,更容易达到生产级要求;而家庭、养老等非结构化场景,落地难度就要高得多,核心门槛是安全。
张正友一再强调,进入家庭场景的机器人,安全性必须做到100%,没有任何妥协空间。“要实现安全的人机接触,触觉、力觉感知是必备能力。没有力觉控制的机器人,搀扶老人时可能造成骨折,根本无法进入养老、康复等场景。”
综上,腾讯在AI领域并不执着于技术噱头式的领先。互联网时代,它靠连接人与人、人与服务、人与内容建立壁垒;AI时代,它要靠连接模型与场景、智能与硬件、开发者与产业,成为AI基建的“水电煤”。
