“具身智能的数据需求,远未触及天花板。”
在WAIC主论坛的一次对话中,亮源新创创始人姜旭的判断引发了广泛共鸣。他进一步指出,具身智能本质上是大模型向物理世界的延伸,将沿着“规模化预训练→规模化对齐→规模化部署”的三阶段范式演进。同大模型时代一样,智能供给的红利核心源自 数据,目前行业连最基础的 预训练阶段的数据缺口都尚未填补。
确实,这个直面行业痛点的观点足够犀利。然而,关于数据问题的具体解决方案,论坛上的嘉宾似乎并未给出详尽解答。带着这个疑问,我们走访了WAIC上的具身智能企业,期望从一线从业者那里找到答案。

值得庆幸的是,今年参展的具身数据基础设施公司不在少数,提供的实用信息也相当丰富。尤其是在与简智机器人的交流中,我们理清了当前行业究竟缺乏何种数据,以及如何获取这些高质量的数据。
具身行业真正缺失的,是“开箱即用”的数据
许多人认为具身行业缺数据,但事实果真如此吗?互联网沉淀的人类视频已超过百亿小时,这曾被视为具身模型预训练的重要资源。然而,这些数据只能支撑模型“看懂世界”,却无法支持机器人完成真实物理世界的精准交互。
具身行业真正需要的,其实是 可以直接喂给模型、无需二次加工的数据。
简智机器人将这种数据定义为 “Model-Ready Data”,即 “开箱即用” 的数据。根据各大具身公司的实际反馈,这类数据需同时具备三个核心特征:高精度、多模态、多样性,三者缺一不可。
高精度是基础门槛。 具体而言,就是低误差、低延迟、低漂移。手部追踪的厘米级误差会沿训练链路持续放大,最终导致机器人操作失败;传感器之间几十毫秒的时间差,会让模型学到完全错误的因果关系;采集十几分钟后姿态开始漂移,整条数据的价值便大打折扣。
当前行业普通方案的手部关节追踪误差普遍在2-3厘米,什么概念?成年人手指直径约1-2厘米,这意味着模型看到的手指位置与真实位置相差整整一个手指的距离,会导致抓杯子时手指穿进杯壁,拧瓶盖时手指根本没碰到瓶盖,训练出的策略永远无法准确抓取物体。
多模态决定了能力边界。 真正的人类操作不止包含RGB画面,还包括人体姿态、手部轨迹、相机位姿、深度信息、触觉信息等多个维度。
纯视觉路线仅采集了“人看到了什么”,完全缺失了“人是怎么动的、用了多大劲”的核心信息。没有手部关节数据,手一被物体遮挡就会丢失轨迹;没有触觉数据,模型永远不知道抓鸡蛋该用多大劲;没有全身姿态数据,动作永远僵硬得像提线木偶。
多样性决定了泛化上限。 模型要面向一千个家庭、一千种角色,数据就必须从尽可能多的场景中采集。数据价值绝非单纯堆叠时长,核心在于场景、任务、人物、物体的丰富度,这是决定模型落地后泛化能力的关键。
如果几十万小时数据中90%都是实验室白墙前“拿杯子、拧瓶盖”的重复简单动作,模型训练后只能在演示环境中做固定动作,一到真实场景就会失效。
为什么大多数数据公司做不到这三点?背后的难点各不相同。
高精度的核心,在于接近100%地还原人在现实中的移动与操作过程:眼睛看到了什么、手接触了什么、每个关节转动的角度、手部接触面的先后顺序,这一系列过程必须完整保留。这反过来要求足够强大的算法能力,即通过算法将原始信号转化为精准的结构化数据。
多模态的难点,核心在于硬件本身。硬件是模态的基础,如果硬件获取能力差、精度低,最终效果就无从谈起。许多团队用现成模组拼凑,摄像头、数据手套、IMU各自为战,缺乏硬件级的时间同步,不同传感器数据的时间差普遍在20-50毫秒,模态之间根本无法有效对齐。
多样性的难点,则考验公司的产品能力和运营体系。设备的易用性、价格、质量、适配性,决定了它能否进入更多场景;完整的数据运营管线,决定了能否高效处理来自不同场景的异构数据。产品做得不好,设备进不了更多家庭和商业空间,扩张速度就会很慢;管线效率低,现实数据清洗不过来,多样性就是空谈。
此外,即使克服了以上三点,还要面临一道终极考验:规模化。规模化对于数据公司而言是一种综合性大考,需要大规模的采集体系、数据处理管线以及对模型的深刻理解。
当前,行业只有简智等少数几家企业能真正实现规模化,从他们的成功经验中,或许可以学到一些“干货”。
从算法到硬件,Model-Ready Data 如何实现?
“开箱即用”说起来简单,真正落地需要一整套体系的支撑。从模型理解到算法实现,从硬件设计到场景搭建,每一环都是漏斗,一环做不到位,最终的数据质量就会打折扣。
那么,究竟要怎样才能实现全流程的闭环?在与简智机器人交流的过程中,我们逐渐理清了思路。
▎懂模型,才能做出模型能用的数据
很多人存在误解:数据公司不需要懂模型,只要把数据采回来交给客户就行。但在简智看来,如果不懂模型,就做不到“Model-Ready Data”,只会产出半成品,浪费下游客户大量时间进行二次加工。
懂模型分为两个层面:
第一,要懂当前模型在每个细分模态下的质量要求,知道针对该模态该设计什么样的范式。 比如标注,并非标得越多越好,而是价值驱动的COT链式标注:不仅标注动作本身,更将人类行为背后的目标、常识、价值判断显性化——不仅标注“这是抓取动作”,还要标注任务目标、操作步骤逻辑、物体交互关系、力控原因、失败修正动作、环境约束与常识规则。
简智所做的全人工帧级CoT标注,并非简单标注“这是开门”,而是建立完整的思考链路,让模型不仅学会“怎么做”,还学会“为什么这么做”。
第二,要懂如何用模型加工数据。 如果靠人工、非系统化的方式处理数据,精度和效率都有明显天花板。简智自主研发Data Foundation Model(DFM数据基础模型),核心目的就是用模型实现“输入头手相关信息,直接输出完整人体数据”的端到端能力。

这其中最典型的应用就是遮挡补全。真实世界里,人做动作时手经常会被物体遮挡——手伸到抽屉里、拿东西时手指被挡住、叠衣服时手埋在布料下面……传统采集方案遇到遮挡就只能丢失数据,或者靠硬件增加更多相机,但无论多少相机都不可能完全消除遮挡。
简智的解法是用视频生成模型补全关键帧: 基于前后帧信息,模型可以预测出被遮挡部分的手部姿态,就像人看到手伸到桌子下面再伸出来,自然知道中间手在做什么一样。这样就能保证提供给模型训练的数据是连续的、完整的,手部全程的动作状态都能准确输出。
“这就像一座自动化工厂,既解决效率问题,也解决严格的时空对齐问题。”简智团队解释,人的头和手处于同一个时空坐标系中,因为神经传导的完整性,动作不会有中断,时空坐标系是连续的。如果没有完整的模型方案,靠先采集头部数据、再采集手部数据、最后人工拼接的方式,永远无法实现真正全链路闭环,完整复刻人类感知-动作回路。
第三,要懂模型长期发展需要什么。
真正的人类数据,从来不是只采集“手”和“眼睛”的数据。人做动作是一个完整的整体:腰怎么转、腿怎么站、重心怎么移、身体如何保持平衡,这些才是让人形机器人真正“像人”的核心。
简智的无本体采集方案从设计之初就面向人形机器人的终极需求:不仅采集手部和视觉数据,更完整覆盖腰、腿、全身的运动链,输出完整的SMPL-X人体网格,还原人做每一个动作时的全身协同、重心变化、平衡逻辑,而不是只给模型“一只手”和“一双眼睛”。
这才是人类数据的终极价值:不是为了适配某一款机器人,而是 通过完整还原“人”本身,让模型的运动能力、行为逻辑无限向人对齐。当整个行业的数据都在向“完整的人”靠近时,模型能力、机器人能力才能形成正向循环,共同推动具身智能真正达到接近人的水平。
▎算法:端到端自研,多源融合,高效压缩
算法层面,核心是多套体系的配合。
比如端到端自研算法。不同于基于开源算法的迭代优化,端到端自研可以从底层控制精度和稳定性。结合多源传感器数据的实时融合校正,最终实现手部关节追踪稳定误差小于1厘米——这也是行业首个达到亚厘米级精度的无本体采集方案。
还有多源融合算法。视觉、IMU、触觉三端数据并非简单叠加,而是多特征、多源的融合与矫正。即使手完全被物体遮挡,多源融合算法也能精准还原手指姿态,不会跟丢轨迹,无效帧比例可控制在3%以内。多模态输入不仅增加了信息维度,更可以通过交叉验证反向提升每个单一模态的精度。
还有一个被低估的是压缩算法。比如六目相机的数据量比双目相机多得多,如果没有好的压缩算法,传输和存储都会成为大问题。简智自研的感知压缩算法,并非简单做有损压缩,而是在帧率层面做智能优化,压缩比可达到原始数据的2%,并且压缩是在设备端直接完成的,再加上端侧质检直接过滤掉30%的无效数据,大大降低了传输带宽和存储成本。
▎硬件:仿生的第一性原理——从骨骼、肌肉、皮肤来拆解、记录人的全模态
相比模型,硬件的共识要广泛得多,许多人都表示,在数据采集领域,硬件是一切的基础,像前文提到的“多模态”的核心就是硬件。但具体到硬件的选择上,简智却有不少“非共识”之处。
其中最典型的就是摄像头方案。行业里大多数第一视角采集设备采用双目甚至单目相机,简智却坚持使用六目同步相机,这是为了拍得更清楚吗?
其实并非如此。六目相机不仅向外拍摄环境,同时也向内,视野覆盖人的腿、膝盖、腰部的全部动作。而且六目是两两组合的,全身每个角度都有多摄像头覆盖,组内效应能将精度提得很高。
没错,他们的目标从一开始就是 同时记录人的全身动作以及人与物理环境的交互。 人的行走、腿部动作、身体姿态,这些都是单一胸前视角的摄像头拍不到的,但对理解完整的行为逻辑至关重要,比如叠衣服时突然抬胳膊,单看手部数据像是异常值,但有全身数据就会知道,是旁边有东西过来需要避让。
而在手上,简智通过电子皮肤+仿生关节方式,直接测量抓握的力度、接触面积、摩擦力变化,全部能精准捕捉,补足了全部模态。
硬件上另一个容易被忽视的点是 量产可行性。 行业里许多团队用现成的模组攒设备,做个demo看起来没问题,但一到量产就问题百出:过热、续航短、不同设备一致性差……
简智选择了全链路自研,从摄像头、关节传感器到计算单元、电池管理、热管理全部自行完成。团队中有大量来自消费电子行业的资深工程师,他们 从设计之初就考虑百台、千台甚至万台规模普及后的挑战。
▎场景:用系统化指标衡量多样性
多样性不能仅停留在概念上,必须有可量化的指标。
简智提出了一个自研的综合性指标叫“DPH”, 含义是:同一技能下,每小时的数据由多少人、在多少场景下完成。这个指标能很好地概括多样性,用户采购数据时,只需查看对应技能下的DPH指标,就能保证数据的多样性。比如擦桌子的数据,不会是一个人擦100个小时,也不会是10个人在同一个房间擦同一张桌子100个小时,而是不同的人、在不同场景、擦不同的桌子。
专业场景的数据采集尤其讲究。家庭场景相对还好,最难的是实验室、学校、高精尖制造、化工这类专业场景,商业场景也一样,比如寻找优秀的厨师、理发师,难度都很高。专业人士的核心优势是能熟练完成动作,如果设备影响了他们的操作,破坏了他们的专业性,采集的数据就没有价值。
这又回到了产品力的问题。采集专业人士的数据,戴设备会影响他们工作,不戴设备又采集不到高精度的触觉、力觉数据。这个矛盾只能通过极致的产品力来解决:极致的轻量化,极致的无感化,沿着人体天然的生理结构设计,做到不干扰人的正常动作。
数据基础设施的重要性,才刚刚开始被认识
作为一家数据基础设施建设公司,把数据生产出来只是第一步。要真正让客户“开箱即用”,还需要了解不同客户的真实需求,更要清楚自己的边界在哪里。
当前行业里的数据客户大致分为两类:一类是有明确落地场景的客户,需要在特定场景落地商用机器人,他们的需求与落地场景深度绑定,更看重单一技能的深度,要将某几个动作做到极致;另一类是做通用基座模型的客户,他们要打造GPT级别的具身大脑,不追求单个技能做到100分,而是要掌握上万种技能,每种都做到95分,让技能之间能融会贯通。
对于后者来说,他们需要尽可能全的模态、尽可能高的多样性、尽可能大的数据量,百万小时数据可能只是起步,甚至需要上亿小时的真实场景数据,才会出现能力的涌现。但无论是哪类客户,对数据的核心要求是一致的:精度要足够高,稳定性要好,拿到手就能直接用,无需再花几个月时间清洗处理。
要满足这些需求,光有技术还不够,还要有全链路的 工程化交付能力。
数据从硬件采集到变成Model-Ready Data,是一条非常长的链路,每一环都是漏斗,一环慢则全链慢。这需要成熟的数据飞轮实践经验,从采集端的设备管理,到云端的数据处理、质检、标注,再到与客户服务器打通,实现数据的流式交付。
这样一来,客户无需等待硬盘邮寄,也无需自行下载海量数据,直接在自己的服务器上就能按需调取所需数据集,甚至可以对接训练流水线,实现数据到训练的无缝衔接。
同时,交付标准最好要高于客户需求,不是客户要什么格式就做什么格式,而是用一套统一的、更高的标准来交付,比如画面覆盖范围比客户要求的更大,数据维度比客户需要的更多。这样,无论客户是做机械臂、做人形机器人、还是做不同构型的机器人,都能从这套标准数据中提取自己需要的部分,无需反复调整格式、重新对齐。
更重要的是,作为第三方数据基础设施厂商,要明确自己的 业务边界,知道哪些事不能做。
现在行业里许多数据公司做着做着就开始自己做模型、自己做机器人本体,看似延伸了产业链,实际上变成了客户的直接竞争对手,没人敢把自己的核心数据需求交给竞争对手。
真正要做全行业的基础设施,就要保持中立的第三方立场:不大规模做与客户绑定的真机数据,因为真机数据是与本体厂商深度绑定的,头部厂商都会自己做这部分,第三方做真机数据要么做不深,要么就会与客户抢赛道;也不自己做具身基座模型、不做机器人本体,不参与上下游的市场竞争,只专注把数据这一件事做深。
这种中立性看似放弃了短期的热点,实际上是建立 长期信任的基础。 无论是哪类厂商、无论大公司还是创业团队,都不用担心数据供应商会变成自己的对手,才能放心地将数据需求交过来,共同搭建行业生态。
简智正是因为实现了以上几点,才获得了大厂客户的青睐,得以助力小米、蚂蚁灵波等头部模型公司。
总而言之,从WAIC现场的行业反馈来看,具身智能正在走出“拼参数、拼Demo”的早期阶段,开始进入拼落地、拼工业化能力的新阶段。很长一段时间里,行业的注意力都在模型架构和机器人硬件上,许多人觉得数据是“配套环节”,但随着越来越多模型走到商用试点阶段,大家终于意识到,数据才是整个大厦的地基。没有高质量的、开箱即用的数据,再厉害的模型架构也是无米之炊,再便宜的机器人也只能在实验室里做演示。
具身数据正在走出“卖原材料”的粗放阶段,进入工业化、标准化的“开箱即用”时代。就像互联网时代的云计算、大语言模型时代的token服务一样,具身智能的发展最终也将建立在成熟、稳定、中立的数据基建之上:当所有模型团队、机器人团队都无需再从头搭建自己的数据采集产线,无需再为数据清洗、校准浪费精力,整个行业的研发节奏才会真正加快,具身智能走进真实生活的那一天,才会真正到来。


