2026 年,具身智能行业正在掀起一场围绕数据的「圈地运动」。
百万小时数据采集计划,已成为头部厂商的标准动作。星海图宣布年内完成百万小时采集目标,京东则计划在两年内积累超过 1000 万小时数据。与此同时,数采硬件密集发布,开源数据集持续涌现。所有人都在争夺同一个先机:谁率先掌握更多高价值数据,谁就更有机会训练出更强、更大的模型。
今天采用什么样的传感器、采集什么质量的数据,正在很大程度上决定机器人未来能力的边界。
如果说,数据决定机器人的上限,那么又是什么在决定数据的上限?
答案,必然是「机器人之眼」。
当下行业真正稀缺的,不只是更多数据,而是具备真实尺度、稳定时空关系,并能高效进入训练与推理流程的高质量空间数据。
从感知小白到传感器堆叠狂魔
时间倒回到 1960 年,当第一台工业机器人 Unimate 在通用汽车装配线上举起焊枪时,它没有摄像头,也没有激光雷达,只有关节编码器在黑暗中默默计数。这台感知层面的「小白」,没有眼睛,只有粗壮的「肌肉」与重达两吨的「骨骼」。那是机器人发展史上的「蛮荒时代」。更准确地说,它只是一台机器,还称不上真正意义上的「智能体」。
1970 年代,超声波传感器第一次让机器「听见」距离。
1980 年代,激光测距仪登上舞台,SLAM 的种子由此埋下。
1990 年代,CCD 相机与激光雷达开始进入移动机器人领域,这也让机器第一次走出固定工位,被应用于园区巡检、AGV 搬运等场景,它开始真正「看」见世界。
2000 年代,微软 Kinect 将深度相机价格拉入大众可承受范围,双目结构光也开始用于近距离识别。机器人第一次尝试去「理解」眼前的物体。
2010 年代,多传感器融合 SLAM 逐渐成熟,激光雷达从机械式迈向固态化,深度学习接管视觉感知。机器人开始承担无人配送、人机协作等任务。此时,传感器越装越多,算法越来越复杂,采集的数据也越来越庞大。
2020 年代起,事件相机、神经形态传感器、多模态大模型等新型感知模态如潮水般涌现。机器人开始尝试进入家庭服务、精密装配、零样本泛化操作等更复杂场景。
回看「机器人之眼」六十年的演进历程,几乎每隔十年,机器人就会经历一次感知层面的代际跨越。
从「看不见」到「听见」,从「听」到「看」,从「看见」到「看懂」,再从「看懂」走向「多传感器堆叠」。每一次跨越,都伴随着传感器数量的大幅增长,也伴随着系统复杂度的指数级上升。
宇树 G1 头部配备 1 颗激光雷达,智元 G2 底盘配备 2 颗,银河通用 Galbot S1 则在头部 2 颗、底盘 2 颗——总计 4 颗。欧菲光的头部方案更激进:5 颗 RGB 相机加 1 颗 ToF 再加 IMU,全部集成进一个机体之中。
六十年里,每一次代际跨越都解决了上一个时代的问题,却也为下一个时代埋下了更复杂的新难题。

堆到临界点:融合方案的物理缺陷
在行业内部,「堆传感器」有一个更专业的说法——多传感器融合方案。如今,这条技术路线早已聚集大量厂商,大家都在这条成熟路径上全力提速。然而,在不断加速的过程中,一个越来越明显且尴尬的现实也逐渐浮出水面:传感器装得越多,数据之间的割裂反而越严重。机器人身上挂满各类传感器,但不同来源的数据依旧彼此分离,这意味着模型必须付出巨大成本去完成对齐、标定与融合。
有行业资深从业者曾在公开场合直言:当前主流的 3D 结构光、激光雷达、iToF 及双目立体视觉四条路线并行存在,没有任何一家整机厂商只依赖单一技术,这本身就是融合方案「不得已而为之」的最好注脚。传感器越多,融合链路越复杂,边际成本也就越高。
然而,时间来到 2026 年,这条「堆传感器」的道路,似乎已经走到了一个微妙的临界点。
激光雷达厂商集体寻找「图像化」路径,试图将车载激光雷达的感知能力从点云级推进到图像级;头部激光雷达厂商还推出 6D 全彩激光雷达超感光芯片,瞄准空间智能与物理 AI。所有人都在寻找新的答案,但大多数人仍在原有融合框架内打补丁,而不是重新选择一条新路线。
目前,主流厂商普遍采用「组合拳」,远距离感知交给激光雷达类传感器。以 dToF 为核心,结合 CMOS 与 IMU,主打长距离建图、定位和导航,主流产品最远测距达到 70 米,稳定精度可达厘米级,机器人依赖它完成全局避障。
近距离感知,则交给高精度深度相机。以散斑结构光或 iTOF 与 IMU 一体化集成,聚焦机械臂末端的精细操作,在 8 米范围内实现±5mm 的稳定感知,机器人靠它「看清」细节。
两套系统叠加起来,试图同时覆盖机器人的「远」与「近」、导航与操作、移动与安全作业。从工程角度看,这确实是当前最成熟的方案之一,毕竟能够将多传感器硬件同步精度做到小于 1ms,已经代表业内顶尖水平。
但这种方案,从原理上始终绕不开三个核心问题:
视差。多个传感器物理位置不同,观察角度不同,后端融合时必然存在对齐误差。
时间同步。不同传感器采样频率不同,数据到达算法侧的时间也不同,拼接出的世界模型天然带有「时间差」。对于高速运动目标而言,这种误差就可能转化为失控风险。
材质盲区。高反光金属、透明玻璃、亮面薄膜等材质会让光线穿透或镜面反射,传统算法拿到的点云往往残缺不全,甚至完全空白。
这三个问题,并不是算法再强一点就能彻底解决的。它们本质上是「先成像、后计算」这条技术路线自带的物理缺陷。
当「堆传感器」走到临界点,行业才逐渐意识到:第六次代际跨越,不能再只是「再加一颗传感器」,而必须是「换一种看世界的方式」。
第三条路线:先计算,后成像
2026 年 8 月,杭州。时空张量机器人——这家来自杭州的硬科技公司,将在 2026 世界机器人大会(WRC)上全球首发其核心产品:7D 空间智能视觉传感器「天眼 ·Tensopt」。
它所选择的路线,与主流多传感器融合方案并不在同一条赛道上。
时空张量提出了「基于高时间分辨的空间计算智能成像」,其核心逻辑只有四个字:先计算,后成像。
进一步拆解,这是一套自研的「一路双光」光路架构——一条物理光路、一枚传感器,同时具备空间距离感知与二维语义感知能力。纳秒级脉冲激光负责测距与三维重建,皮秒级时序同步与单光子级门控成像负责高清可视化感知,照明与成像在同一时刻、同一光路中完成。
这意味着什么?
传统相机的工作方式是:光线进入,传感器记录,再交给芯片处理计算。时空张量的 7D 空间智能相机则将这个过程反转过来,它在光子抵达传感器之前,就已经开始了计算。
「一路」代表硬件形态,「双光」代表功能分工。它既能完成测距,也能完成二维彩色成像。它不依赖多传感器硬件拼接,而是从物理层面直接消除了多传感器融合中的视差与时间同步问题。
时空张量用一个词来定义这条路线:「超越融合」。
7D:把全光函数的七个维度,融进一枚传感器
在光学领域,一条完整光线需要用 7 个维度描述,也就是计算机视觉中常说的「全光函数」。时空张量将这 7 个维度融合进一枚传感器:X / Y / Z 三维坐标 + RGB 语义 + 时间戳,再叠加脉冲飞行时间测距。
传统方案往往需要将摄像头 + 激光雷达 + 毫米波雷达组合使用,而时空张量的空间智能相机仅需一台相机、一条光路、一个物理信号,就能实现统一感知。
落到机器人应用场景的具体参数上:
感知量程 0.15m-30m,近距离达到毫米级精度,中远距离达到厘米级精度。一台相机,即可同时覆盖远距导航避障与近场精细操作。换句话说,7D 空间智能相机的感知能力,相当于前文所述行业主流顶尖方案中「移动之眼」与「操作之眼」的总和。
原生输出超过 3000 万点/秒的超稠密点云。前文提到的主流方案,原生点云密度明显低于这一量级。点云越稠密,对物理世界空间几何关系与语义属性的还原就越完整、越真实。
全分辨率 25Hz 实时空间点云生成。当前行业顶尖主流方案的全分辨率空间点云生成速度约为 10Hz,而这一能力对于动态捕捉运动目标的空间状态至关重要。
内置 AI 算力。时空张量 7D 空间智能相机可通过计算成像直接输出深度信息和彩色点云,无需依赖外部算力资源;而主流方案通常还需要外部算力支持才能得到成像结果。
从各项核心指标看,时空张量的 7D 空间智能相机相较行业主流方案具备显著领先优势。
真正打动产业的,是高反光和高透明
参数再出色,也不如实际场景更有说服力。
家庭服务。当机器人进入厨房帮人洗碗时,玻璃杯、透明保鲜膜、不锈钢锅等物体,恰恰都是传统视觉系统的典型盲区。光线要么穿透,要么镜面反射,导致点云残缺,机器人抓不稳杯子,甚至可能碰碎餐具。「天眼」凭借「先计算、后成像」的物理原理,能够直接测量空间光场占用率,不依赖表面反射特性,因此可对透明玻璃、高反光金属、纯白墙面、微光暗环境等传统深度相机和激光雷达反复失效的边缘场景进行无空洞完整重建。玻璃、金属、透明膜,在它面前不再是盲区。
精密装配。在 3C 电子产线上,手机主板插件间隙小于 0.1mm,机械臂末端往往需要微米级定位精度。传统视觉系统在反光焊点、金属引脚面前常常失准,良率难以提升。「天眼」凭借毫米级空间定位精度与每秒超 3000 万点的真图像级稠密点云,为机器人「手眼协同」提供高精度数据底座,让机械臂能够在毫米级操作空间内稳定作业,时空张量团队将其概括为「最后一毫米」。
物流分拣。在电商仓库中,包裹形态复杂多变,堆叠状态也往往杂乱无序。有透明胶带封口的纸箱、亮面包装袋以及各种异形软包。传统视觉需要大量样本训练,而且一旦遇到透明材质就会明显失效。而「天眼」输出的超稠密点云能够更完整地还原空间几何关系。对于一个巴掌大小、结构复杂的异形工件,「天眼」可以用数百个高精度三维点完整刻画其轮廓,而传统方案可能只有几十个采样点。
户外作业。配送机器人在强光、眩光、逆光等复杂环境下运行时,传统摄像头容易过曝,激光雷达也会出现信号衰减。「天眼」的抗干扰能力达到 100KLux,在单一光路内同时完成照明与成像,不受环境光变化明显影响,机器人看到的不再是「过曝白片」,而是清晰稳定的三维世界。
这些场景有一个共同点:它们都是传统多传感器融合方案容易「看不准」或「看不到」的地方,而「天眼」则从物理原理层面绕开了这一难题。
这套方案为产业带来的改变也十分直接:帮助客户减少 2-3 个传感器,标定成本降低 60% 以上,SLAM 精度提升 3 倍。
为什么是现在?
机器人视觉技术路线之争,为什么会在 2025-2026 年这个时间节点出现实质性分野?
第一,VLA 模型的爆发,放大了视觉输入端的瓶颈。 Google 的 RT-2、Physical Intelligence 的 π0、智元的 Gen e Envisioner,这些端到端模型将视觉、语言、动作深度耦合在一起。模型越强,对输入数据质量的要求就越高——稀疏、延迟、带有视差误差的点云,会让再强的模型也只能在一个「失真世界」中进行推理。
第二,多传感器融合路线在工程层面已经逼近极限。主流方案做到小于 1ms 的同步精度,已经属于物理层面的顶尖水准。若要继续提升,只能依赖更昂贵的传感器、更复杂的标定与更精细的工程堆叠,但边际收益正在快速递减。
第三,机器人正在从专用走向通用,对「眼睛」的要求也从「能用」升级为「全场景可用」。工业分拣、精密装配、物流搬运、家庭服务——每一个场景对视觉系统的要求都不相同,但没有任何场景能够容忍明显盲区。
这三股力量叠加在一起,让「先计算,后成像」这条原本偏小众的技术路线,突然站到了行业舞台中央。
此外,时空张量还构建了全新的数据采集方式:非本体、非穿戴,以第三人称视角为主、第一人称视角为辅,并以分布式部署于真实场景为核心,数据由此脱离本体束缚,具备跨硬件复用能力。至此,数据的「质」与「采」形成完整闭环,「天眼」保证源头高保真,「天录」保证高效采集与可复用,二者共同抬升了这场「数据圈地运动」的真实上限。
时空张量的商业化进展也在印证这一路线的可行性。截至目前,其已与两家新能源汽车头部主机厂签订协议,车载版空间智能相机进入上车测试阶段。在具身智能赛道中,这一方案也正在嵌入下一代人形机器人的视觉系统。
写在最后:机器人真的需要「像人一样看」吗?
回到文章开头的那个问题:具身智能这场「数据圈地运动」的上限,究竟在哪里?
当机器人的眼睛能够天然输出具备真实尺度、稳定时空关系,并可高效进入训练与推理流程的 7D 空间数据时,行业所拼命追逐的「百万小时高质量数据」,将不再依赖事后融合与人工清洗,而是在源头就以「物理级正确」的方式被直接生产出来。「天眼」所感知的数据天然具备连贯、完整、统一的时空属性,无需繁琐的标定、对齐与融合算法,为行业提供了通往物理 AI 世界的重要基础设施。
「一路双光」、空间光切片、计算成像,这些技术的本质,是为机器人量身定义一种只有机器才能实现的「看」。同一束光,在同一条光路中,同时完成照明、成像、测距与三维重建。没有视差,没有时差,也没有盲区。
数码相机取代胶片时代时,柯达并不是输在胶卷质量上。智能手机取代功能机时代时,诺基亚也不是输在按键手感上。每一次底层技术逻辑切换,最终的赢家从来不是「把旧方案做得更好的人」,而是「重新定义问题的人」。
又一个属于具身智能的十年已经开启,未来,或许会比我们想象中来得更快。
