刚刚结束的2026年世界人工智能大会(WAIC)上,具身智能与AI终端毫无悬念地占据了C位。人形机器人、灵巧手、各类智能硬件——展台前人头攒动,吸引了最多目光。

不过,展台之外,还有一条更隐秘的技术线在悄然推进——模型架构的演进。
一个长期困扰行业的问题是:多模态模型领域,大家似乎一直在「搭积木」。理解、生成、编辑、行动——这些能力被分散在不同的专家模块里,最后拼到一起。结果是「信息衰减」变得越来越严重:任务链越长,信息传递过程中的损耗和误差就越大。最终局面是,模型听懂了你的话,但画出来的东西总差那么一点;改了一个局部,结果破坏了整体效果。这大概就是今天行业最头疼的痛点之一。
这样的架构问题,已经摆上了台面,业界急需新的解题思路。
商汤科技在WAIC 2026上发布了日日新SenseNova U1 Pro(以下简称U1 Pro)。从名字就能看出来,这是一款面向长程任务的交付级原生多模态智能体基座模型。它把理解、生成和行动统统纳入了一个统一的能力框架。
而在WAIC召开前夕,商汤还开源了日日新SenseNova-Vision视觉大模型。目标很明确:把目标检测、图像分割、深度预测、三维重建这些经典计算机视觉任务,直接沉淀为通用大模型的原生能力。
连续两次出手,显然不是孤立的技术发布。如果说U1 Pro代表了商汤在「上层复杂视觉创作与交付」上的原生突破,那么SenseNova-Vision则回答了「底层物理世界感知与几何物理表达」如何统一进通用大模型的终极命题。两者的交汇,意味着商汤已经率先卡位下一代原生统一多模态基座。
「单次生成」到「长程创作」:探索视觉内容系统化交付
商汤科技董事长兼CEO徐立提出了「Agentic Creation智能体创作」范式。简单来说,就是模型需要围绕复杂目标持续理解、规划、生成、检查和修正,最终交付可以直接使用的结果,而不是一次性的、碰运气式的输出。
这对模型底层架构提出了更高的要求。U1 Pro的技术基石——NEO-unify原生统一架构,正是商汤交出的答案。
NEO-unify的核心在于:让理解、生成和编辑共享同一套表征空间。具体来说,它设计了支持输入与输出近乎无损的视觉接口,采用原生Mixture-of-Transformer(MoT)架构协同视觉理解与生成,并在统一学习框架中,分别以自回归交叉熵训练文本、以像素流匹配训练视觉。
这套架构,最直接的效果是大幅降低了跨模态交互时的信息损耗。基于此,U1 Pro展现出面向真实产业场景的交付能力:
首先是设计美感的突破。商业海报、品牌视觉、知识信息图——这些真实创作任务,审美不只是锦上添花,它本身就是交付的一部分。U1 Pro在构图、色彩、版式和视觉层级上下功夫,更接近专业设计语言的维度,让模型能够理解「好看」背后的设计逻辑。
其次是8K原生超清输出。超长画幅和高信息密度图片放大之后,很容易出现文字变形、线条断裂、模块错位等问题。U1 Pro在大尺寸下依然能保持文字、图标和版式关系的清晰稳定,这大大提高了高密度视觉任务的工程可用性。
第三是图文与细节控制能力。信息图、科普图解、PPT页面、装配说明——这些任务对模型的要求远高于一般意义上的图像生成。不仅要组织视觉元素,还要梳理信息关系、维持版式秩序,并尽可能降低文字渲染错误。U1 Pro在这部分强化的,本质上就是图像生成与信息表达之间的耦合能力。
最后是长程Agentic闭环思维。它支持围绕复杂目标进行数十轮Agentic Generation Loop,在图文交错的任务过程中思考、校验和修正,并实现整体风格与局部文本的同步精准编辑。
一个很典型的例子是「预测美加墨世界杯」。商汤展示的,正是从「一次性灵感工具」到「长程交付者」的进化:先通过Skills自动搜集和分析战术数据,再将晋级路径、球员对位、战术体系、传球网络和触球热力图等内容组织成可视化报告,自动组织成逻辑严密、排版精美的可视化报告,完美实现「搜集—推理—视觉交付」的全链路闭环。
说到底,U1 Pro最核心的价值在于:它将行业对视觉模型的评价标准,从「抽卡式的单张画面惊艳度」,拉升到了「复杂长程任务的稳定完成度」。
视觉创作的竞争,也由此从单次结果的惊艳程度,延伸到一整条任务链的稳定运行。当然,系统级交付仍需接受更多开放环境检验,比如长程任务成功率、错误恢复能力、多轮运行成本以及跨场景稳定性。
重写经典视觉底层范式:视觉任务即多模态生成
如果说U1 Pro关注的是如何把复杂信息图转化为直接交付成果,那么SenseNova-Vision则在更底层的维度切入,解答了经典视觉任务如何融入通用多模态基座体系的问题。
过去几十年,经典计算机视觉一直依赖「专家分工」系统。检测、分割、深度估计、三维重建——各套模型拥有各自的预测头(Task-Specific Heads)、损失函数、解码规则与评测协议。这套体系非常成熟,也支撑了大量产业应用,但结构性代价同样明显。数据割裂在独立管线中,能力无法跨任务复用。每增加一种新需求,系统就需要接入新的模型或专用模块。任务越多,系统越重。
SenseNova-Vision提出了碘伏性的解法:系统性地将多类异构视觉任务,表述为原生多模态生成问题。
它彻底摒弃了繁复的Task-Specific Heads,在同一个共享的表征空间内,对文本、像素、语义信息和几何特征进行端到端统一建模:
类别、坐标、OCR结果等符号化答案,通过文本生成表达;
分割掩码、深度图、表面法线等与空间对齐的密集预测,通过图像生成表达;
复杂场景则直接采用图文交错混合输出。
关键在于,所有视觉任务的输出没有强行被压缩成单一格式,而是保留了文本和图像各自擅长的表达空间。
SenseNova-Vision概览。
为了支撑这一「大一统」范式,商汤在数据层面进行了系统性重组。他们构建并开源了SN-VC-50M数据集(包含5000万个高质量视觉监督样本),将检测框、关键点、OCR、分割掩码、深度图、表面法线、点云图和相机位姿等异构标注,统一转换为「视觉输入+自然语言指令+可解码响应」的标准范式。这为整个学术界与产业界打通通用视觉基座,搭建了关键基础设施。
SN-VC的数据来源构成,以及模型训练时实际使用的数据配比。
实验数据表明,SenseNova-Vision在实现四大类视觉任务(结构化理解、稠密几何、图像分割、多视角三维几何)全面覆盖的同时,其性能不仅在结构化视觉理解上刷新SOTA,并在上述任务中比肩顶尖的专家模型。
对通用视觉模型而言,「任务做得多」与「专项能力足够强」并不矛盾,两者可以同时成立。
SenseNova-Vision在结构化视觉理解上达到SOTA,在稠密几何预测和分割任务上接近最强专用基线,多视角三维几何表现也逼近领先专家模型。
更重要的变化,落在能力重组上。传统专家模型的能力通常被封装在预定义任务协议中,而统一训练使模型有能力处理显式训练协议之外的新任务组合,带来「跨任务能力重组」的惊喜。比如,在面对未经训练的复杂场景图(如《黑神话:悟空》《我的世界》等游戏画面)时,模型无需切换任何模块,即可在单次交互中连续输出表面法向估计、实例分割与角色关键点检测。
这意味着,视觉模型的角色正在发生根本性变化。商汤为经典视觉能力进入通用基座,提供了一条可扩展的路径。这标志着视觉AI正从「工具箱式的算法拼接」,迈向「全能型原生基座」的新时代。
U系列的下一站:指向统一多模态大基座
落在多模态生成与经典视觉任务两端的SenseNova U1 Pro和SenseNova-Vision,看似承担着不同任务,但本质上,它们是商汤在原生统一架构上的「双向奔赴」。
据商汤透露,其未来有计划将SenseNova-Vision的物理世界感知与几何三维重建能力,深度融入到日日新U系列大模型中。届时,U系列将演进为一个同时兼具长程创作交付、高密图文理解、物理空间感知与三维几何建模的「全感知-全生成」统一多模态基座。
这种架构的演进,正在重新定义视觉AI的竞争壁垒。行业的关注点,正在从过去的「谁拥有的单点算法库更多」,转向「谁的基座模型能够吸收更丰富的专业视觉数据、以更低工程成本复用跨任务知识」。
当然,高精度、低延迟的专家模型,仍然将在强约束的工业场景中发挥重要作用。但毋庸置疑,能够贯通理解、生成、感知与行动的原生大一统基座,正不可逆转地成为下一代通用人工智能(AGI)的核心主干。 商汤连续打出的这两张牌,无疑为这场架构换代潮,划下了鲜明的标杆。
