2026 WAIC现场直击:智能体赛道内卷加剧,主观世界模型成为破局新方向
2026年世界人工智能大会(WAIC)现场,如果你真正走进去,扑面而来的只有一种感觉——竞争激烈,卷得令人窒息。
1100多家参展企业、10万平方米的展区,每个展台的屏幕上都在闪烁同一个关键词:智能体(Agent)。然而,“智能体”喊得越响亮,行业的焦虑就越明显:算力内卷已经走到尽头,智能体究竟怎样才能真正落地企业、为核心业务创造价值?
在一众技术喧嚣中,一个全新的架构吸引了我们的目光——主观世界模型(Subjective World Model,简称SWM)。
为了深入了解这一新架构,我们挤进了特赞科技的展位。听完技术团队硬核的拆解后,才意识到一个事实:过去指望通过大模型去猜测消费者心思,这条路从一开始就走错了方向。
因为,大语言模型(LLM)从根本上就不适合用来建模人的决策过程。
SWM的设计起点,其实源于认知心理学的一个已知事实:人的“自我报告偏好”与“真实决策权重”之间存在系统性偏差。这个偏差是可测量的,也是可建模的。
基于这一判断,SWM走了一条四层异构数据协同训练的路径。每一层解决一个特定的“理解人”子任务,采用不同的数据源、不同的建模目标、不同的验证机制,推理时,四层联合打分。
表达层:语言风格,才是第一张名片
数据来源:数十亿条社交平台原生语料。
目标:构建语言风格向量,映射到人口统计学和心理学特征。
技术本质:这是一个有监督的表示学习任务(representation learning)。输入是用户的历史文本序列,监督信号来自用户画像标注(年龄、地域、职业、消费层级等)。训练收敛后,相同人口特征集群的用户,其语言表征在向量空间里会自然聚集。这个embedding,就成为后续层的人物画像(persona)锚点。
表达层本身并非壁垒——社交数据可以规模化采集。它的真正价值在于,为下一层(叙事层)的稀疏深访数据提供了“扩散基底”:通过persona锚点,将深访得来的persona特征,迁移到更大范围的社交用户群。
叙事层:动机的因果图谱,才是最硬的护城河
数据来源:数万小时一对一的深度访谈语料,单次访谈1-2小时,产生5k-20k字的非结构化文本。
目标:建模行为动机的时序因果图(causal graph of purchase motivation)。
技术本质:这是一个序列因果建模任务,而不是分类或生成任务。训练目标不是预测“下一句话是什么”,而是识别访谈叙述中的完整因果链:trigger event → consideration formation → decision point → post-purchase rationalization,并将其结构化为有向因果图。
为什么合成数据在这一层完全失效?
真实受访者的叙述,天然具有跨情境的因果一致性(causal consistency)。同一个个体在描述不同购买场景时,其核心动机结构会以不同形式反复出现,形成可识别的“动机签名”。
而LLM生成的模拟访谈数据,没有这个属性。因为LLM在每个token步骤独立预测,它没有维护跨情境一致的内在状态。合成语料在认知层(Cognition Layer)和行为层(Behavior Layer)的交叉验证中会系统性失败——这相当于一个内置的抗合成机制。
认知层:说出来的,和做出来的,差距有多大?
数据来源:行为判断问卷、施瓦茨价值观量表(Schwartz Value Survey)、大五人格量表(Big Five Inventory)等标准化量表。
目标:个体的价值权重向量和风险偏好系数。
技术本质:这一层的核心,是建模陈述偏好(stated preference)和显示偏好(revealed preference)之间的差距——也就是“消费者说自己在意什么”与“消费者实际决策时在权衡什么”之间的差值函数。训练目标是在叙事层(Story Layer)提供的叙事和量表测量结果之间建立校正映射,最终输出个体的真实价值权重向量。
行为层:用经济学实验,给模型装上“稳定器”
数据来源:经济博弈实验数据(最后通牒博弈、公共物品博弈、信任博弈)加上真实交易记录。
目标:行为经济学参数估计——损失厌恶系数λ、双曲线贴现率δ、社会规范敏感性γ。
技术本质:基于前景理论(prospect theory)的参数化个体建模。这些参数在跨情境行为预测中起关键作用:当模型遇到全新的场景(历史上没有见过的产品类别或购买情境),它需要依靠这些基础参数外推反应,而不是依赖历史模式匹配。这是SWM能在新产品研究中有效工作的底层原因。
四层训练完成后,SWM对每个目标人物画像(persona)维持一组联合状态:表达层的语言风格嵌入 + 叙事层的动机因果图 + 认知层的价值权重向量 + 行为层的经济学参数。
推理时,输入一个新的研究问题(比如“你对这款新包装设计有什么看法”),四层联合打分:表达层决定语言风格和情绪色彩,叙事层调用相似情境下的动机结构,认知层校正自我报告偏差,行为层注入跨情境稳定的行为倾向参数。
输出的AI人物画像(AI Persona),在连续追问下,能维持一致的内在状态——这是和LLM直接生成persona的本质区别:
- LLM的persona是无状态的(stateless),每次回答都是独立生成;
- SWM的persona是有状态的(stateful),它有一个跨提示词(prompt)持续存在的内在状态。
量化结果:行为模拟准确率85%(对比真人深访基准)。30万+ AI Persona(社交数据扩散),1万+高精度AI Persona(深访语料直接训练),交付时间<30分钟。
注:atypica是基于主观世界模型构建的智能体,Gamelab是atypica为了确保AI模拟准确性的核心评估手段(Evals),通过让真人和AI Persona完成相同的经济学行为实验,对比两者的决策数据,以此量化校准AI Persona对真人的模拟准确度,目标是让AI Persona和真人的数据无限接近。
SWM是“理解消费者”的模型,特赞的团队更进一步,研发了GEA(Generative Enterprise Agent)企业级智能体架构——这是“执行面向消费者任务”的架构。两者在特赞的技术栈中,构成理解-执行的完整链路。
GEA的编排层由特赞自研发散推理模型(Creative Reasoning Model)驱动——这是中国首个备案的发散推理领域的大模型,核心设计是:在收敛前,先穷尽发散可能性,而不是直接走波束搜索(beam search)到最优解。这个特性,在创意内容生成、方案设计等需要探索解空间的任务上,具有显著优势。
执行层调用400+模块化Agent Skill,单次任务可以协调30+基础模型。Context System作为企业知识的持久化存储层,将品牌DNA、历史洞察、产品库、素材库等结构化为智能体可检索的上下文,有效解决多轮任务中的上下文漂移问题。
目前,GEA已经在内容营销、洞察研究、产品创新、设计创作等业务场景跑通并实现大规模部署,月均Token部署量超过100亿,覆盖全球50多个国家和地区。
壁垒:十年的真实深访,算力无法缩短的差距
SWM的竞争壁垒,不在于架构设计的复杂度——四层协同建模的框架本身,是可以被复制的。
真正的壁垒,在于叙事层(Story Layer)的数据积累。十年间真实深访语料的堆叠,加上内置的抗合成机制,让这个数据壁垒具备了自我保护能力。
当合成数据路线在认知层/行为层(Cognition/Behavior Layer)交叉验证中系统性失败,后发竞争者就只有一条路:从头开始做真实深访,追赶十年的数据积累。这个差距,不能用算力缩短。
过去两年,企业AI的主要竞争逻辑是“接入”——接哪个大模型、能不能快速上线一个协处理器(Copilot)。这个阶段基本过去了。大模型API已经是商品,工程接入能力不再形成壁垒。
下半场真正拉开差距的,是对业务场景的领域理解深度,以及能否把这种理解沉淀为可持续调用的技术资产。
SWM之所以难以被追赶,本质上是因为它把“理解消费者”这件事,做成了有复利效应的积累。这是一个随业务规模自动加深的飞轮,一旦启动,就很难停下来。
