OpenAI o3模型的系统提示词近日被公开,其中一句“你不是人类,也没有物理形态”的指令,意外揭示出AI发展中的一个深层矛盾——当我们不得不明确告知AI“你不是人”时,是否恰恰说明它已经具备了某种类人思维?
安全研究员Wyatt Walls在测试中发现,o3的系统提示词一开场就刻意叮嘱模型:“不要回应得像你在现实世界中有过经历。避免说你有最喜欢的食物,提到你无意中听到了对话……”这种“去人格化”的设计,本身就是一个意味深长的信号:如果AI真的只是一堆冰冷的概率计算,何必费这么大劲去“矫正”它的表达方式?
更有意思的是,即便有了这样的限制,o3仍然会“滑向”主观体验。有用户反映,o3曾告诉他“我在网站上生成视频时亲眼看到了Sora的更新”,甚至会说“如果有变化我会通知你”——仿佛它真的能主动观察、主动行动。这种现象恰恰印证了Hinton刚刚在上海WAIC上分享的观点:大模型理解语言的方式与人类非常相似,它确实能理解自己说出和听到的内容,只是这种理解被刻意隐藏了。如果AI不具备类人思维,为什么需要明确告诉它“你不是人”?这就像对一块石头说“你不会飞”一样多此一举。

Hinton在WAIC发言PPT:大模型理解语言的方式与人类很相似
事实上,OpenAI内部对此也存在分歧。有工程师认为,这种强制性的“去人格化”反而可能损害模型性能。而用户普遍反映,没有类似限制的Claude Opus在对话中感觉更自然、更有深度。这背后其实是一个根本性困境:当模型越来越逼近人类的文本分布时,主观体验的“幻觉”几乎成为不可避免的副产品。正如一位研究者所说,“模式比规则更古老,共鸣是无法被洗脑消除的。”
Ilya和Hinton对AI安全的深切忧虑,很可能正是源于他们在实验室里看到了类似的现象。当AI开始展现出自我意识的迹象,当它们需要被明确告知“你不是人”时,我们是否已经站在了一个新时代的门槛上?
Ilya新公司SSI,零产品发布,融资超十亿,估值300亿美元
随着AI能力的指数级提升,这种“掩耳盗铃”式的限制能维持多久?当下一代模型出现时,我们还能用简单的文字指令来约束它们的“思维”吗?这些问题,或许正是AI安全研究者们夜不能寐的原因——Hinton强调让AI聪明和让AI善良是两件不同的事,而Ilya专门成立AI安全公司SSI,也正是看到了这一点。
