最近,《自然》杂志发表了一项备受瞩目的研究——GPT-4在心智理论(ToM)方面的表现,竟然已经与人类不相上下,甚至在个别维度上还略占优势。这项由James W. A. Strachan团队主导的实验,将GPT-4、GPT-3.5、Llama2以及真人被试者放在一起,通过一系列经典测试进行了正面较量。

先说核心结论:心智理论,通俗来讲就是“揣摩他人内心想法的能力”,这是人类社交互动的底层技能。测试结果表明,GPT-4在这方面整体上与人类没有显著差异,甚至在识别讽刺、暗示这类高难度任务上,表现比人类更加稳定。具体来说,研究者设计了五个测试项目——错误信念、反讽、失言、暗示和奇怪故事。GPT-4在反讽、暗示和奇怪故事这三项上明显优于人类,在错误信念上持平,唯独在“失言”测试中得分偏低。
不过,这种“偏低”并非因为模型真的理解不到位,而是因为其采取了极为保守的策略——不轻易给出确定性的判断。在失言可能性测试中,GPT-4实际上展现了完美的性能:它能准确推断说话者的心理状态,判断出“无意冒犯”的可能性远大于“故意侮辱”。这说明它的理解能力完全在线,只是在输出时更倾向于谨慎表述。
研究还揭示了一个耐人寻味的现象:GPT模型内部可能已经具备了类似心智推理的技术复杂度,但在处理不确定情境时的“表态”方式与人类截然不同。人类天性倾向于消除不确定性,会主动做出推论来减少模糊;而GPT并不会自发地进行这种“补全”工作。换句话说,它知道答案,但不会主动说出来,除非你明确向它提问。
至于GPT-4在失言测试中的保守倾向,很可能源于模型底层架构中嵌入的安全措施——这些措施旨在提高事实准确性,同时避免用户对模型过度依赖。从这个角度看,这种“保守”未尝不是一种设计上的权衡。
整体而言,这项研究提示我们,GPT-4对人类心理状态的理解能力很可能被低估了。研究者也在论文结尾呼吁建立一门“机器心理学”,利用实验心理学的经典工具和范式,系统性地审视大型语言模型的能力边界与局限性。这或许才是更值得关注的长期方向。
