人工智能在面部识别领域的能力已经非常强大,甚至在部分静态图像识别任务中超过了人类。不过,达特茅斯学院与博洛尼亚大学最新联合研究指出了一个重要局限:当AI面对动态面部表情识别时,其处理方式与人脑之间仍存在本质性差异。

图源备注:图片由AI生成,图片授权服务商Midjourney
这项研究聚焦于深度卷积神经网络(DCNNs),它是当前AI视觉识别和人脸识别系统的核心底层架构。虽然这类模型的设计思路源自人脑视觉通路,也采用了层层递进的复杂结构,看上去与大脑机制颇为相似,但真正的问题恰恰出在“动态面部表情处理”上。
目前多数AI模型几乎都是围绕静态图像训练和优化的,例如识别一张照片中的人物身份。但在真实社交场景中,人脑需要处理的并不是静止的脸,而是持续变化的表情信息,比如微笑、皱眉、迟疑或怀疑的眼神。为此,研究团队刻意跳出静态图片测试框架,改用包含不同族裔、年龄与表情变化的面部视频进行实验。结果显示:人脑对面部信息的神经表征在不同参与者之间高度一致,而不同DCNNs模型之间的神经编码模式也相对接近,但AI与人脑两者之间的相关性却非常低。换句话说,AI也许能够“认出”一张脸是谁,但在动态面部识别与表情理解方面,捕捉到的关键信息远远少于人脑。
研究共同第一作者之一Jiahui Guo博士直言:“科学家们一直在尝试把深度神经网络作为理解大脑机制的工具,但我们的研究发现表明,这种工具目前与真正的人脑处理方式仍有很大距离。”
更重要的是,人脑在处理面部信息时承担的任务,远不只是“分辨两张脸是否不同”这么简单。詹姆斯·哈克斯比教授指出了其中的核心差异:“当你看着一张脸时,你会同时获取大量社会信息——对方在想什么、情绪状态如何,以及他想给你留下怎样的印象。”相比之下,当前AI更多只能完成身份匹配,判断两张脸是不是同一个人,却难以准确推断对方的心理状态、友好程度或可信度。这种认知层面的差距,正是动态场景下面部表情识别中AI落后于人类的重要原因。
这项研究的结论也给出了明确方向:如果希望AI更接近人脑处理面部表情的方式,就不能只依赖静态图像识别训练。未来的人工智能算法需要更多建立在真实生活情境和动态视频刺激之上,把动态表情的复杂变化纳入模型设计之中,才能更深入地接近人类认知、情绪判断与社交互动的核心。否则,即使AI在人脸识别技术上再先进,也仍然只是一个更擅长处理“静态面孔”的系统。
