在生成式人工智能技术迅猛发展的背景下,深度伪造视频的逼真程度已达到以假乱真的水平。如何可靠地识别这些伪造内容,成为学术界与工业界共同面临的严峻挑战。近日,德国马克斯·普朗克信息学研究所等机构的科研团队提出了一种全新的检测思路——不再依赖画面中的像素级痕迹,而是聚焦于视频人物的面部表情是否自然流畅。在多个基准数据集测试中,该方法的平均检测准确率超过95%,成功识别出许多现有检测器无法处理的伪造操作。相关研究论文已提交至2026年IEEE/CVF计算机视觉与模式识别会议(CVPR)。

当前最精准的深度伪造检测器大多依赖监督学习——先通过大量标注好的真实与篡改视频进行训练,使模型学会区分真伪。但问题在于,这类系统极易“死记硬背”已知的伪造手法,一旦遭遇从未见过的篡改形式,便瞬间失效。这便是典型的过拟合现象:在训练数据上表现优异,但泛化能力极差。
相比之下,自监督方法仅使用真实视频进行训练,理论上对新出现的伪造技术更具鲁棒性,但此前检测精度一直偏低。而新方法首次将高稳定性与高识别率融为一体,其表现甚至超越了众多监督学习模型。
新系统放弃了可疑的像素级痕迹,转而专注于视频中的人脸动态特征。它基于广泛使用的FLAME模型——该模型通过53个参数从数学角度精确刻画面部表情,在计算机图形学与面部动画领域应用普遍。研究团队利用超过450小时的公开视频对模型进行预训练,使其学会预测人们在说话时面部动作的自然规律。
在分析过程中,系统会将视频中实际观测到的面部动作与FLAME模型输出的面部动作参数进行比对。若两者偏差较大,则基本可以判定视频经过篡改。
实验结果显示,该方法在多个成熟基准数据集上均取得了超过95%的平均准确率,刷新了此前的最佳纪录。尤其值得关注的是,团队还利用OpenAI前沿视频生成模型Sora 2专门构建了另一套基准数据集。此前,面对这批视频,几乎所有的深度伪造检测器表现都如同掷硬币——完全靠运气,而新方法依然正确识别出近95%的伪造视频。
当然,新系统也存在短板:它需要在高性能硬件上进行大规模预训练,目前尚无法实现实时应用。不过,这条“以表情辨真伪”的创新路径,无疑为深度伪造检测开辟了全新的方向。
