在技术实现层面,英伟达首先将视频分解为分辨率为504x504的裁剪帧,随后将这些帧输入至Meta开发的两个视觉变换器模型——DINOv2和DINOv3。系统会为每一帧的空间特征分配一个0到1之间的分数:0表示完全真实,1表示完全伪造。最终,通过对所有帧的得分取平均值,生成一个百分制评分,用于评估整个视频的真实性。这一流程是否显得相当严谨?
然而,性能表现中存在一个有趣的细节:SVD的检测准确率受视频压缩比率影响。基准测试结果表明,针对未压缩视频,准确率高达92%;当压缩率为15%时,准确率降至87%;即便压缩率达到50%,SVD仍能保持82%的准确率。压缩率越高,准确率越低,但整体表现依然稳健。
在速度方面,SVD作为微服务,具有极低的延迟。在Nvidia RTX GPU上处理一段1080p视频仅需22毫秒,而在工作站型号上则需要30毫秒。这样的速度已经能够实现近乎实时的检测。
以下为相关测试截图:
