面部动作分析识别深度伪造准确率超95%
科技日报北京7月20日电 (记者刘霞)由德国马克斯·普朗克信息学研究所等机构科学家组成的国际团队,开发出一种比以往更可靠的深度伪造视频识别方法——不再搜寻视觉破绽,而是细查视频面部表情是否自然。在基准数据集测试中,该方法平均检测准确率超过95%,成功发现了许多现有检测器无法识别的伪造操作。相关论文已提交至2026年IEEE/CVF计算机视觉与模式识别会议。

研究示意图。图片来源:物理学家组织网
在生成式人工智能(AI)的助推下,深度伪造视频泛滥成灾,日益真假难辨。如何可靠地识破它们,已成为一个重要的研究领域。
现有最精准的深度伪造检测器普遍依赖监督学习,即从大量标注好的真实与篡改视频中习得辨别力。然而,这类系统极易局限在已知的伪造技法上,面对从未见过的数据便力不从心,这便是过拟合——在训练数据上表现得过于出色,却难以泛化到陌生的篡改花样。
相比之下,自监督方法仅用真实视频进行训练,被认为对新生的深度伪造技术更具韧性,但迄今检测精度仍然偏低。而新方法首次将高稳定检测与高识别率融为一体,其表现超越一众监督方法。
新系统舍弃了可疑的像素级痕迹,转而聚焦视频中人脸的面部动态。它植根于广泛使用的FLAME模型,该模型用53个参数从数学上刻画面部表情,常用于计算机图形学与面部动画。团队先用超过450小时的公开视频预训练模型,使其学会预测人们说话时面部动作的自然规律。
分析时,系统将视频中可见的面部动作,与FLAME模型给出的面部动作参数进行比对。若两者相差悬殊,就强烈暗示该视频已遭篡改。
实验中,该方法在多个成熟基准数据集上均录得逾95%的平均准确率,刷新了此前的最佳纪录。尤其值得一提的是,团队还利用OpenAI的前沿视频生成模型Sora 2,专门制作了另一套基准数据集。此前的深度伪造检测器面对这批视频,表现几乎与掷硬币无异,而新方法依然正确识别出了近95%的伪造视频。
不过,新系统需要在强劲硬件上完成大规模预训练,暂时还不适合实时应用。
| 分享1 |





