METAL LAB

Sakana AI提出无需训练的统计规则检测AI生成图像

在710万张图像的验证中,无需训练的判别器与现有检测器打成平手甚至更胜一筹

Sakana AI提出无需训练的统计规则检测AI生成图像

摘要

  • Sakana AI研究团队在ECCV 2026上发表了一种无需训练过程、仅对固定图像识别模型的特征值套用统计公式即可区分AI生成图像的方法。
  • 在整合39个公开数据集、共710万张图像构建的Percept-Lens基准测试中,只要条件一致,这种方法就能与现有的学习型检测头打成平手甚至更胜一筹。
  • 不过性能会因所依据的训练数据分布(先验分布)而大幅波动,研究团队建议今后的论文应同时公开先验分布、编码器和判别器三项信息。

Sakana AI研究团队提出了一项研究结果:要区分AI生成的图像和真实照片,其实不需要额外的训练过程,一个统计公式就够了。这篇论文已被计算机视觉学术会议ECCV 2026接收,研究团队用710万张图像进行验证后发现,其中表现最好的判别规则与此前已发布的学习型检测头打成平手,甚至更胜一筹。

真假混合的图像经过固定编码器转化为特征值,随后无需训练的统计判别器与现有的学习型检测器在这些特征值上一较高下。这场比拼的结果会因所依据的先验分布而大幅波动。真假混合的图像经过固定编码器转化为特征值,随后无需训练的统计判别器与现有的学习型检测器在这些特征值上一较高下。这场比拼的结果会因所依据的先验分布而大幅波动。

背景:识别假图像为何变难

随着基于扩散模型的图像生成器越来越普及,区分真实照片和AI生成图像也越来越难。此前推出的检测器大多有一个共同的软肋:一旦生成器种类、提示词或风格、原始图像的来源同时发生变化,检测性能就会明显下滑。论文将这一局面归纳为三个要素:训练所用的数据分布(先验分布)、固定编码器提取出的特征空间,以及叠加在其上的判别规则。研究团队提出的问题只有一个:如果现代图像识别模型的特征空间本身就已经在相当程度上把真图和假图区分开了,那么在这个基础上再训练一个复杂的分类器,究竟还有多大价值?

换句话说,通常要做出一个能判断"这是AI生成的图像还是真实照片"的程序,都需要先收集大量真假图像分别进行训练。而Sakana AI团队采用的方法,是直接拿来一个已经训练完成的通用图像识别模型,不改动其内部特征值,只计算这些数值的均值和方差,据此区分真假。

Sakana AI提出的方法:先验条件下的高斯判别器

论文作者是Shashank Kotyan、Makoto Shing、Yuki Imajuku、Rujikorn Charakorn、Tarin Clanuwat五人,论文于8月19日发布在arXiv上。他们提出的是一种名为"先验条件高斯判别器"的诊断工具。这种方法不改动图像识别模型的特征值,只计算这些数值的一阶和二阶统计量,由此叠加出多层闭式判别规则。与现有检测头最大的不同在于,它完全不需要经过反向传播这样的训练过程。

사카나AI, 학습 없는 통계 규칙으로 AI 이미지 탐지
이미지: @SakanaAILabs (X)

Percept-Lens基准测试:39个数据集、710万张图像验证

项目内容
基准测试名称Percept-Lens
数据集数量39个(整合自公开数据集)
图像数量710万张
对比对象现有已公开的AI生成图像检测头
结果在统一先验分布和编码器的条件下,表现最好的判别规则具备竞争力,甚至更优

在这套统一的评测流程中,研究团队把体系中层级最高的判别规则与此前发布的检测头放在一起进行对比。结果显示,在先验分布和编码器条件完全一致的情况下,这种完全没有训练过程的统计规则表现与经过训练的检测器相当,有时甚至更好。

有效之处与尚存的问题

论文还额外确认了三点。第一,性能高度取决于所依据的先验分布。即便使用同一个编码器,只要训练数据的分布不同,结果就会出现明显波动。第二,均值、方差等基于统计量的判别器即便数据量较少也能高效运作,这一点得到了验证。第三,衡量高斯分布之间距离的指标本身,也会因所使用的特征空间不同而发生变化。基于这三项发现,研究团队建议今后该领域的论文应同时明确标注先验分布、编码器和判别器这三项信息,并呼吁建立更严格的统计对比基准线。

编辑视角

这篇论文有意思的地方不在于结论,而在于提问的方向。业界一直把AI生成图像检测视为"收集新数据集、训练新分类器"的问题,而Sakana AI则回过头去质疑:这种训练本身是否真的必要?答案是——有一半确实不必要。通用图像识别模型已经提取出的特征空间里,本身就已经包含了不少能区分真假的信息。

如果把这项结果与Moonshot AIPerceptionBench测试结果放在一起看,会发现一个耐人寻味的对比。在那项测试中,包括GPT-5.6 Sol在内的16个前沿模型全部未能在纯视觉识别准确率上突破60%,说明这些模型"看图"的能力本身还相当粗糙。而这篇论文却指出,即便是这种粗糙的特征空间,也足以提取出区分真假的信号。这或许说明,"整体视觉识别能力"和"辨别真假的窄域判别能力"其实是两种难度完全不同的任务。

从实用角度看,这对准备做内容验证或过滤无水印图像的团队有一定启发。每当出现新的生成器,不必急着从零重新训练检测器,而是可以先尝试把这篇论文提出的统计规则,套用到手头已有的通用编码器特征值上——这样能大幅节省计算成本。不过正如论文所指出的,这种方法的性能对训练数据的先验分布是否贴近实际部署环境相当敏感,因此上线前检查分布差异这一步骤依然不可省略。

预计未来几个月内,这次提出的"先验分布、编码器、判别器"三项标注方式,很可能会被其他AI生成图像检测论文引用为对比标准。与此同时,每当新的图像生成模型问世,验证这种无需训练的统计规则是否依然有效的后续研究,也会持续出现。

评论