盲测
Blind Testing
在不知道结果由哪家公司、哪个程序生成的情况下,只凭输出本身评判优劣的验证方式
简单来说
盲测就是在隐藏制作方身份的情况下,只根据输出结果打分的方法。就像品酒会上遮住酒标、只凭味道排名一样。人一旦知道品牌名称,往往会不自觉地给知名品牌打高分;而遮住标签后,就能纯粹依据成果的品质来比较。
在众多AI视频或图像生成服务中挑选更好的一个时,道理也是一样。如果评审者不知道这段视频出自哪家公司的哪个程序,只按画质、自然程度打分,就能不受品牌名气影响,真实比较各家的实力。
把同一个问题(提示词)分别输入多个服务,再把生成的结果混在一起、隐去名称后打分,这样得出的结论会更可信。
在报道中是这样出现的
文章建议,在选择视频生成API之前,"评审者应在不知道提供方和模型名称的情况下(盲测)对输出结果打分",并将画质与延迟、错误率、成本一并记录下来。这里容易产生的误解是认为盲测只用于评估画质,但实际上,关键在于必须把它与速度、成本、失败率等运营指标一起测量,才能得出真正可用于实务的比较结果。
亲手试一试
- 提前准备20到50个贴近实际使用场景的提示词。
- 针对每个要比较的服务,用相同的提示词、相同的分辨率和时长条件生成结果。
- 从输出文件名中删去服务名称,只标上编号后打乱顺序。
- 在不知道哪个结果来自哪个服务的情况下,只凭质量进行排名。
- 评分结束后再揭开名称标签核对,并结合速度、成本、失败率的记录做出最终判断。
