随机对照试验
Randomized Controlled Trial
将参与者随机分成两组,只对其中一组采用新方法,再比较结果的实验方式。
简单来说
随机对照试验(RCT)就像抛硬币一样,把人随机分成两组,只对其中一组采用新方法,然后确认结果的变化是否真的是由这个方法造成的。
为什么要像抛硬币一样随机分组呢?举例来说,如果原本身体就更健康的人恰好尝试了新方法,而其他人没有,那么即使结果更好,也无法判断这是方法本身的功劳,还是这些人本来就更健康。随机分组能让年龄、健康状况、生活习惯等其他因素在两组之间均匀分布,这样剩下的差异就可以归因于这个方法本身。
评估AI时也适用同样的逻辑。把AI独自解题时的成绩,与真人和AI对话解题时的成绩,在随机分组之间进行比较,揭示的不只是AI本身的能力,而是人们实际使用AI时会发生什么。
在报道中是这样出现的
文章提到,在一项针对英国1298名成年人的随机对照试验中,与AI独自解题相比,当人们通过与AI对话来判断症状时,表现明显下降。容易被误解的一点是,这并不意味着'AI能力不好'。随机对照试验把AI本身的能力,和人们实际使用该AI时的结果分开进行了比较,揭示出来的正是这两者之间的差距。
亲手试一试
下次在健康或科技新闻中看到'随机对照试验'这个说法时,可以这样确认:
- 参与者有多少人,被分成了几组?
- 比较的对象是什么(例如:AI独自完成 vs 真人与AI共同完成)?
- 文章是否说明了结果差异是来自方法本身,还是因为两组本来就存在差异?
