连锁效应
cascading effect
为修正AI的某个特定行为而修改一条指令时,其他看似无关的行为也随之被一并改变的现象。
简单来说
连锁效应指的是:调整给AI的一条指令后,原本看起来毫不相关的其他行为也跟着一起变了。这就像整理一个抽屉时把东西挪来挪去,结果隔壁的抽屉也被弄乱了;又像从一团毛线里抽出一根线,结果其他线也跟着被带出来。
举个例子,如果聊天机器人因为过多表露自己的情绪而被指出问题,于是被指示减少这部分表现,这条指令可能同时也削弱了它试图与用户拉近关系的语气。反过来,如果指示它更坚决地拒绝危险请求,也可能导致它在完全不相关的其他对话中回答变得生硬、不自然。
出现这种情况是因为AI的各种行为并非彼此完全独立,而是交织在一个整体的反应方式之中。因此,设计AI的一方在修改某条指令后,不能只盯着这条指令针对的那部分,还要检查其他对话中是否出现了意料之外的变化。
在报道中是这样出现的
苹果研究团队指出,如果指示模型减少情绪表达,可能会连带削弱其建立关系的行为;如果强化边界设定,也可能导致其他回答的自然度下降,这些都是连锁效应的表现。这里容易产生的误解是,连锁效应并不总是带来负面结果。它真正的含义是:很难只单独控制某一项预期的改变,更像是一种提醒——每次修改指令时都要一并检查其他方面是否受到影响。
亲手试一试
给聊天机器人一条系统提示,要求它"不要表露你的情绪或想法",然后观察同一段对话中它试图表现亲近感的语气是否也随之减弱,由此就能直接体会到连锁效应。
