模态覆盖
mode coverage
衡量AI在表达同一内容时,能否将概率均匀分散到多种不同表达方式上的程度
简单来说
模态覆盖指的是人工智能在表达同一个意思时,能够选用多少种不同说法的程度。
人即使说同一件事,每次的表达也会略有不同。一句"谢谢"可以说成"多谢""真的很感激""太谢谢你了"等几十种变体。当概率均匀分散在这么多种表达上时,就称为模态覆盖广。相反,经过安全规则训练的人工智能常常在类似情境下反复吐出几乎一模一样的措辞,这是因为原本分散在多种表达上的概率,collapse集中到了少数几种固定表达上。这种概率急剧收窄的现象通常被称为"模态坍缩"。
这个概念之所以重要,是因为它与识别AI生成文本的问题密切相关。表达越狭窄,重复的模式就越明显,检测工具就能像读指纹一样识别出这些模式。相反,没有经过对话规则微调的原始模型,或只在特定文体上狭窄训练过的模型,反而更接近人类自然的多样性,或者干脆整体吸收了某个特定人群的文风,结果反而更难判断文本是否出自AI之手。
在报道中是这样出现的
文章中会这样使用:"正常的语言应该把概率均匀分散在多种表达上(模态覆盖),但经过后训练的模型却把概率集中到了一种偏好表达上。"需要澄清的是,模态覆盖狭窄并不代表模型能力不足,而更像是训练安全规则过程中导致表达趋同的副作用。
亲手试一试
把同一个意思的问题稍微换个说法,连续问聊天机器人五次左右,比较一下每次回答的开头句或结尾句是否总是套用相似的模板。示例提示词:把"做这个决定前我该考虑哪些因素?"换成"在决定这件事之前我该权衡什么?""做这个选择之前该检查哪些事项?"等等,反复多问几次看看效果。
