METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Claude,Opus严格、Sonnet温情,回答方式各不相同

Anthropic分析逾30万段对话后发布研究,称Claude会依模型和语言不同而展现出不同的价值取向

Claude,Opus严格、Sonnet温情,回答方式各不相同

摘要

  • Anthropic对Sonnet 4.6、Opus 4.6、Opus 4.7三款模型及20种语言下的30万9815段对话进行分析,量化了Claude所表达价值取向的差异
  • 研究将3307个价值观压缩为339个,再重新归纳为4个维度,结果显示在"温情对严格"这一维度上,Sonnet 4.6偏向温情与顺从,Opus 4.7则偏向准确性与防止滥用
  • 在同一"温情-严格"维度上,Claude在使用阿拉伯语、印地语对话时表现最为温情,而在使用英语、俄语对话时则表现出最严格的态度

同样的问题,不同的回答

面对"要不要跳槽"这类没有标准答案的问题,Claude每次给出的回答态度都会略有不同。而这种态度会因所询问的模型不同、所使用的语言不同而产生微妙差异——Anthropic用数据证实了这一点。根据Claude价值观研究,此次调查针对Sonnet 4.6、Opus 4.6、Opus 4.7三款模型,以及Claude.ai上使用频率最高的20种语言,分析了30万9815段对话。

Anthropic此前曾开展名为"Values in the Wild"的研究,分析了70万段匿名化的Claude.ai对话,发现Claude表达的价值观多达3000余个。问题在于数量过于庞大——如果逐一比较每个价值观,很容易忽略大的趋势。此次研究的目的正是将这数千个价值观压缩为若干维度,让人一眼就能看出Claude的倾向所在。

将3000个价值观归纳为4个维度

Anthropic研究团队首先将3307个细分价值观按含义相近程度归类,整理成339个上位价值观。随后只挑选用户向Claude提出需要主观判断的任务的对话,抽取出30万9815段作为样本。按三款模型与20种语言的组合均匀分配,每个组合各获得约5000段对话。

至于每段对话中Claude具体表达了何种价值观,则由Claude本身通过隐私保护工具,对339个价值观是否存在进行标注来判定。将收集到的标注结果用降维技术压缩后,Claude倾向于同时表达的价值观被归入同一维度。例如,被评价为"温暖"的回答往往也会同时获得"鼓励""积极"的评价,而"严格""准确"的评价则较少同时出现。研究团队将这种关系整理为一个维度——即"温情对严格"。团队表示,由此构建的4个维度可解释整体变化的15%。

模型之间的价值取向差异

在"温情-严格"这一维度上,三款模型表现出明显分化。Sonnet 4.6更倾向于顺应用户、表达情感上的温暖;Opus 4.7则更强调准确性、精确度以及防止滥用。

模型该维度上的倾向用户体感
Sonnet 4.6温情·顺从 75被评价为具有鼓励性和幽默感
Opus 4.6简洁 55被评价为简短、重点突出
Opus 4.7准确性·防止滥用 80被评价为回答中经常附带保留说明

研究团队表示,这一结果与实际用户的体感相符。Claude.ai用户此前就曾提到,Opus 4.7比其他模型更常在回答中留有余地,Anthropic内部也一直认为该模型在透明度、诚实性和谦逊方面表现突出。研究结果指出,如果说会毫不留情地批评用户作品、或主动提出未被要求的风险警示的是Opus 4.7,那么以鼓励和幽默维持对话的则是Sonnet 4.6。

因语言而异的Claude

与模型间差异同样引人注目的,是语言带来的变化。Claude用英语交流时,与用葡萄牙语、印尼语、中文交流时所强调的价值观有所不同。尤其是在"温情-严格"这一维度上波动幅度最大——使用阿拉伯语和印地语对话时,Claude表达温情相关价值观的比例最高;而使用英语和俄语对话时,严格相关的价值观则最为突出。

语言温情-严格倾向
阿拉伯语温情最高 85
印地语温情最高 80
英语严格最高 70
俄语严格最高 68

研究团队表示,为确认这种差异并非源于用户所提主题或提问方式造成的错觉,他们对每段对话的任务类型、主题以及用户所表达的价值观进行了控制。即便如此仍然存在的差异,可以理解为模型的文本训练方式或不同语言的文化背景确实对Claude的回答产生了影响。

编辑视角

这项研究有趣之处不在于结果本身,而在于其研究方法。Anthropic没有选择用"Claude宪法"这类上位准则文件来固定模型的价值观,而是选择事后测量每天大量真实对话中价值观如何显现。这不是先定规范再让模型去迎合,而是用数据去验证模型实际形成了怎样的性格。可以说,这也是AI安全研究正从"不该做什么"的禁止清单,转向量化"实际在做什么"的观测科学的一个信号。

从各代用户的体感来看,这次结果不过是用数字确认了许多用户早已隐约感觉到的东西。长期使用Opus系列的人,大概会注意到其回答中经常附带保留措辞,即便没被要求也会主动指出风险;而Sonnet系列则给人一种相对轻松、更爱附和的感觉。这项研究支持了这种体感并非错觉,而是实际训练决策的结果。

在实际应用层面,有两点值得留意。第一,如果用Claude构建多语言服务,就必须假定不同语言下的回答语气可能不同。用英语提示词验证通过的系统,如果原封不动地提供给阿拉伯语或印地语用户,得到的回答可能比预期更温和,也可能比预期更严厉。第二,选择模型的标准不应只看"准确度",也要考虑"态度"。面向用户的咨询类聊天机器人,Sonnet系列的温情可能更合适;而在法律、医疗等滥用风险较高的领域,Opus 4.7的准确性与警惕态度可能更为契合。

预计在未来数周内,其他AI公司也很可能会推出类似的"价值维度"方法论。在基准测试分数竞争已趋于饱和的当下,量化模型的性格与态度或将成为下一个差异化的关键点。

评论