
이미지: Anthropic 화면 갈무리
摘要
- Anthropic对Sonnet 4.6、Opus 4.6、Opus 4.7三个模型及20种语言下的30万9815条对话进行分析,量化了Claude所表现价值观的差异
- 研究将3307个价值观压缩为339个后重新归纳为4个维度,结果显示在"温情对严谨"这一维度上,Sonnet 4.6偏向温情与顺应,Opus 4.7则偏向准确性与防止滥用
- 在同一温情-严谨维度上,Claude在使用阿拉伯语、印地语对话时态度最为温情,而在使用英语、俄语对话时态度最为严谨
- 분석 대화 수
- 309,815건 (모델·언어 조합당 약 5,000건)
- 대상 모델
- Sonnet 4.6, Opus 4.6, Opus 4.7
- 분석 언어
- Claude.ai 상위 20개 언어
- 가치 압축 과정
- 3,307개 세부 가치 → 339개 상위 가치 → 4개 축
- 축이 설명하는 변동성
- 4개 핵심 축이 전체 변동의 15%를 설명
- 온기 최고 언어
- 아랍어, 힌디어
- 엄격성 최고 언어
- 영어, 러시아어
- 전작 연구 규모
- 70만 건 대화 분석, 3,000개 이상 가치 식별 (Values in the Wild)
同样的问题,不同的回答
当被问到"我该不该跳槽"这类没有标准答案的问题时,Claude每次的回答态度都会略有不同。而Anthropic用数据证实了一个事实:这种态度会因所问的是哪个模型、用的是哪种语言而产生微妙差异。根据Claude的价值观研究,此次调查考察了Sonnet 4.6、Opus 4.6、Opus 4.7三个模型,以及Claude.ai中使用最多的20种语言下的30万9815条对话。
Anthropic此前在名为"Values in the Wild"的研究中,曾分析70万条匿名化的Claude.ai对话,从中发现了3000多个Claude所表现的价值观。问题在于数量太多。如果逐一比较每一个价值观,很容易错过整体趋势。此次研究的任务,就是将那数千个价值观压缩为几个维度,让人能够一目了然地看出Claude偏向哪一边。

将三千个价值观归纳为四个维度
Anthropic研究团队首先将3307个细分价值观按语义相近程度归并,整理成339个上位价值观。随后,团队只挑选用户向Claude提出需要主观判断的任务的对话,抽取了30万9815条作为样本。按三个模型与20种语言的组合均匀分配,每个组合约获得5000条对话。
至于每段对话中Claude表现了哪种价值观,研究方式是让Claude自己通过隐私保护工具,对339个价值观是否存在进行标注。将由此收集到的标签用降维技术压缩后,那些Claude倾向于同时表现出来的价值观便被归并到同一个维度上。举例来说,被评价为"温暖"的回答,往往也会同时获得"鼓励"、"积极"的评价,而"严谨"、"准确"这类评价则较少同时出现。研究团队将这种关系整理为一个维度——温情对严谨。研究团队表示,由此构建出的4个维度可解释整体变动性的15%。
因模型而异的价值取向
在温情-严谨这一维度上,三个模型呈现出明显分化。Sonnet 4.6更倾向于顺应用户、表达情感上的温情,而Opus 4.7则更强调准确性、精确度以及防止滥用。
| 模型 | 该维度上的倾向 | 用户体感 |
|---|---|---|
| Sonnet 4.6 | 温情·顺应 75 | 被评价为具有鼓励性和幽默感 |
| Opus 4.6 | 简洁 55 | 被评价为简短且直击要点 |
| Opus 4.7 | 准确性·防止滥用 80 | 被评价为回答中经常附带保留说明 |
研究团队表示,该结果与实际用户的体感相符。Claude.ai用户此前一直反映,Opus 4.7比其他模型更常对回答留有保留,Anthropic内部也一直评价该模型在透明度、诚实性和谦逊方面表现突出。研究结果说明,如果说毫不留情地对用户的作品提出批评、或主动提出未被请求的风险警告的一方是Opus 4.7,那么以鼓励和幽默维系对话的一方则是Sonnet 4.6。
因语言而异的Claude
与模型间差异同样引人注目的是语言导致的变化。Claude用英语交流时与用葡萄牙语、印度尼西亚语、中文交流时,所强调的价值观各不相同。尤其是在温情-严谨维度上波动幅度最大:用阿拉伯语、印地语对话时表现出的温情相关价值观最多,而用英语、俄语对话时严谨相关价值观最为突出。
| 语言 | 温情-严谨倾向 |
|---|---|
| 阿拉伯语 | 温情最高 85 |
| 印地语 | 温情最高 80 |
| 英语 | 严谨最高 70 |
| 俄语 | 严谨最高 68 |
研究团队表示,为确认这种差异并非源于用户所问主题或提问方式所造成的错觉,他们对每段对话的任务类型、主题以及用户所表达的价值观都进行了控制。即便如此仍然存在的差异,可以理解为模型的文字训练方式或各语言所处的文化语境确实会影响Claude的实际回答。
编辑视角
这项研究有趣之处不在于结果本身,而在于研究方式。Anthropic没有选择用名为"Claude宪法"的上位准则文件来固化模型的价值观,而是选择事后测量每天大量涌现的真实对话中价值观是如何显现的。这不是先定规范再让模型去迎合,而是用数据去验证模型实际形成了怎样的性格。可以毫无违和地将其视为一个信号:AI安全研究正从"不该做什么"的禁止清单,转向量化"实际正在做什么"的观测科学。
从各代用户的体感来看,这次结果不过是用数字确认了许多用户早已隐约感受到的东西。长期使用Opus系列的人,大概早就察觉到它的回答常常带有保留措辞,即便未被要求也会主动指出风险;而Sonnet系列则给人一种相对更愿意附和的感觉。这项研究支撑了一个结论:这种体感并非错觉,而是实际训练决策的结果。
从实务角度来看,有两点值得注意。第一,如果要用Claude搭建多语言服务,就必须假定不同语言下回答的语气可能有所不同。若一个已用英文提示词验证完毕的系统原封不动地投放给阿拉伯语或印地语用户,可能会得到比预期更温和、或比预期更强硬的回答。第二,选择模型的标准不应只看"准确度",还要考虑"态度"。如果是面向用户的咨询型聊天机器人,Sonnet系列的温情或许更合适;而在法律、医疗等滥用风险较大的领域,Opus 4.7在准确性与边界把控上的态度可能更为契合。
预计在未来数周内,其他AI公司也很可能会推出类似的"价值维度"方法论。在基准测试分数竞争已趋于饱和的当下,将模型的性格与态度量化,很可能成为下一个差异化的着力点。


