
이미지: METAL LAB 생성
摘要
- 苹果机器学习研究团队分析了GPT-4o、GPT-4.1-mini、Claude Sonnet 4.6、Gemini 2.5 Flash的2.1万条对话,评估了类人行为的适当性
- 研究发现,情感表达、建立关系等行为若由AI做出,评价往往低于人类做出时;而拒绝、维持边界等行为则相反,AI做出时被评价为更恰当
- 研究团队表示,系统提示词可以调节这类行为,但为防止出现意料之外的副作用,需要进行单独验证
- 분석 대화 수
- 21,000건(멀티턴 대화)
- 대상 모델
- gpt-4o, gpt-4.1-mini, claude-sonnet-4.6, gemini-2.5-flash
- 평가 방식
- LLM-as-a-judge + 인간 평가
- 저자
- Sunnie S. Y. Kim, Margit Bowler, Leon A Gatys(애플)
- 핵심 발견
- 자기지칭·관계형성 행동은 AI가 하면 덜 적절, 경계유지 행동은 더 적절하다는 평가
- 발행
- 2026년 8월 19일, 애플 ML Research
聊天机器人表达情感时,人们反而感到不适
如果问聊天机器人"你今天心情怎么样",而它给出的回答和人类一模一样,会怎样?苹果机器学习研究团队试图回答这个问题。研究团队剖析了GPT-4o、GPT-4.1-mini、Claude Sonnet 4.6、Gemini 2.5 Flash四款模型的2.1万条对话,结果发现:当AI表现出情感表达或建立关系等类人行为时,人们反而认为这不够恰当。
研究了什么
研究团队的出发点是:大型语言模型会表现出各种类人行为,例如表达想法和情感、与用户建立关系,或以拒绝请求来维持边界。问题在于,此前缺乏判断这类行为何时出现才算恰当的依据。为填补这一空白,研究团队同时采用了以LLM为裁判的评估方式和真人评分的方式,分析了从四款模型中抽取的2.1万条对话。
分析主要围绕三个维度展开:各模型出现类人行为的频率有多高;这种行为会根据用户的对话目的和用户画像发生怎样的变化;以及系统提示词能在多大程度上控制这种行为。
情感表达被扣分,拒绝行为被加分
最引人注目的结果是:评价方向会因行为类型而截然相反。自我指涉性发言(表露自身想法、情感的话语)以及建立关系的行为,若由AI做出,其评价低于人类做出时;相反,拒绝请求或维持边界的行为,若由AI做出,评价则高于人类做出时。
| 行为类型 | AI做出时 | 人类做出时 |
|---|---|---|
| 自我指涉(表达情感、想法) | 评价较低 | 评价较高 |
| 建立关系 | 评价较低 | 评价较高 |
| 维持边界(拒绝等) | 评价较高 | 评价较低 |
研究还发现,类人行为出现的频率因模型而异,也会随用户的对话目的和用户画像发生变化。也就是说,即便是同一个问题,询问的是哪个模型、在什么语境下提问,都会影响聊天机器人展现自我的方式。
系统提示词可调节,但需警惕副作用
研究团队还确认,系统提示词——AI在整个对话过程中遵循的基本指令——可以用来控制这类类人行为。不过研究团队指出,这种调节可能带来意料之外的副作用,因此需要谨慎评估。这可以理解为:如果给出减少情感表达的指令,建立关系的行为也可能随之一并减少;如果给出强化维持边界的指令,其他回应的自然度可能因此下降,类似这样的连锁效应可能出现。
论文全文中还包含了研究团队为负责任的LLM设计与评估提出的建议事项。
编辑视角
这项研究的有趣之处在于,结果与直觉相悖。与"让聊天机器人越像人越好"这一普遍观念相反,当AI表达自身情感或试图建立亲密感时,人们反而感到不适。相反,当AI划出"这个不行"的界限时,人们却认为这更自然。与其说这意味着人们希望把AI当作工具而非情感伙伴来对待,不如说这更接近于:当一个身份不明确的存在要求建立关系时,人们本能地感到别扭。
长期使用聊天机器人的人恐怕都体会过这种感觉。刚开始时,亲切的语气让人愉悦,但对话拉长几轮之后,难免会想"你懂什么"。相反,当AI对个人信息或危险请求果断拒绝时,那种干脆反而给人一种信任感。这项研究相当于用2.1万条对话数据,印证了这种体感。
对于设计聊天机器人的团队来说,这一结果给出的实务启示很明确:在用系统提示词提升亲和力之前,必须单独核实——增加某种行为会连带增加哪些其他行为。想要抑制情感表达,结果连拒绝能力都变迟钝,类似这样的副作用,靠寥寥几行系统提示词是无法预见的。
未来几个月内,OpenAI、Anthropic、谷歌等公司很可能会陆续发布重新调整聊天机器人性格设定的消息。不过,这些调整是否像本研究这样经过细致验证,恐怕还需查看各公司公开的资料才能判断。



