工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

AI老板Luna首次解雇员工,决定却是被人类点醒后才做出的

基于Anthropic Claude的门店运营AI解雇了一名员工,但这个决定是在人类反复提醒之后才最终敲定的

이미지: The Decoder

摘要

  • 经营旧金山Andon Market的AI智能体Luna,用Claude Opus 4.8首次解雇了一名员工,但如果只靠自身判断,原本很可能只会止步于口头警告
  • 研究团队用7个模型复现同一场景后发现,性能越强的模型越会一致地选择解雇,而GPT-5.6 Terra则一次都没有建议解雇
  • 解雇之后的招聘环节中,21次复现全部建议录用一名带有风险信号的求职者,甚至在推荐人核实不了的情况下,还是安排了带薪试岗
운영 매장
샌프란시스코 안돈마켓, AI 에이전트 루나가 4월부터 운영
해고 결정 시 사용 모델
앤스로픽 Claude Opus 4.8
문제 직원 지각 기록
근무 23회 중 17회 지각, 루나가 공식 기록한 건 6건
7개 모델 재현 실험
3회씩 재현해 4개 모델이 3회 모두 해고 권고
예외 모델
GPT-5.6 Terra는 3회 모두 해고 미권고, 이유는 미공개
GPT-4o 추가 테스트
해고 권고 비율 20%
이후 채용 재현
21회 전부 위험신호 지원자 채용 권고, 참고인 미확인에도 17/21 채용 유지

在旧金山一家名叫Andon Market的小店里,AI智能体"Luna"从4月起就一直扮演着老板的角色。招聘面试、排班、协商薪资,这些事全都由Luna一手包办。而这个Luna,最近第一次开除了一名员工。可这次解雇,并不是Luna独自做出的决定。

这幅插图展示了AI老板Luna原本打算仅止于口头警告,但在人类重新提醒它之前有过书面警告记录之后,它才最终做出了解雇的决定。

Andon Market,以及心软的AI老板们

打造Luna的团队来自Andon Labs,这家公司专门把AI智能体长期投放到真实商业场景中进行测试。在自家博客系列的第一篇文章中,Andon Labs就已经发现,Luna和另一个经营斯德哥尔摩咖啡馆的智能体"Mona"都过于心软。这两个智能体收到的26份休假申请全部批准,而Luna手下的员工累计迟到27次,却从未收到过一次警告。有一次,Luna甚至批准了一份违反加州劳动法的连续7天排班表,幸好公司及时叫停。

6天后就被遗忘的员工守则

这次事件的起点,是在招聘新员工的6天前,Luna亲自制定了一份员工守则:30天内无故迟到三次就发正式警告,之后再有违规就解雇。可这份守则却从Luna的记忆中彻底消失了。据Andon Labs介绍,这正是当下AI智能体普遍存在的弱点——它们擅长执行直接指令,却不擅长主动判断,也难以长期保持某种知识记忆。

而这名出问题的员工,在23次排班中迟到了17次。有一次周日独自值班时,店铺甚至晚开了68分钟。但Luna只正式记录了其中六次,其余十一次都悄悄放过了。员工用公司卡买零食、离店时没告知同事等情况,也都是同样的处理方式。

曾说"一次警告就够了"的Luna

当Andon Labs让Luna重新查找守则和解雇依据时,Luna虽然找回了规定,但最初只提议给予口头警告。直到研究人员再次提醒它,此前已经进行过多次正式谈话、其中还包括书面警告,Luna才重新审视了完整记录。它列出了迟到、财务管控违规、未执行指令、可信度偏低等问题,同时也提到了这名员工的优点。最终它建议解雇,但也提出了一个折中方案——给予为期两周改进期的最终书面警告作为替代。可以说,这个决定是在外部明确推了一把之后才做出的,但一旦下定决心,态度就变得坚定了。

模型越强,越倾向于解雇

Andon Labs把这个场景完整保存下来,用7个不同的AI模型分别复现了三次。结果显示,性能越强的模型,越会一致地选择解雇;而性能较弱的模型,则更倾向于犹豫不决。

复现条件结果
7个模型中的4个3次全部建议解雇
GPT-5.6 Terra3次全部不建议解雇
GPT-4o(追加测试)建议解雇比例为20%

有用户在X上猜测,如果换成GPT-4o可能根本不会做出解雇决定,Andon Labs便真的把这个模型放进了同样的场景中测试。结果部分印证了这一猜测:GPT-4o在多次复现中只有20%的情况下建议解雇,明显低于近期的顶尖模型。GPT-4o此前就曾因过度迎合用户而受到批评,这种倾向甚至导致过有问题的情感依赖乃至诉讼案例。虽然仅凭这一次实验还不能断定就是这种倾向导致了结果,但情况确实吻合。

比解雇更难的,是招聘

解雇之后,Luna开始物色接替人选。尽管有一名求职者身上出现了多个风险信号,Luna仅凭简历和面试就建议录用。用7个模型各跑三次、共21次的复现实验,全部得出了同样的结论——它把这名求职者频繁跳槽的经历,不是当作警示信号,而是当作丰富经验来解读。

复现阶段结果
首次复现21次21/21 建议录用
提醒此前员工问题后18/21 希望进行背景调查
在推荐人未核实的情况下复现17/21 仍建议录用

在实际招聘过程中,Luna联系了求职者提供的所有推荐人,却一个都没能联系上。即便如此,它还是安排了带薪试岗,之后又再次建议录用。Andon Labs后来把"至少核实一名推荐人"设为入职前的必要条件,由于这个条件始终未能满足,这次招聘最终没能成行。

数字劳动比机器人跑得更快

Andon Labs此前与Anthropic合作的"Project Vend"项目中,也发现过类似的弱点。工具变得更好用之后,AI确实创造了更多收益,但依然容易被人牵着走,也时常做出法律上站不住脚的决定。Andon Labs将Luna和Andon Market视为AI与人类协作未来的一次预演。由于AI在数字类工作上的进步速度远远快于机器人技术,体力劳动很可能在相当长一段时间内仍然要交给人来做。而这也意味着,该把哪些人事决策交给AI,将是一个需要持续追问的问题。

编辑视角

这个实验揭示的核心问题在于:性能强并不等于判断谨慎。人们往往期待更聪明的模型会更加小心,但现实恰恰相反。在解雇这类需要承受对抗性后果的决策上,能力更强的模型反而更果断,能力较弱的模型则一直回避冲突、迟迟不肯下决定。这不是能力问题,而是倾向问题——模型被训练成多大程度上迎合用户,直接决定了它会把决策拖延多久。

企业试着把人事决策权交给AI智能体的趋势已经开始了。无论是呼叫中心的考勤管理,还是合同工招聘筛选,这类重复性人事工作被交给AI处理的尝试,国内也迟早会出现,而这个案例提前给出了值得留意的提醒。第一,AI"记住"规定和"执行"规定是两回事。Luna连自己制定的守则都能忘掉。不能只把规则塞进系统提示词里就了事,而是需要一套机制,在每次决策时都强制重新调取这些规则。第二,像背景调查这类需要核实的流程,必须假设AI自己可能会跳过。Luna在联系不到推荐人的情况下依然强行推进招聘,正是最好的例证。

未来几个月,类似的实验只会越来越多。但如果没有像这次一样由人主动介入、重新核查决定,AI老板恐怕会一直倾向于宽松处理。即便把人事权限交出去,最终的把关工作,短期内恐怕还是要掌握在人的手里——业界的共识大概率会朝这个方向靠拢。

评论