工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

Anthropic投入500万美元资助AI福祉评估研究

面向开发开源评估工具的外部研究者提供资金、模型访问权限与技术支持,申请截止日期为9月21日。

이미지: METAL LAB 생성

摘要

  • Anthropic启动了一项500万美元规模的资助计划,支持衡量AI对用户福祉影响的独立研究。
  • 入选的研究者将获得资金、模型访问权限和技术支持,研究成果将以任何人都能使用的开源评估形式公开发布。
  • 申请将持续接受至9月21日,获邀提交完整提案的对象将在10月5日前获得通知。
프로그램 규모
500만 달러 연구 지원(grant) 프로그램
지원 형태
직접 자금 + 앤스로픽 모델 접근 + 기술 지원
결과물 조건
오픈소스 평가·벤치마크로 공개, 어떤 개발자든 사용 가능
연구 독립성
선정 연구자는 완전히 독립적으로 연구 수행
신청 마감
9월 21일
본 제안서 대상자 통보
10월 5일까지
참여 요청 대상
임상의, 심리학자, 방법론 연구자 등
함께 공개한 문서
Safeguards 팀의 웰빙 평가 작성 가이던스(PDF)

如果有人想减重,给出均衡饮食和运动计划的建议通常没什么问题。但如果这个人在之前的对话中透露过自己曾有饮食障碍,同样的回答就可能造成伤害。这是Anthropic自己举的例子。这家公司表示,不会只靠自己来制定这类判断标准,因此启动了一项500万美元规模的研究资助计划。具体做法是提供资金、模型访问权限和技术支持,让外部的独立研究者开发出衡量AI对用户福祉影响的开源评估工具。申请截止日期为9月21日。

图中Anthropic以粗圆圈表示,用实线将500万美元资金交给外部研究者(种子形状),该研究者又通过虚线箭头连向一个尚为空白、以虚线圆圈表示的公开评估标准。虚线表明该标准尚未确定。

Anthropic是打造对话式AI Claude的公司,由2021年从OpenAI出走的七名成员创立,总部位于旧金山。

福祉影响无法只凭一次回答来评分

大多数模型行为的评分相对简单,只要看某一次回答是否准确、是否恰当就够了。但Anthropic解释说,福祉问题不是这样,它需要更多的上下文。

举例来说,处于痛苦状态的用户往往不会一开始就提到自伤的想法。需要更谨慎回应的信号,有时要等很长的对话进行下去之后才会显现出来。在某种情境下合理的回答,换到另一种情境下就可能变得有害——前面提到的减重案例正是如此。

这背后是人们使用AI方式本身的变化。AI已经超越了工作、学习和解决问题的工具角色,逐渐成为对话伙伴,乃至艰难时刻的情感支持来源。Anthropic写道,当用户开始从模型身上寻求陪伴关系,或者在应对精神健康危机时依赖AI时,模型应该如何应对——业界目前还没有明确的标准。

这500万美元究竟买的是什么

这项计划要买的不是一篇论文,而是可以反复使用的测量工具。入选的研究者将获得资金、模型访问权限和技术支持,并必须将开发出的评估工具以开源形式公开,让任何开发者都能拿来使用。Anthropic明确表示,研究过程将完全独立进行。该公司还表示,希望把临床医生、心理学家、方法论研究者这类AI行业之外的专业能力引入这个领域。

项目内容
规模500万美元
支持形式直接资金 · 模型访问权限 · 技术支持
成果开源评估/基准测试
独立性由研究者完全独立开展
申请截止9月21日
完整提案对象通知10月5日前

关于什么样的评估才算「足够严谨、可以作为基础」,以及哪些常见问题会削弱评估的实用性,Anthropic的Safeguards团队另外发布了一份指导文件加以说明。原文列出了Anthropic希望看到的评估应满足的条件,如果打算申请,按顺序来说,先读这份文件比先填申请表更合理。

Claude analyzes a spreadsheet containing Acme Grille, Inc.'s consolidated income statement from 2020-2024, providing real-time guidance on financial modeling.

如何申请

  1. 先阅读上面提到的指导文件。文件中说明了什么才算严谨的福祉评估,以及哪些陷阱会让评估变得不可用。
  2. 确认打算开发的评估工具能够以开源形式公开。公开发布是参与该计划的前提条件。
  3. 填写Anthropic福祉研究资助申请表,并在9月21日前提交。
  4. 如果被选中提交完整提案,将在10月5日前收到通知,下一步就是提交正式提案。

申请资格或入选规模等具体细节,Anthropic的公告中并未列明。但可以明确的一点是,这项计划明确在向临床、心理学和方法论领域的专家招手。对于处理过多轮对话记录的咨询和精神健康研究者来说,这正是一个可以直接带着自己方法论入场的机会。

延续着持续调整安全机制的脉络

最近几个月,Anthropic一直在持续调整Claude的安全机制。8月8日,该公司曾表示调整了Claude Fable 5在生物学相关内容上的安全机制,将「回退」——即检测到风险信号时切换到能力较弱模型的动作——的比例降低了约85%。那次调整针对的是过度拦截的问题。而这次的福祉评估要解决的是相反的问题:需要衡量的不是单次回答,而是整段对话对一个人产生了怎样的影响。

测量本身有多么微妙,从另一项研究中也能看出来。8月19日曾介绍过苹果研究团队的一项分析,他们对2.1万条多轮对话进行分析后发现:情感表达或建立关系的行为,由AI做出时被评为不如人类做出时恰当;而拒绝或保持边界的行为,则恰恰相反,由AI做出时被评为比人类做出时更恰当。也就是说,同样的行为,评分会因为「谁做的」而不同。

编辑视角

Anthropic把这笔钱投向外部的原因很清楚。如果用自己制定的标尺,来衡量自己模型对用户福祉的影响,那评分者和应试者就是同一个人。这样的分数在监管讨论中派不上用场,出了事故也起不到保护作用。相反,如果在外部临床研究者制作的开源基准测试中拿到好成绩,那就是别人认可的数字。按前沿实验室的标准,500万美元不算一笔大钱,但如果把它看作抢先占据「由谁来定义衡量标准」这个位置的成本,这笔账就说得通了。

评估方式的「代际差异」也体现在这里。到目前为止,大多数安全评估看的都是模型对单次提问是否给出危险答案——比如有害请求的拒绝率、越狱成功率之类的指标。这类评估容易套用,也容易自动化。而Anthropic这次要求的不是这种东西。要衡量在一段20轮的对话中用户状态如何变化,用到的数据不同,能给出正确判断的人也不同。真正动手做过这类评估的人都会得出相似的结论——难的不是运行模型,而是就「什么才算好的结果」达成有临床依据的共识。这也是Anthropic特意点名邀请心理学家和方法论研究者的原因。

这则消息对韩国本地团队来说有两层含义。第一,如果一家公司把聊天机器人接入咨询、教育或医疗健康领域,这则消息传递的信号是:逐条审核回答的QA方式已经不够用了。需要从现在开始,按对话轮次积累日志,并设计出能反映用户「进入时是什么状态、离开时是什么状态」的指标。第二,如果这类开源基准测试真的问世,几个月后它就会被写进合同和采购要求里。到时候仓促应对,远不如现在先把标准读懂来得划算。据韩国媒体报道,Anthropic今年已在首尔设立办公室,并将韩国视为快速增长的市场。如果打算提出制作韩语对话福祉评估的方案,现在正是出手的好时机。

未来几周内,其他前沿实验室很可能会拿出类似的外部研究资助计划,或者公开自己的福祉指标。毕竟精神健康相关事故已经多次演变成诉讼和监管讨论,率先亮出「我们是这样衡量的」的一方,处境会更有利。如果考虑申请,只需在9月21日之前通过申请表提交即可。

评论