
이미지: METAL LAB 생성
摘要
- Ai2于2026年8月7日公开了利用真实一对一数学辅导对话记录制作的评测框架TutorMoments预览版
- 仅指示LLM"要教得好"时,大多数模型都倾向于过度提供帮助,很少出现促使学生自主思考的引导
- 即便在提示词中明确写出帮助与克制之间的权衡,模型与人类辅导老师之间的差距依然没有缩小,模型之间的表现差异也很大
- 공개 주체
- Ai2 (Allen Institute for AI)
- 이름
- TutorMoments
- 공개일
- 2026년 8월 7일
- 평가 방식
- 실제 미국 과외 프로그램 전사를 활용한 리플레이 기반 평가
- 역할 구성
- LLM이 튜터 역할, 또 다른 LLM이 학생 역할을 맡아 시뮬레이션
- 주요 발견
- 지시 없이는 과도하게 도와주는 경향, 트레이드오프 명시해도 격차 미해소
- 공개 자료
- 비식별화 전사 데이터셋, 리플레이 파이프라인 코드, 모델 리플레이 기록
学生求助时反问的理由
当一名学生在解数学题时卡住,问出"这题该怎么解?"时,优秀的辅导老师不会立即给出答案。相反,他们会反问:"你觉得这道题在问什么,说说你的理解?"Ai2解释称,这种反问并非不友善,而是用来诊断学生理解程度的核心技巧。因为一旦替学生把题解出来,就会剥夺学习所必需的"有效挣扎(productive struggle)"——即在找到答案之前经历的试错与挫折,以及在这一过程中夯实的理解。
相比之下,语言模型被训练成给出"有帮助的答案"。解释概念、列出解题步骤、直接引导至答案,是它的默认习性。而在辅导场景中,这种习性反而可能成为毒药。Ai2于8月7日公开了正面测量这一问题的评测框架TutorMoments的预览版。
还原真实辅导过程的方式
TutorMoments基于美国某辅导项目中收集的真实一对一数学辅导对话记录制作而成。经验丰富的数学教师审阅这些记录,从中挑选出辅导老师面临"要不要把问题简化以帮助学生"还是"要不要推动学生自己再多想一想"的分歧时刻。评测将对话原样交给语言模型,直到那个决策点为止,让模型接手辅导角色继续进行模拟。此时学生角色由另一个语言模型担任。也就是说,这并非真人参与,而是通过模型对模型的重演(replay)来观察判断时刻的结构。
要么全帮,要么完全不帮
现有的许多辅导基准测试都以单一行为作为评分标准,比如"绝不能直接给答案"或"必须始终给提示"。但优秀的辅导并非固定的行为清单,而是随情境变化的判断。此次结果显示,当模型仅仅被指示"要教得好"时,大多倾向于过度提供帮助,很少出现促使学生进行更深层自主思考的引导。当提示词中明确写出帮助与克制之间的权衡时,表现有所改善,但仍未达到能够根据情境持续做出一致判断的人类辅导老师水平。Ai2表示,模型之间的差异也很大。
| 公开内容 | 说明 |
|---|---|
| 数据集 | 去标识化的真实辅导对话记录 |
| 代码 | 重演评测流程 |
| 重演记录 | 评测对象中主要决策时刻的模型辅导重演 |
为何是现在这个问题
AI辅导已经在课后学习、考试备考、个性化学习服务等领域迅速普及。然而,模型对学生提问立即给出答案的习性,在评分基准测试中会被评为"有用",但在教育现场却可能起到消灭学习机会的副作用。TutorMoments正是试图以真实教师的判断为基准,来量化这一差距的尝试。Ai2公开了数据集、代码和重演记录的全部内容,使其他研究人员和AI辅导开发团队能够用同一标准进行复现和验证。
AI辅导,帮助时机判断基准测试出现 (/2026/8/tutormoments-ai-tutor-benchmark)
那么,这会带来什么改变
TutorMoments目前处于预览阶段,仅限于美国中小学数学科目,尚未全面公开详细评测项目或全部对象模型列表。尽管如此,此次公开的意义在于,它为开发AI辅导系统的团队提出了一个新的评分标准——不是"能否答对",而是"能否恰当判断介入时机"。既然已确认仅靠提示词无法弥补这一差距,未来AI辅导的开发很可能会转向在模型训练阶段就教导其"何时该退后"。由于数据和代码均已开放,其他研究团队也获得了用同一标准验证自身模型的途径。



