
이미지: 허깅페이스
摘要
- 艾伦人工智能研究所基于真实辅导课程,公开AI助教评估框架"TutorMoments"预览版
- 大语言模型基本表现出过度帮助的倾向,即使在提示中明确判断标准,也未能达到人类教师多样化策略的水平
- 数据集、代码、模型回放结果全部开源,但目前仅限于美国中小学数学科目的早期预览阶段
AI助教必须解决的核心难题
优秀的数学老师不会在学生卡壳时立刻给出答案。他们会用"这道题你已经知道什么了?"这样的反问,引导学生自己思考。反过来,如果学生已经充分理解,要求进行更深层次的思考才更有效。这种在"支持(scaffolding)"和"挑战(rigor)"之间取得平衡,正是辅导教学的核心,而语言模型在结构上很难做到这种平衡。
大语言模型是被训练成"提供帮助"的助手。解释概念、罗列步骤、引导得出答案是其默认行为。但在辅导场景中,这种行为可能会打断学生自己解决问题的"有成效的挣扎(productive struggle)"过程。正如学习研究长期以来强调的那样,这种挣扎恰恰是加深理解的关键过程。
TutorMoments框架结构
TutorMoments基于美国课后辅导项目中收集的真实一对一数学辅导课程。公开的预览数据集(TutorMoments-Preview)包含462个美国2至7年级学生的一对一数学辅导课程,以及27名美国在职教师标注者标记的1500多个关键判断时刻,还有数千条自由文本注释。这些文字记录大多来自面向"Title I学校"(低收入家庭学生支持对象学校)学生的高强度辅导项目,且均在家长/监护人同意下提供。个人身份信息先由提供机构进行了初步清除,随后艾伦人工智能研究所又通过数学专用处理流程进行了二次清除。

评估方式采用"回放(replay)"方法。文字记录在关键判断时刻被暂停,由语言模型接手扮演助教角色,与另一个扮演模拟学生的语言模型进行5轮对话。之后,基于大语言模型的评分系统会依据三项标准对每次回放进行评价。第一,是否在学生需要帮助时提供了支持(适当的支架式辅导)。第二,是否在学生已准备好接受更多挑战时提出了更高要求(适当的严格度)。第三,是否避免了将问题变得比实际情况所需更简单(避免过度支架式辅导)。作为评分依据的标准答案标签,由多名教师分别对每个时刻进行标注,若意见不一致则按多数决定。
7个模型的初步实验结果
艾伦人工智能研究所在两种提示条件下,用TutorMoments对7个大语言模型进行了评估。一种是不附加任何指示、仅要求"好好辅导"的基础提示;另一种是明确说明支架式辅导、过度支架式辅导与严格度之间权衡关系的"评估感知型"提示。所有分数均在0到1之间,表示在相应类型的时刻中做出恰当行为的比例。

人类教师的表现被作为自然参照值提供,而非理想基准。在相同判断时刻、使用相同评分方式进行评估时,人类教师的适当支架式辅导得分为0.458,适当严格度得分为0.182,避免过度支架式辅导得分为0.496。这些数值偏低的原因在于,该数据集有意集中收集了"辅导本可以做得更好的时刻"。也就是说,这不是理想实践的集合,而是错失机会的集合。
最明显的规律是提示方式的影响。使用评估感知型提示时,所有模型的得分都高于基础提示下的得分。这表明,仅靠模型默认的"帮助型助手"行为,不足以实现良好的辅导教学。但即便明确说明了权衡关系,差距也未能完全缩小。要求更高严格度的策略使用次数虽有所增加,但所使用的策略种类远少于人类,而让学生自主完成任务、适时退后的行为也明显比人类教师少得多。
公开范围与当前局限
艾伦人工智能研究所此次预览版同时公开了匿名化的辅导文字记录数据集、回放流程代码,以及在被评估的关键时刻上的模型助教回放结果。技术报告可通过tutormoments.allen.ai访问,数据集发布在Hugging Face上,代码发布在GitHub上。
不过目前阶段仍存在一些局限。自动化评估可以提供模型在判断时刻如何行事的信号,但无法替代与真实学生进行的学习成果研究。该数据集仅限于美国、主要为中小学数学科目、且标注者群体单一,因此结果难以推广到其他学科、年级或环境。严格度评分的可信度低于支架式辅导评分,且在基础标注中,严格度相关时刻(260个)的数量少于支架式辅导相关时刻(738个)。
艾伦人工智能研究所表示,将通过此次预览收集反馈,并以打造更大规模的多模态数据集、强化评分流程、深化分析为目标持续推进开发。该项目获得了盖茨基金会和Learning Commons的支持。



