METAL

Google Research 开放学习互动模块库

Google Research 于 9 月 17 日公开了让教师自己制作互动式学习模拟的研究。只用一次提示就满足全部要求的比例仅为 3.5%,而让系统自我修正十轮后升到了 69.3%。

Google Research 开放学习互动模块库

摘要

  • Google Research 于 9 月 17 日公开了用生成式 UI 制作教师定制学习模拟的研究实验。
  • 同时开放了 30 多个英文样本组成的资源库,全部由 AI 生成并经教师审阅。
  • 12 位教师参与的研究中平均分超过 8.1,40 份请求的专家评审接受率为 86%。
The future of practice: Enabling teachers to create learning interactives with generative UI

教师把课堂要讲的主题写下一行,学生用的模拟当场就被生成出来。这就是 Google Research 于 9 月 17 日公开的研究实验 learning interactives。这篇由研究科学家 Gal Elidan 与产品经理 Yael Haramaty 共同撰写的文章说,团队给生成式 UI(GenUI)加上了学习设计护栏,让教师能够自己制作贴合各自课程与学生的引导式模拟。生成式 UI 指的是不预先写好界面代码,而由模型即时构建用户界面的技术。

这项研究瞄准的位置很清楚。文章写道,在线教科书和视频库改变了信息获取方式,但数字化学习在体验上仍然偏被动。能让学生自己思考、自己解题的互动式练习制作成本高、数量少,而且要花教师更多精力。公司表示,他们想看看 AI 能不能把这个缺口补上。

随文章一同开放的是 30 多个英文样本。涵盖物理、化学、生物、数学等 STEM 科目,重点面向初中和高中。它们全部由 AI 生成并经教师审阅,资源库中包含生物、化学、计算机科学、地球科学、数学和物理主题。开普勒行星运动定律、数据可视化、抛体运动等学校课程主题都在名单上。

生成过程分四个阶段。把教师的请求转成学习目标和模拟构想的规划阶段,把学习目标拆成难度递增关卡的支架阶段,根据构想与目标搭出实际界面的 Gen-UI 阶段,以及附上导览、提示、解法与反馈的引导阶段。关卡生成五个,后一关的目标要接着前面各关的目标依次生成。搭建界面的工作由 Gemini 完成。

METAL 下载并逐页数过的这份 16 页技术报告,用数字记下了这个过程为何必要。即便手里已经握有通过前序阶段的构想和分级目标,仅凭一次提示就生成满足全部教学要求的模拟,概率也只有 3.5%。在此基础上让自我修正的循环跑 10 轮,通过全部评审意见的比例升到了 69.3%。问题不在于不知道要求,而在于一次做不对。

评审分为四类。报告中的图表显示,从首次尝试到最后一次尝试,遥测从 23.3% 升到 93.5%,视觉从 47.8% 升到 84.7%,机制从 67.0% 升到 98.2%,可解性从 85.5% 升到 87.9%。越是看得见的缺陷越容易修,本来就守得住的项目变动最小。

衡量可解性的方式是这项研究里最实用的部分。据文章介绍,自动评估中的一项会打开一个 Chrome 实例,像真人一样直接操作模拟。它不只看某一个答案是否走得通,还会做出把旋钮推到极端值这类对抗性尝试。这和游乐设施开放前工作人员先坐一遍、故意使劲晃一晃的流程是一样的。

人这一侧的验证从 12 位教师开始。报告称,美国参与者中数学 4 人、生物 2 人、物理 2 人、环境科学 2 人、天文 1 人、化学 1 人,男女各六人。他们各自提出三项对自己学生有帮助的模拟请求,共 36 项。其中只有 3 项未达到可以呈交教师的水平,教师给所有模拟都打了 7 分以上,平均分超过 8.1。

教师们真正有反应的不是性能,而是掌控权。一位高中科学教师说:"Oh my gosh. Like if I was just teaching and I could just type put this in for anything and then a simulation would come, that would be amazing... I've never been able to differentiate any of the simulations because it's just, you know, you get what you get."另一位教师则点出分级提示:"This is amazing because this is like this is what I would be doing one-on-one with kids going around if they didn't understand it... But this kind of, you know, saves me from kids just sitting and waiting for me to get over there to help them."

规模更大的评审也暴露了弱项。教育专家挑选的 40 份请求,由教授对应科目的两位教师分别打分,接受率为 86%。分数从不及格 0 分到通过 1 分、良好 2 分、优秀 3 分。生物低于其他科目,报告解释说,像细胞周期阶段这类生物主题需要记忆的细节多于可供操作的方程,容易做成跟着教科书顺序走的画面。物理和化学平均最接近优秀。

从人文角度看,这项研究的骨架是一百年前的主张。报告以约翰·杜威 1916 年写下的 "Give the pupils something to do, not something to learn" 开篇。让·皮亚杰的建构主义与 Chi 和 Wylie 的 ICAP 框架也一并被引用,作为主动参与比被动听讲或阅读带来更深理解和更长记忆的依据。谷歌在 2024 年的教育模型 LearnLM 和 2025 年的 Learn Your Way 实验中已经处理过这一原则,这次研究叠在其上。

因此这套系统不是消除摩擦,而是刻意保留摩擦。报告写道,生成模型通常被设计成尽量减少摩擦和用户投入,于是交互会导向认知卸载,产生可能反而损害学习的增强与侵蚀悖论。面对这一点,公司选择的答案是不给开放式沙盒。把复杂概念拆成难度递增的关卡之后,学生必须提出假设、改动数值、自己解开,才能进入下一关。

教师的位置靠流程而非代码来守护。学习目标要由教师批准才会成为生成的基础,每个构想会生成五个候选供教师挑选。在接下来的试点中,新生成的互动模块也会先送给提出请求的教师,只有经该教师验证并批准后才会进入公开资源库。使用 Google Workspace for Education 的学校可以通过 Google for Education Pilot Program 报名。

METAL 曾报道Ai2 推出评估 AI 导师介入时机的框架,实测了帮得太早这一问题。这次研究之所以不直接给出答案,而是堆起分级提示与事后解法,原因正在于此。把 AI 放进课堂的其他路径也已经在跑,METAL 曾报道OpenAI 把 ChatGPT for Teachers 扩展到美国 55 个学区。

余下的问题在教室里面。公司表示接下来会用 UX 研究和实地研究衡量学习效果与学生参与度,在那些结果出来之前,这项工作证明的是生成式 UI 能够接住教师的请求,做出可用的模拟。把一次成功率 3.5% 靠十轮自我修正抬到 69.3% 的结构,正是这一证明的核心。教师自制教材的成本,如今是用审阅时间而不是制作费用来计算的。

评论