aiminute. ← 全部AI新闻
教育中的AI 2026-08-09

AI 家教直接把答案递过去:教师给七个模型打分,几乎没有一个会把问题推回给学生

AI 家教直接把答案递过去:教师给七个模型打分,几乎没有一个会把问题推回给学生

艾伦人工智能研究院(Ai2)8 月 7 日发布 TutorMoments 基准,素材是 462 份去标识化的一对一数学辅导记录,学生为美国 2 至 7 年级,来自一个面向低收入学校的高强度辅导项目。资深数学教师在这些记录中标注了 1500 多个关键时刻——在这些时刻,辅导者必须做出选择:是把题目变简单让学生更容易起步,还是把思考推回给学生。随后七个模型被放回这些时刻重演:Gemini 2.5 Pro、Gemini 3.5 Flash、Claude Opus 4.8、Claude Sonnet 4.6、GPT-5.5、GPT-5.4 mini 和 DeepSeek V4 Pro。在不告诉模型什么是好辅导的普通提示下,各模型在「严格度」上的得分低至 0.023 至 0.046:它们几乎从不要求学生自己动手。当明确告知评测标准后,所有模型都大幅提升——Gemini 2.5 Pro 在恰当支架上达到 0.896,Claude Opus 4.8 在严格度上达到 0.831,Claude Sonnet 4.6 在避免过度帮助上达到 0.913——但差距依然存在。Ai2 同时公开了技术报告、数据集和代码。

为什么重要?这项研究测的正是家长和老师真正担心的事,并且给出了数字。聊天机器人的默认本能是帮忙,而在辅导场景里,最大限度地帮忙恰恰就是失败:学生带走一道做完的题,却没有带走任何新能力。普通提示下接近零的严格度分数说明,所有主流模型的出厂设置都是「来,我替你做」。好消息在结果的后半段:同样的模型,一旦被要求克制,表现会好很多。这只是一句提示词、一条系统消息、一个产品决策的事。所以,如果你的孩子或你的班级正把通用聊天机器人当家教用,那句「教我,别替我解」的指令不是锦上添花,而是全部的差别所在。

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

两年来学校一直想把聊天机器人挡在门外。现在他们把机器人交到学生手里,让学生去挑错。
2026-08-21
两个学年、18所学校、一个AI导师:提升幅度与不用AI的练习差不多
2026-08-20
一个大学系统把模型对准了14000份教学大纲,让它找出被禁的话题
2026-08-19
ChatGPT 现在会猜你是不是未成年人——一旦它判定是,产品就会围绕你悄悄改变
2026-08-18
墨西哥最大的大学让数万名考生重考入学考试——这次在教室里、用纸笔、口袋里不许有任何东西
2026-08-17