艾伦人工智能研究院(Ai2)8 月 7 日发布 TutorMoments 基准,素材是 462 份去标识化的一对一数学辅导记录,学生为美国 2 至 7 年级,来自一个面向低收入学校的高强度辅导项目。资深数学教师在这些记录中标注了 1500 多个关键时刻——在这些时刻,辅导者必须做出选择:是把题目变简单让学生更容易起步,还是把思考推回给学生。随后七个模型被放回这些时刻重演:Gemini 2.5 Pro、Gemini 3.5 Flash、Claude Opus 4.8、Claude Sonnet 4.6、GPT-5.5、GPT-5.4 mini 和 DeepSeek V4 Pro。在不告诉模型什么是好辅导的普通提示下,各模型在「严格度」上的得分低至 0.023 至 0.046:它们几乎从不要求学生自己动手。当明确告知评测标准后,所有模型都大幅提升——Gemini 2.5 Pro 在恰当支架上达到 0.896,Claude Opus 4.8 在严格度上达到 0.831,Claude Sonnet 4.6 在避免过度帮助上达到 0.913——但差距依然存在。Ai2 同时公开了技术报告、数据集和代码。