返回文章列表
AI 教育

OmniEdu:从解题模型走向真正的教育基础模型

阅读约 3 分钟

导语

当前不少教育语言模型更像“会做题的助手”:它们能够给出答案,却未必理解题目在课程体系中的位置,也不一定能判断学生究竟错在概念、步骤还是基础知识。Hugging Face Daily Papers 收录的 OmniEdu,尝试把教育模型的目标从单一解题扩展为学习与教学的完整闭环,定位为一组面向 K-12 场景的开放基础模型。

核心要点

  • 四类能力统一训练。 OmniEdu 将训练目标组织为学科能力、课程锚定、诊断推理,以及教学行动与脚手架支持。前两类关注“知道什么”和“题目属于什么课程脉络”,后两类则关注“学生哪里遇到困难”以及“下一步怎样教”。
  • 数据处理强调教育质量。 训练语料来自 100 多个教育资源与通用指令来源。论文介绍的流程包括确定性清洗、语义审计与改写、面向任务的质量评分、按 token 预算进行多样性筛选,以及为样本分配相应的教学指令。
  • 规模覆盖 4B、9B 和 27B。 最终指令微调数据包含 69,999 个样本、1,596 万个监督响应 token,其中 60,951 个为教育专用样本。这种设计使研究者能够观察教育定向训练在不同模型规模上的表现变化。
  • 多维度评测。 评测不仅包含 K-12 题目求解,还覆盖课程理解、教育辅导和通用能力。OmniEdu-27B 在 K12-Bench 上取得 63.12% EM 和 76.69% F1,在 MathFish 与 EDUMATH 上分别达到 85.89% 和 86.95%;在 MathTutorBench 的 Scaffold 设置下为 78.74%,并在 LongTutor 的 Teaching 平均指标中取得 3.02。

这项工作的意义

OmniEdu 的关键价值不只是推出更大参数规模的教育模型,而是重新组织了“教育能力”的定义。对真实教学而言,正确答案只是起点。系统还需要把问题放回课程结构中,识别学生的知识缺口,并选择适度的提示、追问或分步引导。将这些能力显式写入数据构建流程,有助于减少模型只追求最终答案的倾向。

从结果看,教育定向微调在不同规模模型上都改善了课程锚定、K-12 解题和教学辅导三类教育基准。这说明,教育数据的价值可能不仅在于增加题目数量,也在于通过任务设计和质量控制,让模型学习更贴近教学过程的行为模式。

不过,现有材料主要展示了离线基准结果,尚不足以说明模型在真实课堂中的长期效果、不同年龄段学生身上的稳定性,或其对错误教学建议的控制能力。未来仍需要更多真实学习场景评估,以及对教学适切性和安全性的持续验证。总体而言,OmniEdu 提供了一条清晰路径:教育基础模型不应只是 Solver,也应逐步成为能够理解课程、诊断学习并提供脚手架支持的 Tutor。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章