返回文章列表
模型评测

DataPrep-Bench:把“会做训练数据”变成可评测能力

阅读约 3 分钟

导语

在大模型训练中,数据质量往往比模型结构的细节更直接地决定最终能力。但一个长期问题是:当 LLM、智能体或自动化数据流水线被用来“准备训练数据”时,我们到底该如何判断它们做得好不好?DataPrep-Bench 试图给出一个更贴近训练结果的答案。

这项来自 Peking University 等作者的工作,将训练数据准备拆成两个同等重要的能力:一是数据构造,即把原始来源转化为可用于监督微调的数据;二是数据质量评估,即在真正训练之前,预测某个候选数据集是否值得用于训练。论文特别强调,这里的“质量”不是流畅度、格式整洁度或关键词丰富度,而是数据对下游模型性能的实际贡献。

核心要点

  • 统一评测两类能力:DataPrep-Bench 同时评估数据构造与数据质量评估,而不是只做数据清洗或样本打分的局部测试。
  • 以下游结果作为依据:在数据构造轨道中,不同方法使用相同原始来源生成训练数据,再与 Dolly-15k 共同用于微调基础模型,最终通过下游表现打分。
  • 覆盖多领域与多基础模型:基准设置横跨六个领域,并在多个 base model 上考察,降低单一任务或单一模型带来的偶然性。
  • 发布 Data-Construction-Skill:作者提出一个技能引导型智能体。在 Llama-3.1-8B 的 Finance 设置中,它相较仅使用 Dolly 的基线提升接近 20 个绝对点;在知识抽取密集的领域,也能与较强的 agent 或 DataFlow 方法竞争。
  • 提出 DAS 评估器:Distributional Alignment Score 使用候选数据集与领域代理之间的 MMD 分布距离来衡量对齐程度。它在六个领域中的四个取得最强跨模型相关性,并且是在 Math、Science、Medical 三个领域同时达到 r > 0.70 的指标。

意义与影响

DataPrep-Bench 的价值不只是“又一个榜单”。它把数据准备从经验工程推进到可复现实验:同样的原始材料、同样的候选池、同样以下游训练收益为评判标准,使不同 LLM、智能体和数据工作流可以被放在同一框架下比较。

这对未来的数据中心 AI 工作流尤其重要。随着模型训练成本上升,团队不可能对每批数据都进行完整训练试错;能否在训练前判断数据的潜在价值,将直接影响预算、迭代速度和模型表现。DAS 这类分布式对齐指标的结果也说明,单纯依赖文本表面质量或启发式规则可能不足以判断“训练有用性”。

当然,该基准仍是一个评测框架而非最终答案。不同领域的数据形态、任务目标和基础模型差异,都会影响数据价值的定义。但 DataPrep-Bench 至少明确了一个方向:评估训练数据准备能力,应回到模型训练后的真实收益,而不是停留在看起来是否“高质量”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SceneActBench:让VLM智能体在看见的3D场景中真正行动
模型评测
cctest.ai
模型评测

SceneActBench:让VLM智能体在看见的3D场景中真正行动

SceneActBench 关注一个比“看图说话”更难的问题:视觉语言模型智能体能否基于图像或视频帧,在完整的多物体 3D 场景中完成动作任务。该基准用统一的智能体-环境循环和几何指标,检验当前 VLM 从感知走向行动的能力边界。

阅读全文