返回文章列表
模型评测

DataPrep-Bench:把“会做训练数据”变成可评测能力

阅读约 3 分钟

导语

在大模型训练中,数据质量往往比模型结构的细节更直接地决定最终能力。但一个长期问题是:当 LLM、智能体或自动化数据流水线被用来“准备训练数据”时,我们到底该如何判断它们做得好不好?DataPrep-Bench 试图给出一个更贴近训练结果的答案。

这项来自 Peking University 等作者的工作,将训练数据准备拆成两个同等重要的能力:一是数据构造,即把原始来源转化为可用于监督微调的数据;二是数据质量评估,即在真正训练之前,预测某个候选数据集是否值得用于训练。论文特别强调,这里的“质量”不是流畅度、格式整洁度或关键词丰富度,而是数据对下游模型性能的实际贡献。

核心要点

  • 统一评测两类能力:DataPrep-Bench 同时评估数据构造与数据质量评估,而不是只做数据清洗或样本打分的局部测试。
  • 以下游结果作为依据:在数据构造轨道中,不同方法使用相同原始来源生成训练数据,再与 Dolly-15k 共同用于微调基础模型,最终通过下游表现打分。
  • 覆盖多领域与多基础模型:基准设置横跨六个领域,并在多个 base model 上考察,降低单一任务或单一模型带来的偶然性。
  • 发布 Data-Construction-Skill:作者提出一个技能引导型智能体。在 Llama-3.1-8B 的 Finance 设置中,它相较仅使用 Dolly 的基线提升接近 20 个绝对点;在知识抽取密集的领域,也能与较强的 agent 或 DataFlow 方法竞争。
  • 提出 DAS 评估器:Distributional Alignment Score 使用候选数据集与领域代理之间的 MMD 分布距离来衡量对齐程度。它在六个领域中的四个取得最强跨模型相关性,并且是在 Math、Science、Medical 三个领域同时达到 r > 0.70 的指标。

意义与影响

DataPrep-Bench 的价值不只是“又一个榜单”。它把数据准备从经验工程推进到可复现实验:同样的原始材料、同样的候选池、同样以下游训练收益为评判标准,使不同 LLM、智能体和数据工作流可以被放在同一框架下比较。

这对未来的数据中心 AI 工作流尤其重要。随着模型训练成本上升,团队不可能对每批数据都进行完整训练试错;能否在训练前判断数据的潜在价值,将直接影响预算、迭代速度和模型表现。DAS 这类分布式对齐指标的结果也说明,单纯依赖文本表面质量或启发式规则可能不足以判断“训练有用性”。

当然,该基准仍是一个评测框架而非最终答案。不同领域的数据形态、任务目标和基础模型差异,都会影响数据价值的定义。但 DataPrep-Bench 至少明确了一个方向:评估训练数据准备能力,应回到模型训练后的真实收益,而不是停留在看起来是否“高质量”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SAEScientist-Bench:AI智能体能独立完成机制可解释性研究吗?
模型评测
cctest.ai
模型评测

SAEScientist-Bench:AI智能体能独立完成机制可解释性研究吗?

SAEScientist-Bench将稀疏自编码器(SAE)研究转化为可测评任务,检验AI智能体能否自主发现模型内部具有语义意义的特征。结果显示,智能体已能筛选出有价值的候选特征,但在因果操控和实验结果解读上仍明显落后于专家。

阅读全文