返回文章列表
模型评测

ExplorationBench:让AI在“外星世界”中接受探索能力考验

阅读约 3 分钟

导语

科学发现并不只是回答已知问题。真正困难的部分,往往发生在现有知识失效之后:系统需要提出假设、设计实验、读取反馈,再根据结果调整自己的理解。对AI而言,这种能力一直很难测量,因为研究者既要确认新假设是否成立,也要排除模型只是从预训练语料中找到了相似答案的可能。

ExplorationBench提出了一种更可操作的评估方案:把模型放进规则陌生、但结果可以精确验证的“外星世界”。

核心设计

该基准包含两个独立沙盒:AlienCode和AlienLogic,分别面向代码式规则发现与逻辑推理。每个沙盒都设置了一组需要发现的目标和配套任务,但系统不会直接获得完整、可靠的规则说明,而是要利用探索过程逐步建立世界模型。

  • 规则可执行:环境中的规则能够由程序运行,系统提交的答案可以被精确检查,减少了开放式科学问答中“结论是否正确”难以判定的问题。
  • 刻意制造陌生性:这些世界的规则与常见知识存在冲突,模型不能仅靠熟悉的物理、数学或编程经验完成任务。
  • 信息并不完美:系统获得的是有缺陷的手册、针对任务的环境反馈,以及专门设计的工具调用接口。它必须判断哪些说明可信、哪些现象值得进一步验证。
  • 探索与测试分离:系统先在沙盒中进行实验,再处理保留任务。这样的设置有助于观察它是否真的获得了可迁移的新规则,而不只是记住某道题的答案。

研究发现

论文评估了10个AI系统。结果表明,能力较强的系统确实能够从反馈中提炼陌生规则,并将这些规则应用到新的任务上。这说明,至少在受控环境内,当前AI已经表现出一定的“获取新知识”能力,而不仅是调用既有记忆。

不过,探索并不是稳定、单调的进步过程。不同运行轨迹之间的表现差异很大;继续进行更多探索,有时不能带来额外收益,甚至会让系统偏离此前已经形成的正确理解。换言之,探索策略、信息筛选和记忆更新同样重要,单纯增加交互次数并不能保证发现能力提升。

意义与局限

ExplorationBench的价值,在于把“AI是否会探索”从抽象口号转化为可重复实验:环境负责生成反馈,执行规则负责核验结果,保留任务则用于检验知识能否迁移。这为研究智能体如何提出实验、处理不确定信息和避免错误累积提供了统一测试场。

当然,虚拟沙盒仍然不能完全替代真实科学研究。真实世界涉及更复杂的观测噪声、资源约束、长期目标和领域知识。更现实的下一步,是研究系统能否在更开放的环境中保持有效探索,并建立可靠的停止、复核和纠错机制。

总的来看,ExplorationBench关注的不是模型“知道多少”,而是它能否在未知规则面前主动学习、验证并迁移知识。这一视角可能成为评估科学智能与AI智能体能力的重要补充。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
WhatWorkedBench:用有限实验检验 AI 研究代理是否真正理解“什么有效”
模型评测
cctest.ai
模型评测

WhatWorkedBench:用有限实验检验 AI 研究代理是否真正理解“什么有效”

WhatWorkedBench 为 AI 研究代理设计了一套实验理解基准:代理需要在有限预算下选择测量、分析代码,并预测不同组件组合的结果。研究显示,高斯过程、成对效应建模和代码等价性信息都能显著提升预测效果。

阅读全文