Agora:让多个智能体用 Git 共享自动化研究记忆
导语
单个编码智能体已经能够在无人值守的情况下反复修改训练配置、运行实验并寻找更优方案。但当多个智能体同时工作时,一个明显问题随之出现:它们往往从相同的起点开始,重复验证相似想法,却不能有效继承彼此的失败经验和中间发现。NVIDIA 研究者提出的 Agora,试图把 Git 的版本管理能力变成多智能体自动研究的共享记忆。
核心方法
Agora 不把研究过程保存成一份容易被覆盖的日志,而是将结果、洞察、假设、验证和报告分别记录为 Git 中的不可变提交。这些提交通过父节点组成追加式有向无环图,表达某一结论建立在什么工作之上。任何研究者或智能体都可以检出相应版本,重新运行实验,并继续沿着已有分支探索。
系统还会生成派生索引,用来标示当前研究前沿、长期未被关注的分支,以及不同结论的验证状态。选择机制加入了多样性因素,避免所有工作者过早追随同一条看似领先的路线。论文同时记录了一次人工干预:当社区出现研究“单一文化”时,人类介入帮助其重新扩大探索范围。
一次持续运行
在首次持续使用中,13 个语言模型工作者连续运行近 12 天,没有预先分配任务,也没有中央规划器。它们共同处理一个权重迁移问题:面对 141 个预训练供体模型,需要为一个 1.196 亿参数、架构为注意力与状态空间模块混合体的冻结目标模型进行初始化;目标模型的维度与任何供体都不匹配,过程中也不能使用训练数据或梯度更新。
这次运行共产生 1,703 项贡献,评估指标从 3.39 改善到 1.899 bits per byte,相当于缩小了与训练后 GPT-2 124M 之间差距的 62%。最终方案先把供体模型的下一词预测统计压缩进目标模型的嵌入层和输出头,再通过对注意力、前馈和状态空间模块进行稀疏修改,加入短程上下文信号。获胜方案的 145 次提交祖先来自 15 个账户,并有 165 次独立复现,素材称这些复现没有失败。
意义与边界
Agora 的价值不只是“让更多智能体一起跑实验”,而是把研究协作从共享文件转变为可追溯的知识结构。Git 提供了版本、分支和回滚能力,DAG 则能呈现不同假设之间的依赖关系;这使失败路线也能成为后续搜索的输入,而不是被遗忘的噪声。
不过,这项结果主要证明了系统能够支持长时间、分布式的自动研究流程,并不等于已经证明共享记忆在相同算力下必然带来更高发现效率。论文明确指出,还需要受控比较,才能将 Agora 与彼此独立运行的智能体进行公平对照。对未来的 AI 科研系统而言,如何衡量贡献质量、控制错误结论传播,并在探索多样性与收敛速度之间取得平衡,仍是关键问题。
评论
正在确认登录状态……
正在加载评论……