从写代码到改造推理系统:GLM 的 Infra Agent 走到哪一步了
导语
智谱创始人、首席科学家唐杰与 GLM 团队近日披露了一项内部实践:在 GLM-5.3-Flash 的上线过程中,由 GLM-5.3 驱动的 Infra Agent 参与了推理基础设施的适配、诊断与优化。团队称,该系统在超过 10 万张国产芯片组成的集群上工作,不到两周便将端到端吞吐提升到初始基线的约 3 倍。
这件事的价值并不只在于性能数字。过去,大模型主要被当作工程师的代码助手;在这次实践中,模型开始修改承载自身运行的推理系统,并依据实验结果不断调整方案。智谱将其称为递归自我改进的早期形态,但也强调,这还不是完整意义上的 RSI。
核心要点
- 模型参与基础设施建设。 Infra Agent 完成了模型适配、系统诊断、算子优化和服务性能调优,目标是让 GLM-5.3-Flash 在大规模国产芯片集群上稳定运行。
- 反馈闭环比代码生成更关键。 Agent 不只接收最终吞吐或延迟结果,还能使用正确性测试、运行日志、执行 Trace、运行时事件和微基准测试,逐层判断问题所在。
- 三个案例体现了不同能力。 团队披露了 KDA 上下文并行路径的精度问题、KV Transfer 与 DeepEP 并发受 Python GIL 影响的问题,以及通过调整算子分块策略获得性能提升的案例。
- 人的角色仍不可替代。 工程师负责定义目标和约束,搭建实验环境,并审核涉及数值语义、并发行为及线上风险的关键修改。
为什么稠密反馈重要
单一的端到端指标只能告诉 Agent 结果变差了,却很难解释原因。智谱的做法,是把复杂优化过程拆成一系列可局部观察和重复验证的任务。例如,精度对照可以确认不同并行路径是否算对;时间线可以揭示计算、通信与等待之间的关系;微基准则能帮助判断某项优化是否只在特定输入条件下有效。
这种反馈并非简单堆积更多日志,而是要求信息足够局部、获取成本较低,并且能够通过对照实验进行客观验证。Agent 可以据此提出假设、修改代码、执行实验,再保留或否定方案。这样,原本依赖资深工程师经验的诊断过程,被转化为模型能够持续执行的工作流。
意义与影响
这项实践显示,AI Agent 的工程价值正在从辅助编码扩展到复杂系统优化。对于推理服务而言,真正的瓶颈可能位于算子实现、显存管理、通信调度、线程并发或服务架构之间,单纯提升代码生成能力并不足够。只有把测试、观测和验证组织成反馈环境,模型的推理能力才可能转化为稳定的工程收益。
不过,材料也没有把这次进展等同于 AI 已能自主创造下一代 AI。目标选择、风险判断和上线边界仍由人掌握。更准确的理解是:GLM 已展示出一种人机协作的新范式——模型优化推理系统,系统再承载模型服务。若这种闭环继续扩展,它可能成为未来更高程度自动化模型研发的重要基础,但距离完全自主的递归自我改进仍需更多验证。
来源:InfoQ 中文
评论
正在确认登录状态……
正在加载评论……