返回文章列表
代码智能体

LinkedIn 如何用多智能体把 AI 代码审查做成基础设施

阅读约 3 分钟

导语

在大型组织中,代码审查的难点并不是让模型写出更多评论,而是让开发者愿意相信并处理这些评论。LinkedIn 的实践显示,通用 AI 审查工具在规模化场景下容易遇到三类问题:模型盲点带来的遗漏和误报、无法融入组织与代码库约定,以及缺少延迟、质量和故障方面的运营控制。

因此,LinkedIn 将代码审查视为一种生产级工程基础设施,搭建了多智能体 AI 代码审查平台。平台的目标不是追求评论数量,而是提高开发者真正采纳的比例,并尽量在人工审查员介入前提供有价值的发现。

核心做法

  • 让多个审查员独立工作。 不同智能体使用不同模型或推理方式,从各自角度检查代码变更。多个智能体发现同一问题时,这种趋同会成为增强置信度的信号;只有一个智能体提出的问题,则进入额外验证流程,而不是直接发布。
  • 把组织知识纳入审查。 平台支持可组合的定制化规则,覆盖组织级政策、代码库级惯例,以及面向高风险或特定业务场景的上下文规则。这样,审查重点不再只是通用最佳实践,也能反映团队长期形成的隐性知识。
  • 在发布前过滤低价值结果。 表面化的格式建议、已经被修复的问题、不相关反馈,以及不符合代码库约定的建议,都需要经过过滤,避免噪音进入开发者工作流。
  • 按基础设施方式运营。 平台采用基于 Kubernetes 的事件驱动管道,配合持久队列和可水平扩展的工作节点。团队可以持续观察延迟、建议接受率、任务完成率和供应商故障等指标,而不是把模型当成一个无法管理的黑盒。

采纳率比评论数量更重要

LinkedIn 还建立了自动化评估流水线,将 AI 建议与最终合并后的代码进行比较,以判断建议是否被实际采纳。在 1727 个 PR 的 5230 条抽样评论中,90.1% 可以基于合并代码进行高置信度评估,整体建议采纳率为 63.9%。不同问题类型差异明显:逻辑错误为 80%,缺陷修复为 58.1%,重构变更为 43.5%,安全相关修复为 40.6%,并发缺陷则为 100%。这些数据并不意味着所有评论都同样可靠,但说明评估 AI 审查时,最终代码变化比评论数量更有参考价值。

意义与影响

LinkedIn 的方案体现了企业级 AI 编码工具的一种转向:竞争重点从“接入一个更强模型”转向“构建可验证、可定制、可运营的系统”。多智能体并不能自动消除幻觉,也会增加编排、验证和资源管理成本,但它为不同检查能力提供了隔离和交叉验证机制。

对其他组织而言,真正值得借鉴的不是照搬具体架构,而是先定义高价值审查标准,再围绕接受率、误报、延迟和故障恢复建立闭环。Cloudflare 和 Databricks 也在探索不同的 AI 编码编排方式,这表明大规模代码审查尚未形成单一答案。随着 AI 生成代码增加,能否把审查结果稳定地转化为开发者信任,可能比单次模型能力更决定工具的实际价值。

来源:InfoQ 中文

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
LEGO-RL:让编码智能体在原生运行框架中完成强化学习
代码智能体
cctest.ai
代码智能体

LEGO-RL:让编码智能体在原生运行框架中完成强化学习

LEGO-RL试图解决编码智能体强化学习中的一个关键难题:如何在不改动原有Harness控制流的前提下,让真实工具调用、上下文压缩和执行反馈可靠地进入策略优化流程。该框架在三个编码智能体Harness上训练Qwen3.5-35B-A3B,并提升了SWE-bench Verified成绩。

阅读全文