LinkedIn 如何用多智能体把 AI 代码审查做成基础设施
面对超大规模代码变更,LinkedIn 没有简单套用现成 AI 审查工具,而是搭建了一个由多个审查智能体、规则系统和事件驱动架构组成的平台。其重点不只是生成评论,更是控制幻觉、提升信噪比并衡量建议是否真正被采纳。
阅读全文面对超大规模代码变更,LinkedIn 没有简单套用现成 AI 审查工具,而是搭建了一个由多个审查智能体、规则系统和事件驱动架构组成的平台。其重点不只是生成评论,更是控制幻觉、提升信噪比并衡量建议是否真正被采纳。
阅读全文Uncle Bob正在尝试把软件开发交给AI智能体,把人类角色转向质量约束与架构把关。实践显示,自动化测试能显著降低审查负担,却还不能替代人类对系统结构和业务上下文的判断。
阅读全文LEGO-RL试图解决编码智能体强化学习中的一个关键难题:如何在不改动原有Harness控制流的前提下,让真实工具调用、上下文压缩和执行反馈可靠地进入策略优化流程。该框架在三个编码智能体Harness上训练Qwen3.5-35B-A3B,并提升了SWE-bench Verified成绩。
阅读全文Oracle为OpenJDK贡献设下新红线:AI生成的代码不能进入仓库、PR或项目沟通渠道。该政策与Oracle高层近期强调“AI正在写代码”的表态形成鲜明对照。
阅读全文Prime Intellect 发布开源编程 Agent Harness Prime Agent,围绕 Recursive Language Model 与 Continual Harness 两个抽象构建。其与 Opus 5 组合在 ARC-AGI 3 上取得 95.5% RHAE Best@1,略高于报告中的人类专家基线。
阅读全文Uber 的经验显示,AI 编程工具从“提效实验”进入规模化使用后,真正的挑战不再只是采用率,而是成本、质量与基础设施可持续性的平衡。
阅读全文FrontisAI 提出 OpenMLE 全栈系统,并在其上训练 35B 参数的 Frontis-MA1,让模型围绕代码生成、改进、调试与交叉组合进行长期搜索。论文把“AI 改进 AI”的递归自我改进问题,落到可执行、可验证的机器学习工程任务中。
阅读全文这篇论文讨论了一个更难的代码智能目标:不仅让模型生成能通过测试的程序,还要让它学会生成运行更快的程序。研究指出,执行时间作为奖励信号看似直接,实际却会被噪声、稀疏奖励和训练不稳定性放大。
阅读全文Kimi Code 文档显示,Kimi K3 新增 256k 上下文版本 k3-256k,面向日常问答、代码补全和常规开发任务。相比 1M 上下文的 k3,它在 256k 范围内保持同等效果,并显著降低配额消耗。
阅读全文一项基于 207 个 GitHub 项目、102 万个已评审 Pull Request 的研究显示,AI Agent 参与代码评审后,决策速度明显提升,但质量收益并不稳定。
阅读全文亚马逊云科技发布适用于 AWS 的 Claude 应用网关,为 Claude Code 与 Claude Desktop 提供自托管控制平面。它把身份、策略、路由、遥测和成本限额集中到服务端,回应企业大规模使用 AI 编程工具时的治理难题。
阅读全文OpenAI 的首款自有品牌硬件并不是手机或 AI 伴侣设备,而是一款面向 Codex 用户的可编程迷你键盘。它与 Work Louder 合作设计,定价 230 美元,核心用途是让开发者更便捷地控制 AI 编程 agent。
阅读全文围绕AI代码工具是否应进入Linux内核开发,Linus Torvalds给出了强硬回应:Linux不会成为反AI项目。争议焦点不只是代码生成,而是开源社区如何在效率、质量与维护者负担之间重新划线。
阅读全文一项针对 2361 个热门 GitHub 仓库的研究显示,智能体编程工具已经开始进入开源协作流程,但真正高强度使用仍集中在少数项目中。
阅读全文一篇新 arXiv 论文提出“生成式编译”,尝试把编译器反馈从代码生成后的检查,提前到大模型逐步生成代码的过程中。该方法面向 Rust 这类静态语义严格的语言,希望减少不可编译输出并提升功能正确性。
阅读全文