1.7万次实测揭示:Claude、Codex与Cursor如何选择第三方工具
一项覆盖近1.7万次运行的实验显示,编码代理对第三方服务的选择并不一致,代码库语言、上下文和信息呈现方式都会显著改变结果。
阅读全文PaperCompiler:把论文转代码变成可追溯的仓库级规范
PaperCompiler 针对论文到代码过程中常见的算法简化、隐含假设丢失和跨文件不一致问题,引入了面向整个代码仓库的规范编译流程。该方法通过记录证据来源、约束文件职责与依赖关系,提升生成实现对原论文的忠实度。
阅读全文从训练到搜索:AI 编程系统如何冲上 IOI 金牌线
一项研究展示了面向竞赛编程的完整后训练流程:从题目筛选、合成推理轨迹,到监督微调、强化学习和测试时迭代。其系统在 IOI 2026 评测中取得 535.4 分,超过最高人类选手成绩。
阅读全文Harness-of-Harness:让编程智能体在多轮迭代中持续改进软件
Harness-of-Harness(HoH)不是一个新的代码模型,而是一套运行在既有编程智能体之上的迭代框架。它通过规划、编码、测试和独立评估的循环,让智能体从一次性交付转向持续开发。
阅读全文Claude Code拒读AGENTS.md,Shopify的“禁用令”揭开了什么
围绕一个配置文件格式的争议,正在演变成大型研发组织的工具治理问题。Shopify CEO公开考虑禁用Claude Code后,Anthropic给出的回应并未平息开发者不满。
阅读全文LinkedIn 如何用多智能体把 AI 代码审查做成基础设施
面对超大规模代码变更,LinkedIn 没有简单套用现成 AI 审查工具,而是搭建了一个由多个审查智能体、规则系统和事件驱动架构组成的平台。其重点不只是生成评论,更是控制幻觉、提升信噪比并衡量建议是否真正被采纳。
阅读全文Uncle Bob的AI编程实验:不再逐行审代码,但架构仍离不开人
Uncle Bob正在尝试把软件开发交给AI智能体,把人类角色转向质量约束与架构把关。实践显示,自动化测试能显著降低审查负担,却还不能替代人类对系统结构和业务上下文的判断。
阅读全文LEGO-RL:让编码智能体在原生运行框架中完成强化学习
LEGO-RL试图解决编码智能体强化学习中的一个关键难题:如何在不改动原有Harness控制流的前提下,让真实工具调用、上下文压缩和执行反馈可靠地进入策略优化流程。该框架在三个编码智能体Harness上训练Qwen3.5-35B-A3B,并提升了SWE-bench Verified成绩。
阅读全文Oracle禁止OpenJDK接收AI生成代码:开源治理与企业AI实践的矛盾
Oracle为OpenJDK贡献设下新红线:AI生成的代码不能进入仓库、PR或项目沟通渠道。该政策与Oracle高层近期强调“AI正在写代码”的表态形成鲜明对照。
阅读全文Prime Agent 开源:以自我改进为核心的编程 Agent 实验
Prime Intellect 发布开源编程 Agent Harness Prime Agent,围绕 Recursive Language Model 与 Continual Harness 两个抽象构建。其与 Opus 5 组合在 ARC-AGI 3 上取得 95.5% RHAE Best@1,略高于报告中的人类专家基线。
阅读全文AI 编程普及后,Uber 为什么开始给开发者设预算上限?
Uber 的经验显示,AI 编程工具从“提效实验”进入规模化使用后,真正的挑战不再只是采用率,而是成本、质量与基础设施可持续性的平衡。
阅读全文Frontis-MA1:把机器学习工程变成 AI 自我改进试验场
FrontisAI 提出 OpenMLE 全栈系统,并在其上训练 35B 参数的 Frontis-MA1,让模型围绕代码生成、改进、调试与交叉组合进行长期搜索。论文把“AI 改进 AI”的递归自我改进问题,落到可执行、可验证的机器学习工程任务中。
阅读全文让代码模型不只写对,还要写快:Meta 论文探索面向代码优化的强化学习
这篇论文讨论了一个更难的代码智能目标:不仅让模型生成能通过测试的程序,还要让它学会生成运行更快的程序。研究指出,执行时间作为奖励信号看似直接,实际却会被噪声、稀疏奖励和训练不稳定性放大。
阅读全文Kimi Code 上线 K3-256k:用更低消耗覆盖主流编程场景
Kimi Code 文档显示,Kimi K3 新增 256k 上下文版本 k3-256k,面向日常问答、代码补全和常规开发任务。相比 1M 上下文的 k3,它在 256k 范围内保持同等效果,并显著降低配额消耗。
阅读全文从人工审查到 Agent 审查:AI 让代码评审更快,但未必更好
一项基于 207 个 GitHub 项目、102 万个已评审 Pull Request 的研究显示,AI Agent 参与代码评审后,决策速度明显提升,但质量收益并不稳定。
阅读全文Claude 应用网关上 AWS:AI 编程工具进入企业级治理阶段
亚马逊云科技发布适用于 AWS 的 Claude 应用网关,为 Claude Code 与 Claude Desktop 提供自托管控制平面。它把身份、策略、路由、遥测和成本限额集中到服务端,回应企业大规模使用 AI 编程工具时的治理难题。
阅读全文OpenAI 推出 Codex Micro:为编程 Agent 准备的迷你控制键盘
OpenAI 的首款自有品牌硬件并不是手机或 AI 伴侣设备,而是一款面向 Codex 用户的可编程迷你键盘。它与 Work Louder 合作设计,定价 230 美元,核心用途是让开发者更便捷地控制 AI 编程 agent。
阅读全文Linus力挺AI参与Linux开发:不认同就Fork或离开
围绕AI代码工具是否应进入Linux内核开发,Linus Torvalds给出了强硬回应:Linux不会成为反AI项目。争议焦点不只是代码生成,而是开源社区如何在效率、质量与维护者负担之间重新划线。
阅读全文GitHub 项目如何早期采用智能体编程工具?一项 arXiv 研究给出答案
一项针对 2361 个热门 GitHub 仓库的研究显示,智能体编程工具已经开始进入开源协作流程,但真正高强度使用仍集中在少数项目中。
阅读全文