LinkedInが複数エージェントでAIコードレビューを大規模化
LinkedInは既製のAIレビューツールをそのまま導入するのではなく、複数のレビューエージェントと組織固有のルールを組み合わせた基盤を構築した。狙いはコメント数の最大化ではなく、幻覚や低価値な指摘を抑え、開発者に採用されるレビューを増やすことにある。
続きを読むLinkedInは既製のAIレビューツールをそのまま導入するのではなく、複数のレビューエージェントと組織固有のルールを組み合わせた基盤を構築した。狙いはコメント数の最大化ではなく、幻覚や低価値な指摘を抑え、開発者に採用されるレビューを増やすことにある。
続きを読むUncle Bobは、実装をAIエージェントに任せ、人間は自動化された品質管理とアーキテクチャ判断に集中する開発方法を試している。レビュー負担は減らせるが、システム構造や業務コンテキストの判断まで置き換えることはできない。
続きを読むLEGO-RLは、実際のコーディングエージェントが使うHarnessを大きく改変せず、方策勾配による強化学習へ接続する枠組みです。Qwen3.5-35B-A3Bを3種類のHarnessで学習し、SWE-bench Verifiedのスコアを向上させました。
続きを読むOracleはOpenJDKへの貢献において、AIが生成したコードの提出を禁止した。一方で、LLMを個人的にデバッグやレビュー補助に使うことは認めている。
続きを読むPrime Intellect は、プログラミング向け Agent Harness である Prime Agent をオープンソース公開した。Opus 5 と組み合わせた結果、ARC-AGI 3 で 95.5% RHAE Best@1 に到達し、ARC が示す人間専門家ベースラインをわずかに上回ったとされる。
続きを読むUber の事例は、AI コーディングツールが実験段階を超えると、普及率よりもコスト、品質、インフラ持続性の管理が重要になることを示している。
続きを読むFrontisAI は、AI が AI 開発プロセスを改善する能力を研究するための OpenMLE と、35B パラメータの Frontis-MA1 を発表した。実行可能な MLE タスクを使い、コードの生成・改善・デバッグ・交叉を長期探索に組み込む点が特徴だ。
続きを読むこの論文は、コードモデルに正解するだけでなく実行速度の速いプログラムを生成させるための強化学習を扱っている。実行時間を報酬に加えるだけでは不十分で、計測ノイズや報酬の疎さ、GRPO の不安定性が大きな障害になる。
続きを読むKimi Code のモデル文書で、Kimi K3 の 256k コンテキスト版である `k3-256k` が推奨モデルとして示されました。1M 版より消費を抑えつつ、通常の開発作業を対象にしています。
続きを読む207 件の GitHub プロジェクトと 102 万件のレビュー済み Pull Request を分析した研究は、AI Agent の参加がレビュー判断を速める一方で、品質改善には一貫した効果が見られないと報告している。
続きを読むAWS 向け Claude App Gateway が公開され、Claude Code と Claude Desktop に自社運用型の制御プレーンが提供される。企業は認証、ポリシー、ルーティング、監視、コスト上限をサーバー側で一元管理できる。
続きを読むOpenAIの初の自社ブランドハードウェアは、スマートフォンでもAIコンパニオン端末でもなく、Codexユーザー向けの小型プログラマブルキーボードだった。Work Louderとの協業で設計され、価格は230ドルとされている。
続きを読むLinuxカーネル開発にAIコーディングツールを受け入れるべきかをめぐり、Linus Torvalds氏が明確に賛成の立場を示した。焦点はAIそのものではなく、品質、誤検知、メンテナー負担をどう管理するかに移っている。
続きを読むarXiv の新しい研究は、2361 件の人気 GitHub リポジトリを分析し、エージェント型コーディングツールの利用が広がり始めている一方で、集中的な活用はまだ一部のプロジェクトに限られることを示した。
続きを読むarXiv の新論文は、AI がコードを生成している途中でコンパイラのフィードバックを使う「生成的コンパイル」を提案している。対象は Rust のような静的意味論が厳格な言語で、生成後の修正だけでは遅いという課題に取り組む。
続きを読む