PolicyGuide、LLMエージェントを単一動作の監視から業務フローの誘導へ
PolicyGuideは組織のポリシーをワークフローグラフに変換し、ユーザー発話の区切りごとにエージェントの状態を検証する。危険な動作を止めるだけでなく、抜け落ちた手順を補いながら適合した経路へ導く仕組みだ。
続きを読むPolicyGuideは組織のポリシーをワークフローグラフに変換し、ユーザー発話の区切りごとにエージェントの状態を検証する。危険な動作を止めるだけでなく、抜け落ちた手順を補いながら適合した経路へ導く仕組みだ。
続きを読むEnvHarnessは、環境をゼロから作り直す代わりに、既存の静的環境をプラグインで再構成する。EnvRiggerは方策の実行軌跡を観察し、弱点に合わせた環境部品を生成して新しいロールアウトで検証する。
続きを読むNvidiaの研究では、モデルの周囲にあるソフトウェア層を調整するだけで、長期タスクの成績が大きく改善しました。記憶管理や監督エージェント、ツール連携がエージェント性能の中核になりつつあります。
続きを読むMeta AI Researchが、Apache 2.0で提供するオープンウェイトモデル「Muse Glimmer」を発表しました。視覚入力、コーディング、多段階のツール利用、障害からの復旧をローカル環境で実現することを狙います。
続きを読む動画生成の競争軸は、印象的な1カットを作れるかどうかから、企画意図を理解し、多数の実用的な動画を一貫した工程で納品できるかへ移りつつある。
続きを読むOpenConnectorは、AIエージェントとアプリ開発者向けのオープンソース接続ゲートウェイです。SaaSの認証、権限管理、API適応、実行監査を共通ランタイムにまとめることを目指します。
続きを読むSlackが、開発タスクごとにAIコーディングエージェントとチームが協働できるSlack Codeを発表した。コード差分の確認やHTMLプレビュー、公開前のフィードバックと承認に対応する。
続きを読むBinanceは、ChatGPTやClaude Code、CursorなどのAIツールを取引・決済・ブロックチェーンサービスにつなぐAgent OSを発表した。エージェントはユーザーに代わって注文できるが、具体的なリスク管理は主にユーザーが担う。
続きを読むジェフリーズのアナリストが、主要なAIエージェント8製品を5種類の実務タスクで比較し、AlibabaのQwen Officeが総合1位となった。評価はモデル性能だけでなく、実行基盤であるHarnessとタスク単価の重要性も示している。
続きを読むAgentic ESOptは、長期的で分岐の多いエージェントの微調整に進化戦略を用いる手法を提案する。推論時に近いメモリ使用量でパラメータを探索し、モデルとコンテキストの同時最適化を目指す。
続きを読む複数のベンチマーク、エージェント基盤、LLMを横断した研究は、Agent Skillsの主な効果が不足した知識の注入ではなく、ノイズの多い実行履歴を手順のアンカーへ変換することにあると示した。一方、スキル数の増加は検索精度を大きく低下させる。
続きを読む新たな研究は、推論やツール利用、コード生成、ワークスペース操作を行うLLMエージェントに、データベースのACID原則を応用する「エージェントトランザクション」を提案した。関連ベンチマークでは既存エージェントを10.6%上回ったと報告している。
続きを読むUI-Mateは、環境に根差した学習基盤と、コンテキスト内の操作デモから学ぶ仕組みを組み合わせたGUIエージェントです。UI-Mate-27BはOSWorld-Verifiedで77.0%を記録したと、提供された論文概要で報告されています。
続きを読むStateMはモデルの重みを変更せず、状態管理や手順の検証を行うランタイムによって長期タスクの信頼性を高める。Terminal-Bench 2.1ではGPT-5.6 Sol xhighで95.3%の生精度を報告した。
続きを読むVibeLifeBench は、短い指示ではなく、数週間続く生活タスクと静かに変化する環境を使って AI エージェントを評価する新しいベンチマークです。
続きを読むOuroboros は、ツール、プロンプト、コンテキスト構築、コア実装までを改善対象にする自己発展型のエージェント基盤だ。論文は複数のベンチマークで高い結果を報告しつつ、自己改変システムにおける安全設計の重要性を強調している。
続きを読むCloudflare は、人間ではなく AI エージェントの利用を前提にしたクラウドホスト型ブラウザ Kitesurf を発表した。一般的な自動化タスクで Chromium より少ない計算資源を使える点を訴求している。
続きを読むAnt Groupは、マルチエージェント協調のための基盤「Avernet」をオープンソース化し、コミュニティ版を公開した。初版はエージェントの発見、合意形成、協働、ガバナンスに重点を置く。
続きを読むVideo-DeepResearch は、静止画像中心のマルチモーダルエージェントを連続動画へ拡張する提案です。視覚ツールを飛ばして検索に逃げる傾向と、内部記憶に頼る問題に正面から取り組んでいます。
続きを読むSkill-α は、Agent のスキル生成を一連の編集プロセスとして扱い、各編集が下流タスクの実行を改善するかどうかで評価する。文書由来と経験由来のスキル生成の両方で、既存のヒューリスティック型・パイプライン型手法を上回った。
続きを読むLongHorizon-Harness は、長期タスクにおける実行履歴とタスク状態を分離し、環境で検証された事実だけで状態を更新する仕組みを提案している。
続きを読む