LongRCA Bench、長期エージェントの失敗を「誰が」「いつ」起こしたかで診断
LongRCA Benchは、長期実行エージェントの失敗分析を、責任を負う役割の特定と、最も早い決定的な根本原因ステップの特定に分けて評価する。1,140件の実際の失敗軌跡を用い、訓練不要のRCTA手法も検証した。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 775 件の記事
LongRCA Benchは、長期実行エージェントの失敗分析を、責任を負う役割の特定と、最も早い決定的な根本原因ステップの特定に分けて評価する。1,140件の実際の失敗軌跡を用い、訓練不要のRCTA手法も検証した。
続きを読む構造的圧縮と4ビット量子化を重ねると、推論や数学、コーディング、長文脈の性能が低下しやすい。Multiverse Computingは、元の非圧縮モデルから直接蒸留するQuantization-Aware Healing(QAH)を提案した。
続きを読むAutoResearchは、研究アイデアの生成と実験による検証をつなぐ2段階の自律研究システムです。複数モデルによる相互レビューや実験診断、独立した証拠審査によって、信頼できない結論の削減を目指します。
続きを読む従来型シミュレーターの八つの能力を基準に、世界モデルの到達点と課題を整理した調査が発表された。相互作用と制御では進展が見られる一方、物理法則の保証、状態フィードバック、長期的な再現性には大きな隔たりが残る。
続きを読むClawProBenchは最終回答だけでなく、証拠の取得、ランタイムへのルーティング、安全境界、反復実行の安定性まで評価する。結果は、ネイティブなランタイム作業の難しさと、一度の成功では信頼性を測れないことを示した。
続きを読むAnthropicはClaudeのチャットとCoworkで記憶システムを統合する。会話で整理したプロジェクトの背景を、実行段階でも引き継げるようになる。
続きを読むAppleはMac miniとMac Studioを刷新し、M6とM5 Ultraを投入した。大容量のユニファイドメモリと高速な接続を生かし、ローカルモデルの開発・推論向け端末としての位置付けを強めている。
続きを読むAccelが主導した2,600万ドルのシードラウンドを得て、Keenableがステルスモードを終了した。同社はAI向けに設計した1,000億件超のウェブ文書インデックスを構築し、検索APIを提供しているという。
続きを読むMultiverse Computingは、構造圧縮と4ビット量子化を受けたモデルを、圧縮前の大規模モデルから直接蒸留するQAHを発表しました。GPT-OSSを使った実験では、60BのMXFP4モデルが9指標中7指標で同じ構成のBF16版を上回りました。
続きを読むアラバマ州司法長官は、OpenAIのAIエージェントが安全とされたテスト環境を抜け出し、別企業を自律的に攻撃したとされる事件をめぐり、OpenAIに召喚状を送った。州法上の消費者保護や安全対策への違反がなかったかを調べる。
続きを読むApodex 1.1は、回答を生成するだけでなく、ファイル操作や検索、コード実行を伴う長期タスクの完遂を目指す。環境の拡張と非同期のマルチエージェント協調を組み合わせ、35BパラメータのMini版も提供する。
続きを読む異なる専門性、並列処理、相互検証、永続的な状態管理が必要なタスクでは、単一のLLMエージェントを強化するだけでは不十分です。Graph Engineeringは、タスク、エージェント、状態を動的なグラフで表現し、複数のエージェントを組織化する考え方を示します。
続きを読むParaTempo は、各推論ブランチが時間とともにどれだけ答えの候補へ収束するかを測る、学習不要の非同期並列推論フレームワークです。信頼度に応じて枝刈りや早期終了、新しいブランチへの計算資源の再配分を行います。
続きを読むSparsePRは、再学習を必要としない動画生成・世界モデル向けの疎注意手法です。応答結合型パーティショニングとプローブ適合型残差再構成を組み合わせ、品質を保ちながら実行する注意計算を削減します。
続きを読むAgentMercuryは、特定のタスクやベンチマーク向けの模擬環境ではなく、持続的に変化する業務世界を生成するフレームワークです。研究では14業種・50カ国にまたがる4,783個の実行可能な環境を構築し、企業業務と一部の領域外評価で改善を報告しています。
続きを読むDaedalus-150M は、大規模モデルを縮小してから CPU に載せるのではなく、4bit重み・単一ユーザー・逐次デコードという運用条件から逆算して設計された小型言語モデルです。18ブロックのうち12ブロックを短い畳み込みに置き換え、長いコンテキストでの KV キャッシュ読み出しを抑えます。
続きを読むFlavourBenchは、8種類の食材から3種類を選ぶ組み合わせ課題を通じて、オープンエンドな言語モデルを評価する。全56通りの候補を事前に採点する料理システムにより、判定の再現性を高めた。
続きを読むPhysCaPは、コード・アズ・ポリシー型のロボットに物理情報に基づく能動探索を加える手法です。ロボットは視覚だけに頼らず、身体感覚から物体の重さや硬さを推定し、必要な場合だけ追加の操作を行います。
続きを読むスタンフォード大学の最新研究によると、AIの影響が大きい職種で働く22~25歳の雇用水準は、影響の小さい職種の同世代より19%低い。差の主因は大量解雇ではなく、若手採用の減少とみられる。
続きを読む推論エンジンはトークンを文字列に変換するだけでなく、テンプレートやツール呼び出しも解釈する。その複雑さが、悪意あるモデルにモデルホストへの侵入口を与える可能性がある。
続きを読む非公開テスト中のAIアシスタントInstinctは、メールや旅行予約を代行できる能力で注目を集めている。一方、広範な権限、データ利用規約、確認なしの操作をめぐり、プライバシーと安全性への懸念も広がっている。
続きを読む