OpenAI、新音声モードをChatGPTデスクトップ版へ:会話からエージェント操作へ
OpenAIはChatGPTデスクトップアプリに新しいChatGPT Voiceを追加し、ユーザーが音声でChatGPT WorkやCodex、コンピューター操作機能を指示できるようにした。音声は単なる対話手段ではなく、複数ステップの作業を動かすインターフェースになりつつある。
続きを読むOpenAIはChatGPTデスクトップアプリに新しいChatGPT Voiceを追加し、ユーザーが音声でChatGPT WorkやCodex、コンピューター操作機能を指示できるようにした。音声は単なる対話手段ではなく、複数ステップの作業を動かすインターフェースになりつつある。
続きを読むAgentDebugX は、LLM エージェントの失敗を検出・原因特定・修復・再実行のループで扱うオープンソースフレームワークです。エラーが表面化したステップと、実際の原因ステップが異なるという問題に焦点を当てています。
続きを読むDataFlow-Harness は、自然言語の指示と永続的なデータパイプライン成果物の間にあるギャップを埋めようとする研究です。LLM に自由なスクリプトを書かせるのではなく、プラットフォーム固有の DAG を段階的に構築させます。
続きを読むNexForge は、LLM Agent の後学習に必要な実行可能データの不足に取り組むフレームワークです。固定ツールやリポジトリではなく、高レベルな能力要件からタスクと専門家軌跡を合成します。
続きを読むこの研究は、検索エージェントが自分の軌跡から学び直せる訓練環境を作ることに主眼があります。鍵になるのは、正しさを確認できる再現可能な検索・閲覧環境です。
続きを読むAPI を呼び出すエージェントの学習には、大量の高品質な軌跡が必要です。しかし本物の環境を整備するのは重い作業です。本論文は、API 仕様だけを使って LLM に状態付き環境を模擬させる方法を提案します。
続きを読む新しい論文は、交渉中の値を暗号化しても、譲歩の速度や提示額の軌跡、収束パターンから私的制約が推測され得ると指摘する。著者らは、性能を保ちながら推論攻撃を弱める適応的なランダム化方策を提案している。
続きを読むRESOURCE2SKILLは、動画チュートリアル、コードリポジトリ、記事、参考成果物から、ソフトウェアAgentが再利用できる実行可能スキルを抽出する枠組みです。
続きを読むCura 1T は、医療を単なるQAではなく、対話・推論・診断・ツール利用が連動する領域として捉える。能力ごとに狙いを定めて改善する訓練ループが特徴だ。
続きを読むRecursive Harness Self-Improvement(RHI)は、エージェントを動かす外側の足場である harness を、固定された設計ではなく改善対象として扱う。少数の反復で低い推論強度のエージェント性能を高め、推論コストも下げられる可能性を示した。
続きを読むKimi K3 は公開直後にモデル広場へ掲載され、注目を集めました。話題の中心は、巨大なパラメータ数だけでなく、コーディングや長時間タスク、検索、表計算、フロントエンドまで広くこなす点です。
続きを読むVentureBeat の調査によると、AI エージェントは企業内の実システムやデータにアクセスし始めている一方で、ID 管理や隔離、権限制御は追いついていない。回答企業の過半数が、すでに事故またはニアミスを経験している。
続きを読む1Passwordは、Claude向けのブラウザー連携を開始した。ユーザーが承認すれば、AIエージェントは保存済みログイン情報を使えるが、パスワードやMFAコードを直接見ることはないという。
続きを読むarXiv の新しいサーベイは、自己改善型エージェントを経験から能力を蓄積する適応システムとして捉えている。焦点は単一の手法ではなく、モデル、プロンプト、メモリ、ツール、制御ロジックを含む全体構成にある。
続きを読むarXivの論文は、Agentic AI向けの保険フレームワークを提案し、自律性、権限、ガバナンス成熟度、外部依存を引き受け・価格設定に結びつけている。AI保険を単なる損失補填ではなく、運用と規制の仕組みとして捉える点が特徴だ。
続きを読むAi2 は海事向け AI Agent「Shippy」の構築経験を公開した。重要なのは大規模モデルそのものより、ツール、権限、サンドボックス、評価をどう設計するかだ。
続きを読む新しい論文は、固定ベンチマークでの一回限りの改善だけでは Agent 最適化を評価できないと指摘する。新タスクを導入した継続学習設定では、手法間の差が大きく現れた。
続きを読むarXivの論文は、AIエージェントが購買判断を実行する時代に向けて、DVM-HALLモデルとNHAS指標を提案している。人間の好みだけでなく、信頼、委任、実行リスク、検証可能性をブランド選択の要素として扱う点が特徴だ。
続きを読むarXiv 論文が提案する Experience Memory Graph は、失敗からの回復を反省プロンプトではなくグラフ照合として定式化する。テスト時の反復試行を避け、関連する修正経験を一度の実行に使う点が特徴だ。
続きを読むSPyCEは、視覚推論の軌跡を再利用可能なスキルとして蒸留し、方策とスキルライブラリを訓練中に同時に改善する枠組みだ。報酬だけに還元する強化学習や、静的な記憶検索に頼る手法との差別化を狙う。
続きを読むarXiv の新論文は、AIエージェント向け権限システムの提案 21 件を調査し、5 つの商用エージェントとも比較している。焦点は、製品一律の安全設定ではなく、ユーザーごとの権限管理をどう実現するかにある。
続きを読む