Agent最適化の効果は積み上がるのか:Terminal-Bench 2.0で継続学習を検証
新しい論文は、固定ベンチマークでの一回限りの改善だけでは Agent 最適化を評価できないと指摘する。新タスクを導入した継続学習設定では、手法間の差が大きく現れた。
続きを読むClaude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ
全 811 件の記事
新しい論文は、固定ベンチマークでの一回限りの改善だけでは Agent 最適化を評価できないと指摘する。新タスクを導入した継続学習設定では、手法間の差が大きく現れた。
続きを読むarXiv の新論文は、垂直運動する倒立振子を安定化する強化学習問題に、リャプノフ特性指数を物理情報に基づく密な報酬として用いる方法を提案している。エージェントは Kapitza 振子として知られる振動安定化だけでなく、支点の揺れを減衰させて厳密な直立状態を実現したと報告されている。
続きを読むarXivの論文は、AIエージェントが購買判断を実行する時代に向けて、DVM-HALLモデルとNHAS指標を提案している。人間の好みだけでなく、信頼、委任、実行リスク、検証可能性をブランド選択の要素として扱う点が特徴だ。
続きを読むMicrosoftは最新の月例セキュリティ更新で、WindowsやOfficeなどにまたがる570件の脆弱性を修正した。同社は、AIの活用が未発見の不具合の洗い出しに寄与したとしている。
続きを読むarXiv に投稿された TRACE は、長いツール利用軌跡に対して密な報酬を与えるための信用割当手法だ。凍結した参照モデルを使い、最終回答の信号を各ツール呼び出しの報酬へ変換する。
続きを読むABAW11 多タスク学習チャレンジに関する arXiv 論文は、表情分類、行動単位検出、価性・覚醒度推定に同じ融合設計を強制すべきではないと示している。
続きを読むarXivの新論文は、経験ベイズ変分オートエンコーダを拡張し、腫瘍体積の経時変化、脱落までの時間、ゲノム共変量を同時に扱う枠組みを提案した。神経ネットワークの柔軟性と半機序的な薬物動態・薬力学モデリングを結びつける試みだ。
続きを読むarXiv 論文は、言語モデリングで提案された Screening 機構を視覚認識へ拡張する VisionScreen を提案している。すべての画像パッチに相対的な重みを与えるのではなく、関連性の低いパッチを明示的に除外する点が特徴だ。
続きを読むarXiv の新論文は、ダンスを連続的な姿勢列としてだけでなく、意味を持つ「原子的な動き」の系列として扱う生成フレームワークを提案している。音楽に合わせた構造計画と動作補完を分ける点が特徴だ。
続きを読むarXiv の新論文は、アスペクトベース感情分析向けに反事実サンプルを生成・検証する CAVE-ABSA を提案している。文全体の極性ではなく、対象アスペクトの感情だけを反転させる点が特徴だ。
続きを読むarXiv に投稿された CF-Net は、映像内の ambivalence/hesitancy(葛藤やためらい)を認識するためのマルチモーダルモデルだ。典型的な表情ではなく、視覚・音声・テキストの微妙な不一致に注目する。
続きを読むDeltaMerge-LowRes は、低リソース言語で新しいタスクに対応する際の高コストな共同微調整を避けるための手法だ。言語 delta とタスク delta を別々に学習し、推論時に合成する。
続きを読む新しい論文は、メタンプルーム製品に含まれるマスク、IME、プルーム長、排出率、不確実性の整合性を調べる PlumeQuant を提案している。公開された数値だけでは、プルーム境界を一意に決められない場合があるという。
続きを読むarXiv に投稿された新論文が、多面体上の Dikin walk の理論的混合時間を改善した。スケール調整した Lee–Sidford 計量を用い、warm start からの指数サンプリングで d^2.25 回の反復境界を示している。
続きを読むarXiv に掲載された論文は、心理学の「ピーク・エンドの法則」に着想を得た動画美学評価フレームワーク Peak-End-Net を提案している。モデルは動画全体を均等に扱うのではなく、印象的な瞬間と終わり方に注目する。
続きを読むarXiv の新論文は、継続的な個人健康支援を目的とするオープンソースのエージェント基盤 HealthClaw を提案している。各質問を単発で扱うのではなく、生活習慣、嗜好、測定値、リスクの変化に応じて私的メモリを更新する点が特徴だ。
続きを読むarXiv に公開された研究は、心臓 PET/MRI の多モーダルデータを扱うための二段階無教師クラスタリング手法を提案した。自動生成されたテキスト報告とブルズアイ図は、心臓画像専門医の所見と一定程度一致した。
続きを読むarXiv に投稿された SIVA-RL は、画像介入の種類ではなく実際の報酬変化に基づいて視覚アライメントの監督信号を割り当てる手法です。視覚言語モデルが画像証拠に根ざして推論することを狙います。
続きを読むarXiv の新論文は、1時間足の外国為替データに対して次のリターン分布を推定する decoder-only Transformer「VAIOM」を提案している。金融観測を入力では連続ベクトルとして扱い、出力では離散的なリターン区間を予測する点が特徴だ。
続きを読むarXiv の新論文は、監査対象の選び方そのものが内部告発者の手がかりになり得る問題を形式化した。著者らは、継続的カウントに基づく私的監査メカニズムを提案している。
続きを読むPyTorch-Triton 3.7 は、コンパイラ Pass、MLIR 方言、DSL 拡張を実行時に読み込む Triton Plugin Extensions を導入した。これにより Meta の TLX は、Triton をフォークせずに利用できるようになる。
続きを読む