記事一覧へ戻る
AIエージェント

NeoHorse-1、エージェントのルーティングで再帰的自己改善を探る

読了目安 3 分

導入

再帰的自己改善を実現するには、モデルが自分の能力不足を見つけるだけでは不十分です。その情報を、次にどのデータを学習し、どの能力を優先するかという具体的な更新手順へ変換する必要があります。NeoHorse-1は、この問題をエージェント向け事後学習として扱い、推論時のルーティングを学習制御の信号として利用します。

仕組みの要点

  • 異種モデル群を能力別に使い分ける。 ユーザーの各ターンについて必要な能力を予測し、適切なサービス層を選択します。予測、ルーティング結果、その後の対話を一体として記録します。
  • エージェントの文脈を保持する。 学習例には、推論、ツール呼び出し、ハーネスの文脈が交互に含まれます。採用前には構造検証、6次元の意味評価、サブシーン単位のラベル付けを行います。
  • ルーティングをカリキュラムに変換する。 教師ありファインチューニングを3段階に分け、同じ進行をルーティング誘導型オンポリシー蒸留にも適用します。教師モデルは、学生モデル自身が生成した応答をこの順序に沿って監督します。
  • 評価結果で次の学習配分を変える。 能力に基づくデータ配分によって、評価から得た情報を次の学習混合へ反映します。現在のモデルが何を学んだかが、次に何を学ぶかを左右する設計です。

結果と限界

評価対象は、ハーネス型エージェント、ツール利用、コーディング、指示追従を含む11ベンチマークです。論文によれば、事後学習後のマクロ平均は4Bモデルで58.94から64.87へ、9Bモデルで65.60から69.04へ上昇しました。また、事後学習済み4Bモデルと9Bベースモデルの総合的な差も縮小しています。ただし、これはルーティングを用いた学習の有効性を示す結果であり、完全に自律的な自己進化の証明ではありません。

意義と今後の課題

NeoHorse-1の意義は、評価を学習後の静的な確認ではなく、次の訓練を決める動的な信号に位置づけた点にあります。エージェントの性能は文章生成だけでなく、ツールを呼ぶタイミング、ハーネスの規則、多段階の対話を維持する能力にも左右されます。これらを記録すれば、単純な質問応答対より実運用に近い学習資源を作れる可能性があります。

一方で、ルーティング予測、意味評価、ラベルの品質が循環全体を左右します。誤った能力判定は次のデータ配分を偏らせ、蒸留は既存の偏りを引き継ぐ可能性もあります。現段階では、これはハーネスを介した再帰的改善の具体的な初期案と見るのが適切です。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
本番データで見るLLM取引エージェントの実像
AIエージェント
cctest.ai
AIエージェント

本番データで見るLLM取引エージェントの実像

約6カ月にわたる2つの取引エージェント群の記録から、戦略文よりもリスク設定やランキングなどの運用レイヤーが行動を左右することが示された。ボラティリティに応じたポジション調整や、含み益の確保にも大きな課題が残る。

続きを読む
CCTest · Blog
MetaのAIエージェント「Muse」登場、問われるのは実行力より信頼か
AIエージェント
cctest.ai
AIエージェント

MetaのAIエージェント「Muse」登場、問われるのは実行力より信頼か

Metaは、メール送信や旅行予約、買い物まで代行する個人向けAIエージェント「Muse」を発表した。便利さを実現するには広範な個人データへのアクセスが必要で、Metaのプライバシー問題の歴史が普及の壁になりそうだ。

続きを読む
CCTest · Blog
OpenAI、AIエージェントによる研究自動化の進展を公開
AIエージェント
cctest.ai
AIエージェント

OpenAI、AIエージェントによる研究自動化の進展を公開

OpenAIは、社内で「自動化されたAI研究インターン」の段階に到達し、2028年3月までに「自動化されたAI研究者」を目指すと説明しました。ただし、これは完全な再帰的自己改善やAGIの実現を意味するものではありません。

続きを読む