記事一覧へ戻る
AIエージェント

SKT:検証済み合成データでAIエージェントのスキル活用を訓練

読了目安 3 分

導入

言語モデル型エージェントは、単に質問に答える存在から、ツールを呼び出し、手順を実行し、過去の知識を再利用するシステムへと進化している。その中で「スキル」は、再利用可能な手続き的知識をエージェントに与える仕組みとして重要になっている。スキルは、特定のツール利用手順であったり、ある種のタスクを解くための流れであったりする。

しかし、スキルを持っていることと、それを正しく使えることは別問題だ。モデルは、どのスキルが必要かを判断し、適切な順序で適用し、複数のスキルを組み合わせ、実行を完了させなければならない。Hugging Face Daily Papersに掲載された「SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation」は、この課題に対して、検証済み合成データによる大規模なスキル利用訓練を提案している。

主要ポイント

  • スキルの保有ではなく利用を訓練する:論文の出発点は、現在のモデルが必要なスキルを与えられていても、それを正しく識別・適用・調整できるとは限らないという問題意識にある。
  • 単一スキルと複数スキルの両方を扱う:SKTは大規模なスキル集合から適切な構成を選び、単一スキルだけでなく複数スキルを必要とするタスクも合成する。
  • 検証と修復を組み込む:生成されたタスクや軌跡は、ルールベースおよびエージェントベースの検証を受ける。問題があればフィードバックに基づいて修復し、最終的に必要な各スキルを十分に使った成功軌跡だけを残す。
  • 一定規模のデータを生成:2,000個の公開スキルを用いて、4,000個のタスクパッケージと27,164本の検証済み実行軌跡を作成した。
  • SkillEvalを構築:同じパイプラインを使いながら、訓練とは分離されたテストプールに基づき、実行可能な評価ベンチマークSkillEvalも用意している。

意義と影響

SKTの重要性は、エージェント開発における失敗の原因をより具体的に捉えている点にある。多くのシステムは、ツールやスキルの数を増やすことに注目しがちだ。しかし実際には、必要な能力が存在していても、エージェントが誤ったスキルを選ぶ、順序を間違える、複数のスキルをうまく連携できない、といった問題が起こる。

この研究は、その課題を高品質な教師データの問題として扱う。SKTで生成した軌跡を用いた教師あり微調整は、複数のモデル、ベンチマーク、エージェントharnessにおいてスキル利用性能を一貫して改善したと報告されている。また、検証に関するアブレーションは品質の高い supervision の重要性を示し、クロスharness評価は効果が単一のインターフェースに閉じないことを示している。さらに、スキルのカバレッジが広がるほど改善が大きくなる傾向も確認されている。

今後のエージェント開発では、単にスキルライブラリを増やすだけでなく、実行可能で検証済みの「スキルを使った経験」をどのように大量に作るかが重要になる。SKTは、そのためのスケーラブルな方法を示す研究といえる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SoL-Pi、長時間動くコーディングエージェントのトークン消費を削減
AIエージェント
cctest.ai
AIエージェント

SoL-Pi、長時間動くコーディングエージェントのトークン消費を削減

SoL-Piは、コーディングエージェントの基盤モデルではなく、その周囲で動くharnessを自動研究ループで改善する手法です。EdgeBenchではPiに近い性能を保ちながら、トークン通信量とAPIコストを大きく削減したと報告しています。

続きを読む
CCTest · Blog
EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる
AIエージェント
cctest.ai
AIエージェント

EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる

ポップアップや読み込み遅延、移動するウィジェットは、事前に固定したGUI操作計画を簡単に崩してしまう。EvoSkill-GUIは追加学習なしで、実行結果を技能の更新につなげる「反省・修正・再利用」ループを提案する。

続きを読む
CCTest · Blog
コード支援から推論基盤の最適化へ、GLMのInfra Agentはどこまで進んだのか
AIエージェント
cctest.ai
AIエージェント

コード支援から推論基盤の最適化へ、GLMのInfra Agentはどこまで進んだのか

智譜は、GLM-5.3を基盤とするInfra Agentが、10万枚を超える国産チップで構成されたクラスタ上でGLM-5.3-Flashの適応、診断、性能改善に関与したと発表しました。チームによれば、エンドツーエンドのスループットは2週間足らずで初期ベースラインの約3倍に達しました。

続きを読む