記事一覧へ戻る
AIエージェント

MintAct:デジタル環境を横断する統合型ビジュアルエージェント

読了目安 3 分

概要

デジタル環境で動くエージェントは、画面上のボタンやウィンドウの位置を見つけるだけでは不十分です。ユーザーの目的に沿って複数の操作を続け、必要に応じて視覚的なツールも使わなければなりません。これまでのシステムは、モバイル、デスクトップ、ウェブなど特定の環境に最適化されることが多く、単一領域では強みを発揮しやすい一方、別の環境への移行やモデルの個別管理が課題になります。MintActは、こうした能力を一つのモデル系列で扱おうとする研究です。

主なポイント

  • 複数能力の統合。 UI grounding、複数ステップのナビゲーション、視覚ツール利用を同じ視覚言語モデル群に組み込みます。
  • 三つのモデル規模。 2B、4B、8Bのバリエーションが示されています。
  • 異種環境の運用。 モバイル、デスクトップ、ウェブ向けのバックエンドで多数のインスタンスを並行稼働させ、軌跡データの収集とオンライン強化学習に利用します。
  • 学習分布を明示的に管理。 ドメインごとのデータ比率を制御し、特定の環境だけが学習を支配することを避けます。
  • 不完全なフィードバックへの対応。 ノイズを含む環境フィードバックや、方策とデータ分布のずれを考慮した非同期学習を設計しています。
  • 報告された性能。 OSWorld-Verifiedで48.9を記録し、複数のベンチマークで同程度の規模の専門モデルに匹敵するとしています。

意義と限界

MintActの重要性は、複数のタスク名を一つのモデルに並べたことだけではありません。実際に難しいのは、多数の環境を起動し続け、異なるプラットフォームから軌跡を集め、環境ごとのデータ量や品質を調整し、その経験をオンライン学習へ安定して戻すことです。研究チームが環境基盤と非同期強化学習を中心的な要素として扱った点は、ビジュアルエージェントの性能向上が認識能力だけでなく、学習ループ全体の信頼性にも左右されることを示しています。

この方式が他のタスクでも機能すれば、端末やアプリごとに別のエージェントを維持する負担を減らせる可能性があります。一方、今回確認できる素材は概要と主要なベンチマーク結果に限られます。各コンポーネントの寄与、学習コスト、環境別の失敗パターン、実運用での安定性までは判断できません。MintActは、汎用的なデジタル操作が解決済みだという証明ではなく、環境横断型の学習基盤を探る有力な一例として評価するのが適切です。

Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
RecreationWorld、ソフトウェア再現でコンピューター操作エージェントを評価
AIエージェント
cctest.ai
AIエージェント

RecreationWorld、ソフトウェア再現でコンピューター操作エージェントを評価

RecreationWorldは、GUI探索、コーディング、実行、視覚的検証を一つの流れにまとめた、ハイブリッド型コンピューター操作エージェント向けの枠組みです。評価結果は、エージェントが静的な画面構造よりも、複雑な操作や計算結果の再現を苦手としていることを示しました。

続きを読む
CCTest · Blog
ファーウェイが探るAgenticコンピューティング:スーパーノードとクラスタ
AIエージェント
cctest.ai
AIエージェント

ファーウェイが探るAgenticコンピューティング:スーパーノードとクラスタ

長時間にわたって動作するAIエージェントは、待ち時間、通信帯域、メモリ使用量に新たな負荷をかける。ファーウェイはスーパーノードとクラスタを軸に、Agenticコンピューティングの開発方式を探っている。

続きを読む
CCTest · Blog
EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる
AIエージェント
cctest.ai
AIエージェント

EvoSkill-GUI、GUIエージェントの技能を実行中に進化させる

ポップアップや読み込み遅延、移動するウィジェットは、事前に固定したGUI操作計画を簡単に崩してしまう。EvoSkill-GUIは追加学習なしで、実行結果を技能の更新につなげる「反省・修正・再利用」ループを提案する。

続きを読む