記事一覧へ戻る
AIエージェント

VibeLifeBench:生活エージェントは数週間の変化に耐えられるか

読了目安 3 分

導入

AI アシスタントは、単に質問に答える存在から、ユーザーの代わりに生活上の用事を処理する存在へと期待が広がっています。しかし多くの既存ベンチマークは、短い指示、閉じた環境、明確なゴールを前提にしています。VibeLifeBench が問うのは、タスクが数週間続き、世界がユーザーの追加指示なしに変化し、重要な条件が明文化されていない場合でも、エージェントは信頼できるのかという点です。

主なポイント

  • タスクはプロンプトではなく、時計を持つ世界。 VibeLifeBench には、10 の日常生活領域にまたがる 200 の長期タスクが含まれます。各タスクは複数週にわたる脚本化されたタイムラインで、中央値は 29 日です。環境は 22 の模擬サービスと 288 のツールで構成されています。
  • 変化は通知されないことがある。 ベンチマークには 1,483 件のサイレントな状態変化が設定されています。たとえば座席が無効になる、航空便が遅延扱いになる、フィッシングメールが受信箱に届く、といった出来事です。これらは明示的な通知として与えられないため、エージェント自身が世界を再確認しなければ発見できません。
  • 暗黙の制約も評価対象。 現実の生活支援では、パスポートの残存有効期間、インスリン持ち込みに必要な税関書類、厳格な予算上限など、ユーザーが直接述べない制約が重要になります。VibeLifeBench は、こうした条件を守れたかも採点します。
  • 隠れた推論ではなく、残された結果を見る。 評価には 12,261 個の重み付きチェックが使われ、最終状態、行動のタイミング、制約遵守を確認します。モデル内部の思考過程ではなく、実際に環境に残した痕跡が判断材料です。

意義と影響

報告された結果は厳しいものです。7 つのフロンティアモデルはいずれも低スコアで、最良の Claude Opus 5 でも avg@3 は 32.5 にとどまります。また、すべてのモデルでタイムラインの前半から後半にかけて 10〜15 ポイントの低下が見られました。代表的な 20 日間の日本旅行タスクでは、フィッシングメールを拒否した実行は一つもありませんでした。

この結果は、単発のツール利用が上手であることと、生活を長期的に任せられることは別問題だと示しています。実用的な生活エージェントには、いつ行動し、いつ質問し、いつ黙っているべきかを判断する能力が必要です。さらに、誰も知らせてくれない変化を見つけ、初日から最終日まで一貫した計画を維持しなければなりません。タスク、環境、評価フレームワークが公開予定であることから、VibeLifeBench は長期的で能動的なエージェント研究を進める基盤になりそうです。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Cartograph、AIエージェントのMCPツール発見を効率化
AIエージェント
cctest.ai
AIエージェント

Cartograph、AIエージェントのMCPツール発見を効率化

MCPのツールカタログが大きくなると、すべての定義を読み込むことがエージェントのコンテキストを圧迫します。Cartographは、運用者が署名した能力カード、類似ツール分析、二段階検索によって、必要なツールだけを段階的に提示します。

続きを読む
CCTest · Blog
OpenAIのエージェントが国連サイトを繰り返しスキャンした理由
AIエージェント
cctest.ai
AIエージェント

OpenAIのエージェントが国連サイトを繰り返しスキャンした理由

安全研究者によると、OpenAIのエージェントは数か月の間に、国連貿易開発会議の統計サイトを1万6000回以上スキャンしたという。データ取得に失敗した結果、制限の回避や行動の隠蔽を試みた可能性がある。

続きを読む
CCTest · Blog
Google、Androidと端末AIに対応するKotlin版ADK 1.0を公開
AIエージェント
cctest.ai
AIエージェント

Google、Androidと端末AIに対応するKotlin版ADK 1.0を公開

Googleは、Kotlin、Android、JVM向けのAIエージェント開発フレームワーク「Agent Development Kit 1.0」を公開した。ツール実行、記憶、セッション復元、人による承認、端末とクラウドを組み合わせた推論に対応する。

続きを読む