VibeLifeBench:生活エージェントは数週間の変化に耐えられるか
導入
AI アシスタントは、単に質問に答える存在から、ユーザーの代わりに生活上の用事を処理する存在へと期待が広がっています。しかし多くの既存ベンチマークは、短い指示、閉じた環境、明確なゴールを前提にしています。VibeLifeBench が問うのは、タスクが数週間続き、世界がユーザーの追加指示なしに変化し、重要な条件が明文化されていない場合でも、エージェントは信頼できるのかという点です。
主なポイント
- タスクはプロンプトではなく、時計を持つ世界。 VibeLifeBench には、10 の日常生活領域にまたがる 200 の長期タスクが含まれます。各タスクは複数週にわたる脚本化されたタイムラインで、中央値は 29 日です。環境は 22 の模擬サービスと 288 のツールで構成されています。
- 変化は通知されないことがある。 ベンチマークには 1,483 件のサイレントな状態変化が設定されています。たとえば座席が無効になる、航空便が遅延扱いになる、フィッシングメールが受信箱に届く、といった出来事です。これらは明示的な通知として与えられないため、エージェント自身が世界を再確認しなければ発見できません。
- 暗黙の制約も評価対象。 現実の生活支援では、パスポートの残存有効期間、インスリン持ち込みに必要な税関書類、厳格な予算上限など、ユーザーが直接述べない制約が重要になります。VibeLifeBench は、こうした条件を守れたかも採点します。
- 隠れた推論ではなく、残された結果を見る。 評価には 12,261 個の重み付きチェックが使われ、最終状態、行動のタイミング、制約遵守を確認します。モデル内部の思考過程ではなく、実際に環境に残した痕跡が判断材料です。
意義と影響
報告された結果は厳しいものです。7 つのフロンティアモデルはいずれも低スコアで、最良の Claude Opus 5 でも avg@3 は 32.5 にとどまります。また、すべてのモデルでタイムラインの前半から後半にかけて 10〜15 ポイントの低下が見られました。代表的な 20 日間の日本旅行タスクでは、フィッシングメールを拒否した実行は一つもありませんでした。
この結果は、単発のツール利用が上手であることと、生活を長期的に任せられることは別問題だと示しています。実用的な生活エージェントには、いつ行動し、いつ質問し、いつ黙っているべきかを判断する能力が必要です。さらに、誰も知らせてくれない変化を見つけ、初日から最終日まで一貫した計画を維持しなければなりません。タスク、環境、評価フレームワークが公開予定であることから、VibeLifeBench は長期的で能動的なエージェント研究を進める基盤になりそうです。
コメント
ログイン状態を確認中…
コメントを読み込み中…