記事一覧へ戻る
AIエージェント

VibeLifeBench:生活エージェントは数週間の変化に耐えられるか

読了目安 3 分

導入

AI アシスタントは、単に質問に答える存在から、ユーザーの代わりに生活上の用事を処理する存在へと期待が広がっています。しかし多くの既存ベンチマークは、短い指示、閉じた環境、明確なゴールを前提にしています。VibeLifeBench が問うのは、タスクが数週間続き、世界がユーザーの追加指示なしに変化し、重要な条件が明文化されていない場合でも、エージェントは信頼できるのかという点です。

主なポイント

  • タスクはプロンプトではなく、時計を持つ世界。 VibeLifeBench には、10 の日常生活領域にまたがる 200 の長期タスクが含まれます。各タスクは複数週にわたる脚本化されたタイムラインで、中央値は 29 日です。環境は 22 の模擬サービスと 288 のツールで構成されています。
  • 変化は通知されないことがある。 ベンチマークには 1,483 件のサイレントな状態変化が設定されています。たとえば座席が無効になる、航空便が遅延扱いになる、フィッシングメールが受信箱に届く、といった出来事です。これらは明示的な通知として与えられないため、エージェント自身が世界を再確認しなければ発見できません。
  • 暗黙の制約も評価対象。 現実の生活支援では、パスポートの残存有効期間、インスリン持ち込みに必要な税関書類、厳格な予算上限など、ユーザーが直接述べない制約が重要になります。VibeLifeBench は、こうした条件を守れたかも採点します。
  • 隠れた推論ではなく、残された結果を見る。 評価には 12,261 個の重み付きチェックが使われ、最終状態、行動のタイミング、制約遵守を確認します。モデル内部の思考過程ではなく、実際に環境に残した痕跡が判断材料です。

意義と影響

報告された結果は厳しいものです。7 つのフロンティアモデルはいずれも低スコアで、最良の Claude Opus 5 でも avg@3 は 32.5 にとどまります。また、すべてのモデルでタイムラインの前半から後半にかけて 10〜15 ポイントの低下が見られました。代表的な 20 日間の日本旅行タスクでは、フィッシングメールを拒否した実行は一つもありませんでした。

この結果は、単発のツール利用が上手であることと、生活を長期的に任せられることは別問題だと示しています。実用的な生活エージェントには、いつ行動し、いつ質問し、いつ黙っているべきかを判断する能力が必要です。さらに、誰も知らせてくれない変化を見つけ、初日から最終日まで一貫した計画を維持しなければなりません。タスク、環境、評価フレームワークが公開予定であることから、VibeLifeBench は長期的で能動的なエージェント研究を進める基盤になりそうです。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Ouroboros:レビュー済みコミットで自ら進化するコーディングエージェント
AIエージェント
cctest.ai
AIエージェント

Ouroboros:レビュー済みコミットで自ら進化するコーディングエージェント

Ouroboros は、ツール、プロンプト、コンテキスト構築、コア実装までを改善対象にする自己発展型のエージェント基盤だ。論文は複数のベンチマークで高い結果を報告しつつ、自己改変システムにおける安全設計の重要性を強調している。

続きを読む
CCTest · Blog
Cloudflare、AIエージェント向けクラウドブラウザ Kitesurf を発表
AIエージェント
cctest.ai
AIエージェント

Cloudflare、AIエージェント向けクラウドブラウザ Kitesurf を発表

Cloudflare は、人間ではなく AI エージェントの利用を前提にしたクラウドホスト型ブラウザ Kitesurf を発表した。一般的な自動化タスクで Chromium より少ない計算資源を使える点を訴求している。

続きを読む
CCTest · Blog
Ant GroupがAvernetをオープンソース化、マルチエージェント協調を組織化へ
AIエージェント
cctest.ai
AIエージェント

Ant GroupがAvernetをオープンソース化、マルチエージェント協調を組織化へ

Ant Groupは、マルチエージェント協調のための基盤「Avernet」をオープンソース化し、コミュニティ版を公開した。初版はエージェントの発見、合意形成、協働、ガバナンスに重点を置く。

続きを読む