HappyWorld-Bench、世界モデルの「対話後も壊れない信頼性」を評価
導入
世界モデルを評価する際、生成された映像や3Dシーンがどれだけ自然に見えるかだけでは不十分です。エージェントが世界を探索し、複数の行動を実行し、以前の場所へ戻り、さらに環境の一部を変更したときにも、同じ状態とルールを保てる必要があります。HappyWorld-Benchは、こうした「対話中の信頼性」に焦点を当てた総合ベンチマークです。
ベンチマークの特徴
- 3つの評価トラック。 動画世界モデル、空間世界モデル、身体性世界モデルを個別に評価しながら、共通の信頼性という観点で比較します。
- 6段階の能力体系。 世界の生成的構築から統合的な世界モデリングまで、W1〜W6の6段階で能力を整理しています。
- 生成後の挙動を検証。 長いロールアウト、再訪、物体配置、シーン編集、複数ステップの行動、物理ルールの変更への応答などを対象にします。
- 自動評価と人間評価を併用。 HappyWorld-Arenaでは人間によるA/B比較を行い、モデル単位のEloレーティングを算出します。自動指標は、行動が正しく実行されたかを補完的に測定します。
- 複数分野をカバー。 1138の動画プロンプト、300の空間シーン、254の身体性テストケースを用い、動画14モデル、空間9システム、身体性8候補を評価しています。
明らかになった課題
3つのトラックすべてで、信頼性の不足が確認されました。動画モデルは、長時間の展開や過去の場面への再訪時に一貫性が低下します。短い出力が自然に見えても、時間をまたいで同じ世界の状態を維持できるとは限りません。
空間モデルでは、指示を理解することと、正確に実行することの間に差があります。素材で報告された最高値は、物体配置の正確度が70.14%、編集実行率が73.33%です。配置や変更を伴うタスクでは、視覚的な印象だけでは見えない実行ミスが残っています。
身体性モデルは、複数ステップの行動中に状態を保持することに苦戦しています。また、行動条件や物理ルールが変更された場合に、要求へ正確に応答することも困難です。ロボットやエージェントでは、初期段階の状態誤認が後続の計画や制御に連鎖する可能性があります。
意義と影響
HappyWorld-Benchは、評価の問いを「生成された世界はリアルに見えるか」から「探索や変更の後も、その世界を信頼して使えるか」へ広げます。画質、状態一貫性、行動応答、介入後の予測可能性を分けて測定し、同じ枠組みで捉える点が重要です。
開発者にとっては、生成品質の改善だけでなく、状態追跡、長期一貫性、行動条件付き予測、ルール変更への頑健性が次の課題になります。ゲーム、シミュレーション、ロボティクス、エージェントの利用者にとっても、印象的なデモと継続的な対話に耐えるシステムを区別する手がかりになります。世界モデルの本当の難しさは、一度もっともらしい世界を作ることではなく、世界が変化してもその論理を守り続けることです。
コメント
ログイン状態を確認中…
コメントを読み込み中…