LEGO-Anything:コーディングエージェントが1枚の画像を編集可能な3Dシーンへ
導入
単一画像から3Dシーンを復元する研究では、メッシュや点群、あるいは最終的なレンダリング画像を生成する方法が一般的だった。LEGO-Anythingは、復元後もシーンを調べ、編集し、別のタスクから問い合わせられることが重要だと考える。そのため、固定された3D出力ではなく、実行可能なシーンプログラムを生成する。
画像をBlenderコードへ変換
LEGO-AnythingはImage-to-Codeの枠組みを採用する。コーディングエージェントは入力画像を見てBlenderコードを書き、実行結果のシーンとレンダリングを確認する。その後、観察結果に応じてプログラムを修正し、この工程を繰り返す。最終的な成果物は再実行できるプログラムであり、必要に応じて物体や配置を調べたり、シーンを編集したりできる。
この方法は、視覚理解、モデリング、デバッグを一つのループにまとめる一方、エージェント固有の問題も明確にする。研究では主に次の3点が確認された。
- 初期化が弱いこと:最初の構造が不十分だと、後の編集だけで立て直すのは難しい。
- 編集による退行:新しい修正が、以前は正しかった部分を壊す場合がある。
- 自己評価の不安定さ:エージェントのレンダリング評価が、形状や外観の実際の品質を正確に反映しない。
失敗の種類を分ける評価
研究チームは、104の屋内・屋外シーンからなる208枚の画像を収録したLEGO-Benchを導入した。このベンチマークは、成果物が有効に動作するか、可視表面の形状が参照に近いか、レンダリングの外観が一致するかを個別に評価する。これにより、単にファイルを生成できたケースと、画像内容を忠実に復元できたケースを区別できる。
評価対象の中ではGPT-6-astraが最も高い総合結果を示し、屋内で53.4%、屋外で39.6%だった。ただし、有効なシーンを出力することと、形状・外観を正確に復元することの間には、依然として大きな差がある。つまり、実行に成功したことは、復元の正確さを保証しない。
反復構築を制御するプラグイン
LEGO-Pluginは、追加学習なしでエージェントの作業ループを制御するためのハーネスプラグインである。42件のOfficeサブセットでは、6つの評価モデルすべてを改善し、総合スコアの相対的な向上幅は最大62.7%に達した。この結果は、モデル自体の能力だけでなく、状態の管理、変更の制約、フィードバックの整理も成果を左右することを示している。
視覚タスクへの応用と限界
LEGO-Worldでは、GPT-6-astraが復元したシーンから、物体検出、インスタンスセグメンテーション、相対深度を決定的な問い合わせとして取り出した。3つのタスクすべてで一定の能力を示したが、専門のビジョンモデルには大きく及ばない。現時点では、自然画像を完全に表す精密な世界モデルというより、画像とプログラム可能な3D環境をつなぐ有望な中間表現と見るのが適切だろう。
意義
LEGO-Anythingの意義は、画像理解、コード生成、インタラクティブな3D環境を同じ処理ループに置いた点にある。シミュレーションや編集可能なコンテンツ制作、空間情報を必要とするエージェントへの応用が期待できる。一方、単一画像には遮蔽と奥行きの曖昧さがあり、反復編集では誤差も蓄積する。今後は、より強い初期化、変更の巻き戻し、信頼できる自動評価が重要になる。
コメント
ログイン状態を確認中…
コメントを読み込み中…