返回文章列表
AI 智能体

LEGO-Anything:让编码智能体把单张图片变成可编辑的3D场景

阅读约 3 分钟

导语

从一张图片恢复3D场景,过去通常意味着生成一个网格、点云或最终渲染结果。但如果目标是让场景能够被继续编辑、检查和查询,那么“结果长什么样”还不够,系统还需要交付一份可执行、可解释的场景描述。AWS团队提出的LEGO-Anything,正是沿着这一思路,将单图重建转化为一个由编码智能体完成的迭代式编程任务。

核心方法:让智能体写场景代码

LEGO-Anything采用Image-to-Code框架。智能体根据输入图片编写Blender代码,执行后查看生成的场景与渲染结果,再根据观察结果修改程序,反复推进重建。最终产物不是不可变的3D文件,而是能够重新执行的场景程序,因此理论上可以进一步检查物体、调整布局或进行任务查询。

这种做法把视觉理解、几何建模和程序调试放进同一个闭环中,也暴露了传统单次生成流程不容易发现的问题:

  • 初始化不足:起始场景和基本结构没有搭好,后续修改很难弥补。
  • 迭代退化:智能体的新一轮编辑可能破坏之前已经较为准确的部分。
  • 自我评估不可靠:智能体对渲染结果的判断并不总能准确反映几何和外观质量。

更细的评测与改进

研究团队发布了LEGO-Bench,包含来自104个室内和室外场景的208张图片。该基准将工件是否有效、可见表面几何是否接近参考,以及渲染外观是否匹配分别计分,避免只用一张相似度分数掩盖不同类型的失败。实验中,GPT-6-astra取得被评估系统中的最佳总体表现,室内得分为53.4%,室外为39.6%;但有效生成场景与准确恢复几何、外观之间仍存在明显差距。

为控制迭代过程,作者还提出无需训练的LEGO-Plugin。它作为智能体运行框架的插件,帮助管理场景构建和修改,在Office子集上提升了全部六个测试模型,整体得分相对增幅最高达到62.7%。这说明,提升智能体的工作流、状态管理和修改纪律,可能与单纯扩大模型能力同样重要。

从重建到可查询的世界表示

LEGO-World进一步检验重建场景能否支持视觉任务。研究者从GPT-6-astra生成的场景中,以确定性查询方式得到目标检测、实例分割和相对深度结果。三项任务都表现出一定能力,但仍明显落后于专门的视觉模型。换言之,当前系统已经展示了“场景程序可作为视觉接口”的潜力,却还不足以成为精确的自然图像表示。

意义与局限

LEGO-Anything的重要价值不只是把图片变成3D,而是尝试建立图像、代码和可交互环境之间的连接。对于机器人仿真、可编辑内容制作以及需要结构化视觉信息的智能体而言,可执行场景比一次性渲染结果更容易复用。不过,单张图片本身存在遮挡和深度歧义,当前编码智能体又容易在多轮修改中累积错误。因此,未来的关键不仅是生成更逼真的几何,还包括更稳健的初始化、可回滚的编辑策略和可信的自动评估。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章