MaLiang-Harness:让视觉生成从“能运行”走向“符合要求”
导语
在代码驱动的图像和视频生成中,模型首先要写出一段可以运行的程序。但“程序运行成功”只是起点:画面可能构图错误、元素外观不符,视频也可能出现运动方向或时序不符合要求的问题。MaLiang-Harness将这种“代码正确、视觉结果不对”的现象概括为“程序到视觉”鸿沟(Program-to-Visual,P2V),并尝试把视觉生成变成一个可持续检查和修订的过程。
核心要点
- 从一次性生成转向持续状态。 MaLiang-Harness提出持久化可执行生成(PEG)状态,用于保存正在演化的视觉程序及其任务上下文。模型不必每次从零开始,而是可以基于已有程序继续修改。
- 让修改与渲染证据对应。 可追踪生成过程(TGP)把具体编辑连接到渲染结果,使系统能够回看某次修改带来了什么视觉变化,而不是只依赖最终输出进行判断。
- 围绕当前版本进行恢复和验证。 修订感知编辑与验证(REV)支持恢复历史版本,并在任务结束前检查当前版本。这一机制的重点不是单纯增加代码,而是确认当前画面是否真正满足要求。
- 协调规划、执行和反馈。 框架面向不同渲染后端,将多模态大模型的规划、程序执行、视觉检查和后续修订组织在同一流程中。
如何评估
研究团队构建了MaLiang-IBench和MaLiang-VBench,并分别考察图像与视频生成任务中的生成成功率、视觉质量及计算成本。研究评估了11个闭源多模态大模型的图像表现,以及其中4个模型的视频表现。摘要显示,GPT-6-Astra在两个基准上都达到了100%的生成成功率;在满足全部质量阈值的任务中,图像占96.0%,视频占76.9%。这些结果同时说明,能够稳定生成可执行程序,并不等同于能够稳定完成严格的视觉要求。
意义与影响
MaLiang-Harness的价值并不只是提供一个代码生成工具,而是提出了一种更适合评估“程序如何变成视觉结果”的实验范式。传统模型榜单通常衡量通用问答或综合能力,但研究发现,得分相近的模型在视觉生成任务上的差异可能很大。因此,未来评估多模态模型时,除了看模型是否会写代码,还需要考察其能否理解渲染结果、定位偏差、保留有效修改,并通过多轮迭代收敛到目标画面。
这一路线也为可解释的视觉创作提供了基础:程序是可检查的,修改过程是可追踪的,结果则能通过渲染证据进行验证。不过,现有材料主要展示了框架设计和基准结果,尚不足以说明它在所有渲染环境或开放模型上的普适性。对开发者而言,MaLiang-Harness更像是一套把“生成—检查—修订”工程化的基础设施,为后续研究视觉反馈、程序编辑和视频时序控制提供了统一接口。
评论
正在确认登录状态……
正在加载评论……