返回文章列表
模型评测

从“像文字”到“写对文字”:UltraText Bench重新审视图像生成的文本能力

阅读约 3 分钟

导语

让图像生成模型写出几个短单词,已经不再是最具挑战的任务。但当画面同时包含海报标题、路牌、菜单、包装说明和多个信息栏时,模型是否还能把每一段文字写对、放对并保持清晰,仍然是一个难题。来自西湖大学团队的 UltraText Bench,正是为测量这种“密集视觉文本”能力而设计的双语基准。

核心要点

  • 规模与覆盖面:基准包含432条提示词,覆盖24类真实世界场景,并设置三个难度等级。英文和中文样本数量均等,避免评测只反映单一语言的表现。
  • 从单点文字转向多区域任务:每条经过人工审核的提示词,指定4至12个文本区域,同时给出文本内容、位置和视觉属性等结构化参考。模型需要在一次生成中处理多段文字,而不是只完成一个醒目标题。
  • 拆分不同能力维度:研究使用Q-Judger视觉语言模型,对生成结果进行文字保真度、文字清晰度、空间质量和场景质量评估。这样的拆分有助于区分“看起来像字”和“确实写对了字”。
  • 清晰不等于准确:在报告的设置下,Z-Image-Turbo相比Z-Image-Base的清晰度高3.81分,但文字保真度低14.76分。这说明更易辨认的视觉效果,可能伴随更严重的内容偏差。
  • 负载增加会放大缺陷:Qwen-Image-2512在英文任务上的综合得分,从最低难度L1的86.50下降至最高难度L3的42.86。文本数量和场景复杂度提升后,模型的持续遵循能力明显承压。

这项基准的意义

UltraText Bench的价值,不只是增加了一组测试题,而是把图像生成中的文字问题从“局部识别”推进到“多约束执行”。真实设计任务往往要求模型同时遵守文案、位置、层级、风格和整体构图;若只检查一处标题是否清晰,就很容易高估模型的实际可用性。

它还提醒我们,单一总分并不足以描述视觉文本能力。一个模型可能生成了非常锐利、像印刷品一样的字形,却把关键单词、数字或句子改写了;另一个模型也许内容更接近提示词,但布局和可读性较差。将这些维度分开,能为模型选择、训练优化和后续数据构建提供更具体的依据。

研究还邀请10名参与者对自动评分进行人工评估,这为Q-Judger结果提供了额外参照。不过,现有材料主要展示基准设计和部分对比结果,不能据此断言某个模型在所有语言、场景或应用中都绝对领先。对开发者而言,更值得关注的是:未来的图像生成评测需要把长文本、多区域、双语和难度递增纳入常规测试。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章