記事一覧へ戻る
モデル評価

MaLiang-Harness、実行可能コードを視覚的な完成度へつなぐ

読了目安 3 分

導入

プログラムによる画像・動画生成は、自然言語だけの一度きりの生成よりも、構図や動きを細かく制御できる可能性があります。しかし、コードが正常に実行されることは完成条件ではありません。対象の位置がずれていたり、指定された外観になっていなかったり、動画の動きや順序が意図と異なったりする場合があります。MaLiang-Harnessは、この「コードは正しいが視覚結果は正しくない」差をProgram-to-Visual(P2V)ギャップと呼び、生成を反復的な作業として扱います。

中核となる仕組み

  • 状態を保持する生成。 Persistent Executable Generation(PEG)は、変化していく視覚プログラムとタスクの文脈を保存します。モデルは毎回ゼロから書き直すのではなく、過去の版を基に修正できます。
  • 編集と結果を結び付ける。 Traceable Generation Process(TGP)は、プログラムの変更とレンダリングされた証拠を対応付けます。どの編集が画面の変化を生んだのかを追跡しやすくする設計です。
  • 現在の版を検証する。 Revision-aware Editing and Verification(REV)は、以前の状態への復元を可能にし、完了前に現在のリビジョンを確認します。過去に動いたコードではなく、いまの結果が要件を満たしているかを見ます。
  • 生成ループを統合する。 計画、実行、レンダリング、視覚的なフィードバック、修正を、複数のレンダリングバックエンドにまたがる一つの流れとして扱います。

評価で分かったこと

研究では、画像向けのMaLiang-IBenchと動画向けのMaLiang-VBenchを用い、生成成功率、視覚品質、計算コストを測定しました。画像タスクでは11のクローズドソース・マルチモーダル大規模モデル、動画タスクでは4モデルが評価されています。提供された要約によると、GPT-6-Astraは両ベンチマークで生成成功率100%を達成しました。すべての品質しきい値を満たした割合は、画像で96.0%、動画で76.9%でした。

この結果は、実行可能なプログラムを安定して出力する能力と、視覚的な要求を満たす能力を分けて考える必要があることを示します。また、一般的な能力スコアが近いモデルでも、プログラムを視覚結果に変換する課題では性能が大きく異なる可能性があります。

意義と限界

MaLiang-Harnessは、単なるコード生成ツールではなく、視覚生成の評価と運用を整理するためのフレームワークです。進行中のプログラム、修正の履歴、レンダリング結果を共通のリビジョン参照に置くことで、モデルが視覚的な誤りを発見し、有効な変更を維持しながら結果を改善できるかを調べやすくします。

この設計は、マルチモーダルモデルの評価方法にも影響を与えます。今後は、コードを書けるかだけでなく、出力を検査し、ずれの原因を特定し、正しい版を修正できるかを測る必要があります。提供資料だけでは、あらゆるレンダラーやオープンモデルへの一般化までは確認できませんが、「生成・検査・修正」を測定可能な工程として扱うための実用的な出発点を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事