深度分析 Arena‑T2I Hard 基準與依存檢查清單:提升文本生成影像模型忠實度與美感的雙重方案 隨著文本生成影像模型進入實務工作,單一美感評分已不足以衡量忠實度。研究推出Arena‑T2I Hard基準,收錄310筆實際複雜指令,並以依存檢查清單將每項約30個是/否約束分解為DAG,結合美感BT獎勵的正規化訓練,使模型在忠實度與美感上同時提升,此方法在SD3.5‑Medium與FLUX.1‑dev上的MMRB2配對測試中,分別超過單一獎勵與四獎勵基線5%以上。