1D-Bench:電商設計轉程式基準測試提升 React 前端自動化

設計轉程式(design-to-code)技術能將高保真 UI 設計直接產出可執行的前端程式碼,但缺乏一致的資料集與評估標準。研究團隊推出 1D-Bench 基準,以真實電商工作流程為基礎,提供參考渲染圖與可能含錯誤的中介表示,測試模型在不完美中介資料下的韌性。

電商 React 設計測試

背景與挑戰

設計轉程式(design-to-code)旨在把高保真 UI 設計直接轉換為可執行的前端實作,然而目前缺乏一致的資料集、工具鏈與評估流程,使得不同研究之間難以公平比較。

1D-Bench 基準概述

研究團隊提出 1D-Bench(One‑Day Benchmark),以真實電商工作流程為基礎,每個測試案例提供:

  • 參考渲染圖(ground‑truth rendering)
  • 匯出的中介表示(可能含提取錯誤)

模型同時接受兩者作為輸入,利用中介表示的結構資訊,最終以參考渲染圖作為評估目標,重點在於測試模型對中介缺陷的容錯能力,而非純粹的字面匹配。

任務設定

模型必須在固定的工具鏈下產出可執行的 React 程式碼,並遵守明確的元件層級結構。基準還定義了多輪編輯模式,模型可根據執行回饋對元件層級進行逐步修正。

實驗結果

在商業與開源的多模態模型上進行測試,結果顯示:

  • 多輪迭代編輯普遍提升最終渲染成功率。
  • 視覺相似度亦有明顯改善。

此外,研究進一步以合成修復軌跡與基於強化學習的編輯策略進行後訓練,發現收益有限且波動較大,可能受限於稀疏的終端獎勵與高變異的檔案級更新。

資源釋出

所有資料與腳本已上傳至匿名倉庫,供後續研究使用。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more