1D-Bench:電商設計轉程式基準測試提升 React 前端自動化
設計轉程式(design-to-code)技術能將高保真 UI 設計直接產出可執行的前端程式碼,但缺乏一致的資料集與評估標準。研究團隊推出 1D-Bench 基準,以真實電商工作流程為基礎,提供參考渲染圖與可能含錯誤的中介表示,測試模型在不完美中介資料下的韌性。
背景與挑戰
設計轉程式(design-to-code)旨在把高保真 UI 設計直接轉換為可執行的前端實作,然而目前缺乏一致的資料集、工具鏈與評估流程,使得不同研究之間難以公平比較。
1D-Bench 基準概述
研究團隊提出 1D-Bench(One‑Day Benchmark),以真實電商工作流程為基礎,每個測試案例提供:
- 參考渲染圖(ground‑truth rendering)
- 匯出的中介表示(可能含提取錯誤)
模型同時接受兩者作為輸入,利用中介表示的結構資訊,最終以參考渲染圖作為評估目標,重點在於測試模型對中介缺陷的容錯能力,而非純粹的字面匹配。
任務設定
模型必須在固定的工具鏈下產出可執行的 React 程式碼,並遵守明確的元件層級結構。基準還定義了多輪編輯模式,模型可根據執行回饋對元件層級進行逐步修正。
實驗結果
在商業與開源的多模態模型上進行測試,結果顯示:
- 多輪迭代編輯普遍提升最終渲染成功率。
- 視覺相似度亦有明顯改善。
此外,研究進一步以合成修復軌跡與基於強化學習的編輯策略進行後訓練,發現收益有限且波動較大,可能受限於稀疏的終端獎勵與高變異的檔案級更新。
資源釋出
所有資料與腳本已上傳至匿名倉庫,供後續研究使用。
延伸閱讀
- DeLM:利用共享驗證上下文提升大型語言模型多代理效能
- CAF-Gen:利用多代理系統提升 CAF 框架論證挖掘的自動化精度
- 結合 OpenPsi 與 MetaMo 的十階段動機管線:對話式 AGI 的雙速決策策略
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。