速報
Boogu-Image-0.1:開源多模態理解與生成模型全新突破
Boogu-Image-0.1 以開源方式提供統一多模態模型,透過提升模型理解、資料品質與訓練管線,結合推論時的代理式擴展,實現高品質文字轉圖、快速推論與雙語渲染。實驗顯示其表現可與領先閉源系統相近,且僅使用 2.08 億張影像與約 40 萬美元的訓練成本。
速報
Boogu-Image-0.1 以開源方式提供統一多模態模型,透過提升模型理解、資料品質與訓練管線,結合推論時的代理式擴展,實現高品質文字轉圖、快速推論與雙語渲染。實驗顯示其表現可與領先閉源系統相近,且僅使用 2.08 億張影像與約 40 萬美元的訓練成本。
深度分析
現有偏好資料以照片為主,無法捕捉設計師在字體、視覺層次、配色與版面等多維判準。TASTE由十位設計師對四款模型在九項準則逐一評分,並以三項統計檢驗確認每個準則含可學習偏好訊號,指出現有評分器與設計師一致度仍不足,呼籲採準則化監督以提升設計生成對齊。