Boogu-Image-0.1:開源多模態理解與生成模型全新突破
Boogu-Image-0.1 以開源方式提供統一多模態模型,透過提升模型理解、資料品質與訓練管線,結合推論時的代理式擴展,實現高品質文字轉圖、快速推論與雙語渲染。實驗顯示其表現可與領先閉源系統相近,且僅使用 2.08 億張影像與約 40 萬美元的訓練成本。
模型概述
Boogu-Image-0.1 為一套開源的統一多模態理解與生成模型家族,分為 Base、Turbo、Edit 與 Edit‑Turbo 四個變體,支援高品質文字生成圖像、快速推論、指令式編輯以及中英雙語文字渲染。
技術亮點
研究團隊透過三大方向提升效能:1. 針對模型理解的結構性改進;2. 提升訓練資料的品質與多樣性;3. 優化訓練流程與管線,同時在推論階段加入代理式擴展(agentic scaling),即使在受限算力下仍能保持優異表現。
實驗結果
在多項標準基準測試中,Boogu-Image-0.1 的表現持續與其他開源模型持平或超越,且與領先的閉源系統差距顯著縮小。值得注意的是,模型僅使用 2.08 億張獨特影像,理論訓練成本約為 40 萬美元。
開源與資源釋出
團隊以 Apache 2.0 授權釋出模型權重、程式碼與訓練腳本,鼓勵研究社群共同推進統一多模態理解與生成的開放生態。相關資源可於以下連結取得:
https://github.com/Boogu-Project/Boogu-Image延伸閱讀
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。