Black Forest Labs 推出 FLUX 3:多模態流模型在影片生成領域大勝對手
Black Forest Labs 發表 FLUX 3 多模態流模型,支援圖片與 20 秒含音訊影片生成。早期測試中,FLUX 3 在偏好度上以 93% 勝過 Luma Ray 3.2、77% 勝過 Runway Gen-4.5、69% 勝過 Grok Imagine Video。模型採用流匹配架構,並推出機器人動作模仿模型 FLUX-mimic。
Black Forest Labs 發表 FLUX 3:多模態流模型全面升級
Black Forest Labs 正式推出 FLUX 3,這是一款主打多模態流模型的視覺生成系統,能同時產出圖片與長達 20 秒、內含原生音訊的影片。根據官方公布的早期測試數據,FLUX 3 在 10 秒 720p 文字轉影片的偏好測試中表現亮眼,以 93% 的比率勝過 Luma Ray 3.2、77% 勝過 Runway Gen-4.5、69% 勝過 Grok Imagine Video,同時也擊敗 Kling v3 Pro、Seedance 2.0 與 Gemini Omni Flash 等競爭產品。
技術亮點:流匹配架構與多模態整合
FLUX 3 採用流匹配(Flow Matching)作為核心架構,不同於傳統擴散模型,流匹配透過學習從雜訊到資料的連續轉換路徑,在生成品質與速度上取得更好平衡。此模型將圖片與影片生成統一在同一框架內,並首度加入原生音訊生成能力,使輸出更加完整。Black Forest Labs 也同步推出 FLUX-mimic,這是一個專為機器人動作模仿設計的模型,能將影片生成技術延伸至機器人控制領域。
現階段僅限合作夥伴使用
目前 FLUX 3 尚未全面開放,僅限特定合作夥伴與測試者使用。Black Forest Labs 表示,未來將逐步擴大釋出範圍。社群中已有部分開發者進行初步測試,普遍認為 FLUX 3 的生成品質優於 LTX,但部分意見指出其表現仍不及 Seedance 2.0,顯示模型仍有改進空間。
對 AI 生成生態的意義
FLUX 3 的推出代表多模態生成模型正快速進化,從單純的圖片生成擴展到含音訊的影片生成,甚至觸及機器人領域。流匹配架構的採用也反映業界正嘗試超越傳統擴散模型,尋找更高效的生成方式。對開發者而言,FLUX 3 若後續開放 API 或模型權重,將可能改變現有影片生成工具的競爭格局。
原始來源:SST/Latent.Space
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。