FLUX 3 是德國 Black Forest Labs 推出的最新多模態前沿模型,一次把圖像、影片、音訊與機器人動作預測整合進同一個 Self‑Flow 架構,主打「單一模型就能理解與生成視覺世界」,並成為少數能原生生成長達 20 秒音視頻的生成式 AI。
Black Forest Labs 先前以 FLUX.1、FLUX.2 在圖像生成領域打響名號,FLUX 3 則是這個系列首次正式跨入影片、聲音與動作預測的多模態前沿模型。
官方的核心主張是:FLUX 3 不是幾個模型拼在同一介面,而是「一個 flow matching 骨幹」聯合學習圖像、影片與音訊,讓同一套權重同時處理不同感官形式的資料。
這一代產品線分為四個版本:
FLUX 3 Video:主打影片與聲音生成,目前以 Early Access 邀請制開放。
FLUX 3 Image:專注圖像生成與編輯,預計於影片版後數週內推出。
FLUX 3 Action/Flux-mimic:面向機器人與工業動作預測,已在 Audi 工廠測試。
FLUX 3 Dev:預定於 2026 年稍晚推出的開放權重版本,作為開源與研發基座。
從定位上看,FLUX 3 不是單一「影片模型」,而是 Black Forest Labs 嘗試打造的視覺世界模型雛形:能看、能想、能生成,也能預測機器人行為。
FLUX 3 的技術基礎是 Black Forest Labs 所謂的 Self‑Flow 學習框架,一種自監督流匹配方法,原本用在 FLUX 圖像模型上,如今擴展到多模態。
核心結構可以概括為:
單一流匹配骨幹(flow matching backbone)
在同一骨幹中共同學習圖像、影片與音訊,減少不同模態之間的割裂,讓模型在時序與空間上有一致的表示。
專用編解碼器組合
架構中加入專用的圖像編解碼器、影片編解碼器、音訊編解碼器與動作編解碼器,分別負責將骨幹內表示轉為具體輸出形式。
物理與數位環境的統一理解
官方強調,模型學的不只是像素,而是物體、動作與場景的關係,目標是能同時理解現實物理場景與數位環境內容,為機器人與虛擬世界提供共通語言。
這種統一架構的好處,是讓同一模型可以用影片理解機器人行為,再用音訊描述環境,或用圖像生成延伸場景,所有輸出共享相同內在世界模型。
FLUX 3 最具代表性的突破在於影片與音訊生成,它是目前少數宣稱「單次生成可輸出 20 秒音視頻片段」的模型。
官方與多家技術媒體整理出 FLUX 3 支援的多種影片任務:
文生影片:純文字提示生成影片,附帶同步音訊。
圖生影片:以單張或多張圖像為參考,生成動態場景與連續畫面。
影片轉影片:把輸入影片轉成新風格、新場景或不同運鏡。
影音續寫:在既有影片後延伸情節,或讓音訊繼續延長。
關鍵幀驅動:由若干關鍵影格推導中間過渡畫面與動作。
多鏡頭串聯:生成多個鏡頭並保持角色與場景的一致性。
多語言對話:在影片中生成多語言語音,配合口型與場景。
在長度方面,FLUX 3 Video 單次生成最多可長達 20 秒,官方內部評測常以 10 秒、720p 或 1080p 片段作基準。
在帶聲音的 10 秒 720p 影片人工偏好評測中,FLUX 3 對各競品的勝率如下:
對 Grok Imagine Video:勝率約 69%。
對 Seedance 2.0:勝率約 52%。
對 Gemini Omni Flash:勝率約 52%。
另有報導指出,對 Luma Ray 3.2 的勝率約 93%,對 Runway Gen‑4.5 勝率約 77%。
這些數字來自 BFL 自家人類偏好測試,尚未有第三方大規模基準,但至少呈現了 FLUX 3 在視覺與音訊質量上已站入 SOTA 梯隊。
早期示範影片顯示,FLUX 3 能生成具物理感的情境,例如機甲戰鬥、拉力賽追逐等,搭配相機運鏡控制與多鏡頭連續性,畫質可達 1080p、24 fps。
相對於只做抽象或短秒數影片的模型,FLUX 3 的目標更偏向「能理解場景中的物體關係與動作」,為未來拿來做模擬、機器人訓練與世界模型奠基。
雖然這次的主角是影片與音訊,FLUX 3 的圖像能力仍是產品線的重要一環。
官方與技術文章指出,FLUX 3 Image 模組支援:
多種風格的圖像生成,包含寫實、插畫與概念藝術。
支援寬高比與高解析度設定,適用海報、分鏡與場景設計。
圖像編輯與局部修改,延續 FLUX 系列在細節控制上的優勢。
不過在推出順序上,BFL 採取「先放影片和機器手、畫圖排最後」的策略:FLUX 3 Video 和 Action 已開 Early Access,FLUX 3 Image 則預定未來幾週才上線,開放權重的 FLUX 3 Dev 要等今年稍晚。
這也透露出他們目前更重視影片、音訊與動作預測的前沿戰場,把圖像留給後續,以較穩定節奏釋出。
FLUX 3 最具未來感的一條支線,是機器人動作預測與工業場景應用。
BFL 與 Mimic Robotics 合作推出 Flux‑mimic 影片動作模型,使用 FLUX 3 的架構來預測與生成機器人行為。
該模型已在 Audi 工廠進行生產任務測試,用於工業機器人控制與作業流程優化。
FLUX 3 Action 模組則專注於動作預測與控制,預計優先提供給研究機構與商業合作夥伴,而非大眾開放。
這一方向的意義在於:模型不只是用來創作影片,而是直接介入物理世界的操作層,讓生成式 AI 成為機器人控制與工業流程的一部分。
對世界模型與嵌入式 AI 研究者而言,FLUX 3 提供了一個結合視覺、音訊與動作的多模態骨幹案例。
目前 FLUX 3 並沒有面向全民開放,而是採取分階段 Early Access 策略。
FLUX 3 Video:已開放邀請制搶先體驗,透過合作夥伴如 MindStudio 等平台提供接入,但需申請獲准。
FLUX 3 Image:預計在接下來幾週推出,同樣會有搶先體驗階段。
FLUX 3 Action/Flux‑mimic:先供部分研究機構與工業合作方使用,如 Audi 工廠。
FLUX 3 Dev:開源權重版本計畫在 2026 年稍晚釋出,讓社群能在本地部署與微調。
截至 2026 年 7 月下旬,官方尚未公開 FLUX 3 的標準 API 定價或免費方案,Early Access 使用多半透過合作平台或專案協議進行。
這種策略反映出 BFL 想先把核心功能在受控環境中測試、收集回饋與校準安全機制,再逐步擴大開放範圍。
在生成式影片與多模態戰場上,FLUX 3 的出現把原本偏向圖像的 FLUX 系列推入與 Runway、Luma、Seedance、Grok Imagine Video 以及 Gemini Omni Flash 等模型的直接對決。
從目前偏好測試和技術敘事看,它有幾個明顯特點:
把圖像、影片、音訊與動作預測放進同一架構,而非多模型拼裝。
在 10–20 秒音視頻生成上已達到與主流影片模型相當甚至部分超越的水準。
把工業機器人場景納入多模態模型的一環,試圖將生成式 AI 拉向「物理世界操作系統」。
對創作者與產業分析者而言,FLUX 3 是一個值得深入觀察的節點:
在內容創作端,它為「帶聲音的長秒數影片生成」提供了新的工具候選。
在技術端,它是「世界模型」路線的具體實驗之一,用多模態骨幹測試是否能在同一模型內處理感知、生成與動作。
在產業端,它讓歐洲的研究與初創團隊在生成式影片與機器人控制領域有了與美中巨頭抗衡的前沿樣本。