MiniMax H3 是稀宇科技最新推出的通用全模態生成模型,最大的特點是把文字、圖片、影片與聲音統一到同一套理解與生成架構中,並可原生輸出帶立體聲的音視頻內容,最高支援 15 秒、2K 解析度。它不再只是「影片生成工具」,而是朝著商業級多模態創作與通用助手方向前進的全新模型。
MiniMax H3 的核心定位,是一款「打破任務和模態邊界」的全模態生成模型。
官方的意思很清楚:H3 不再把文生圖、圖生影片、影片編輯、聲音生成視為彼此分離的功能,而是將它們放在同一個多模態上下文中共同理解與處理。
這代表什麼?代表使用者可以同時丟入多張圖片、多段影片與音訊,讓模型讀懂它們之間的角色、動作、場景與聲音關係,再輸出一段連貫的成品。
它的目標不是只做「短片特效」,而是成為廣告、電商、品牌、UI/UX、遊戲與產品設計等場景的商業級創作引擎。
H3 支援文本、圖像、視頻與聲音作為輸入,並能在同一任務中統一理解這些資料。
官方與媒體整理顯示,單次任務最多可支援 9 張圖像、3 段視頻與 3 段音頻,總檔案數不超過 12 個。
這種設計對創作非常關鍵,因為很多商業內容不是單一素材能完成,而是需要參考多個鏡頭、品牌元素、配音與參考圖,H3 正是為這種複合需求而生。
H3 最受關注的賣點之一,是能原生生成雙聲道音訊,且與影片同步輸出。minimaxi+2
這不只是「後製加聲音」,而是模型在生成時就把畫面節奏、動作與音軌關係納入考量,因此更適合需要口型、節拍、音效同步的內容。
在輸出規格上,H3 可直接生成最長 15 秒、2K 解析度影片,並支援多種長寬比,例如 21:9、16:9 與 9:16。
這意味著它既能做電影感橫版短片,也能做社群平台常見的直式內容。
H3 在前期邀測中,特別強調 V2V Motion Transfer,也就是影片到影片的動作遷移能力。
換言之,使用者可以用一段影片的運動方式,套到另一個角色或場景上,達到可控的風格轉換與動作保留。
同時,H3 還支援第一幀、最後一幀等關鍵幀控制與多參考素材條件生成,讓使用者在保留結構的同時,對成品做更精準的編排與修改。
這對廣告、產品展示與品牌影片尤其重要,因為企業往往需要「可控」勝過「純創意發散」。
MiniMax 這次不只強調能力,還很重視成本效率。
官方表示,H3 採用高壓縮 tokenizer 與系統級優化,在同類 2K 影片生成中把成本壓到更低水位。
H3 的 2K 影片輸出並不是靠傳統超分辨率模組「硬補細節」,而是讓基礎模型對自己的低解析輸出做 in-context re-generation。
這種方式的好處是:它不是用猜測填補像素,而是重新在模型內部生成更高解析度版本,因此能保留更多原始資訊與結構一致性。
報導指出,H3 結合自研 H3-VAE,並透過更高效的視頻壓縮方式降低 token 消耗。
MiniMax 官方聲稱,這讓 2K 影片每秒生成成本降到主流模型的三分之一左右,768P 則更低。
為了處理長度、解析度與多模態負載差異極大的任務,MiniMax 也對異構訓練、負載均衡與 GPU 利用率做了系統優化。
這類工程優化看似不如「模型多大」吸睛,但對生成影片這種高算力任務來說,往往才是真正決定能否商用的關鍵。
MiniMax 在官方與媒體報導中反覆強調,H3 是一個商用級模型,而不是只為社群炫技或研究展示而設。
它特別適合以下場景:
廣告與品牌宣傳:需要精準呈現品牌文字、標誌與視覺語言。
電商內容:快速生成產品展示影片、賣點短片與多版本素材。
UI/UX 與產品設計:利用多模態參考素材做概念動畫、流程示意與介面展示。
遊戲與世界觀內容:生成場景動畫、角色動作與宣傳素材。
其中,指令遵循、文字與品牌資訊呈現,以及 V2V 動作遷移,是官方最常拿出來強調的三個能力點。
這說明 H3 的設計邏輯不是只看「畫面漂不漂亮」,而是更重視商業內容最怕出錯的地方:字要對、logo 要準、動作要穩、版本要可控。
根據公開報導,H3 的 2K 影片生成價格約為 0.8 元人民幣/秒,約為同類旗艦模型的三分之一。
如果這個定價在正式商用環境中穩定落地,對需要大量測試版本、快速迭代素材的團隊來說,會有很強吸引力。
這種價格策略的意義不只在「便宜」,而在於它可能改變影片生成的採購方式。
過去企業會把 AI 影片視為高成本試驗工具,但如果 H3 能用更低單價提供 2K 與原生音訊,那它就更有機會走入實際投放與日常內容生產,而不是只停留在 demo 階段。
在競爭面上,H3 被拿來與 Seedance、Runway、Kling 等主流影片模型比較。
媒體報導提到,它在人工偏好評測與編輯能力榜單上都有亮眼表現,甚至有報導稱其在某些視頻編輯項目中排名全球第一。
雖然這些數據多半來自官方或早期測試,仍需更多第三方驗證,但至少說明 H3 已經進入同級競爭的核心圈。
MiniMax 對 H3 採取的是「先上線、後開源」的策略。
官方表示 H3 近期將開源,這讓它不只是商業產品,也可能成為研究與開發社群的重要基座。
目前已知的狀態是:
模型已正式發布。
API 已對外提供,像 Atlas Cloud 這類平台已開始提供接入方式
權重將於近期開放。
如果未來權重真的如期釋出,H3 很可能成為少數兼具商業級能力與社群可再利用性的全模態影片模型。
對研究者、獨立開發者與本地部署團隊來說,這會是非常值得關注的資產。
MiniMax H3 的發布,代表生成式影片模型正在進入新階段。
過去影片模型多半是「文生影片」或「圖生影片」的單一任務工具,而 H3 把圖、文、音、視頻與動作遷移放進同一模型,明顯是在往「通用多模態助手」前進。
這件事對產業有三個重要意義:
創作流程更完整。 從素材收集、風格參考、腳本編排到成片輸出,可以在同一模型中完成。
商業應用更落地。 文字與品牌識別、可控動作遷移、2K 解析度與較低成本,讓模型更接近真實工作需求。
模型競爭轉向通用性。 接下來比的不只是誰能生成更炫的影片,而是誰能同時理解更多模態、保留更多控制、支援更多商業流程。