文章定位:深度技術整理|影片來源:Bilibili:MiniMax H3 一鍵懶人整合包
影片主打「最低 8GB 顯存、15 秒視頻、2K、24FPS、全能參考模式,支援 RTX 30/40/50 系列」的 ComfyUI 整合包。這些賣點背後對應的是近期開放權重的 MiniMax H3 視音頻生成系統,以及 Comfy-Org 對模型檔案、工作流和量化版本的重新打包。
本文不把整合包宣傳語直接當成官方保證,而是將影片內容與 MiniMax 官方 GitHub/Hugging Face 模型卡、ComfyUI 工作流及社群量化方案分開核對。
一、MiniMax H3 是甚麼?
MiniMax H3 是一個全模態生成系統,能理解文字、圖片、影片和音訊等混合輸入,並生成帶原生立體聲音訊的影片。它不是單純的文字轉影片模型,官方規格同時涵蓋文字轉影片、圖片轉影片、首尾幀生成、影片/音訊參考,以及多模態參考生成。
官方模型卡列出的基本輸出規格包括:
- 輸出時長:4–15 秒。
- 輸出幀率:24 FPS。
- 預設較短邊:768 pixels。
- 最高 2K:需要 H3-Regenerate-2K 額外流程。
- 音訊:32 kHz stereo。
- 支援多種畫面比例,包括 16:9、9:16、1:1、21:9 等。
二、影片的「15 秒+2K+24FPS」如何理解?
15 秒是官方基本能力範圍
官方模型卡明確列出 4–15 秒輸出,因此 15 秒不是單純整合包自行拼接的數字。但實際生成時間、顯存使用量和成功率會受解析度、參考輸入數量、採樣設定、量化格式及 GPU 影響。
24 FPS 是輸出規格,不等於生成速度
24 FPS 表示完成後的影片每秒 24 幀。15 秒輸出就是 360 幀;它不表示模型每秒能生成 24 幀,也不代表每張顯卡都能即時預覽。影片生成仍需逐步採樣、VAE 解碼和音訊處理。
2K 不是所有本地工作流的直接輸出
官方方案先由 H3-Base 生成 768p 結果,再透過 H3-Regenerate-2K 以原始上下文和低解析度結果重新生成 2K。官方 README 說明,Regenerate-2K 模組目前尚未完整開源,完整 2K workflow 會結合官方 API。換句話說,ComfyUI 本地整合包能否一鍵本地輸出真正 2K,要看它使用的是哪個節點、模型檔案及工作流,不應只看縮圖標題。
三、兩種核心模式:FL2VA 與 Ref2VA
H3-Base-FL2VA:首尾幀到影片
FL2VA 是 first-and-last-frame-to-video。它可以沒有圖片而使用文字轉影片;有一張圖片時可作首幀或尾幀;有兩張圖片時則可指定首幀和尾幀。這條路線適合控制開場與結尾、做轉場和讓鏡頭在兩個狀態之間變化。
H3-Base-Ref2VA:全能參考模式
Ref2VA 是 reference-to-audio-video,亦即以文字配合多種參考資料生成音畫。官方規格列出:
- 最多 9 張圖片。
- 最多 3 段影片;每段 2–15 秒,總長不超過 15 秒。
- 最多 3 段音訊;音訊不能單獨作輸入,必須伴隨圖片或影片。
- 混合輸入最多 12 個檔案。
它不是簡單的「把圖片當風格參考」,而是要理解不同參考素材之間的關係:人物外觀、場景、鏡頭、動作、聲音、時間順序和目標輸出。輸入越多,控制力可能越高,但顯存、上下文長度和工作流複雜度也會增加。
四、H3 的三模組架構
完整 H3 系統由三個部分組成:
- H3-Context-IR:理解和整理複雜的多模態指令,把參考素材轉換成 H3 容易處理的中間表示。官方強烈建議把它納入生成流程,或依照 Prompting Guidance 自己建立上下文處理。
- H3-Base:根據 Context-IR 生成 768p 的音訊和影片。
- H3-Regenerate-2K:把 768p 結果及原始上下文再次送入 H3,生成細節更高的 2K 版本。
這個架構解釋了為甚麼「ComfyUI 可以本地生成」和「官方完整 2K 流程」不是完全等價的說法。很多整合包主要提供 H3-Base,而 2K 增強可能仍依賴 API 或尚未完整開源的模組。
五、最低 8GB 顯存真的可以嗎?
官方模型卡沒有把「所有 RTX 30/40/50 顯卡最低 8GB」列為通用保證。8GB 通常是特定量化模型、裁剪權重、CPU offload、低解析度、低 batch 或特定工作流的實測門檻。
本地顯存不只放主模型,還要容納:
- H3 diffusion/transformer 權重。
- Qwen3-VL 文字/視覺編碼器。
- 影片及音訊 VAE。
- 中間 activation、KV cache 和採樣工作區。
- 輸入圖片、參考影片、音訊及輸出解碼緩衝。
同一張 8GB 顯卡,文字轉影片可能勉強成功,但加入多張圖片、影片參考、音訊或 15 秒高解析度輸出後便可能 OOM。成功載入也不代表速度理想;部分權重 offload 到 RAM 後,生成速度會明顯下降。
比較實際的判斷方式是:
- 8GB:只先測試量化、低解析度、短片段、低參考數量。
- 12–16GB:較有機會處理單圖 I2V 或簡化 Ref2VA workflow。
- 24GB 以上:更適合較完整的參考模式、較高解析度及減少 offload。
- 系統 RAM:即使有顯卡,也應準備足夠 RAM 存放 offload 權重和 VAE。
因此文章標題應把「8GB 可啟動某配置」和「8GB 可流暢完成全部功能」分開。
六、ComfyUI 整合包通常包含甚麼?
Comfy-Org 的模型頁提供重新打包的 H3 檔案,並列出常見目錄:
models/diffusion_models/:FL2VA/Ref2VA 的 BF16、INT8、FP8 或裁剪版本。models/text_encoders/:Qwen3-VL-32B 的 BF16、INT8 或 NVFP4/AWQ 版本。models/vae/:影片 VAE 及音訊 VAE。- workflow templates:I2V、T2V 和 R2V 工作流。
一鍵整合包通常再加入 ComfyUI、必要 custom nodes、模型下載器、預設 workflow 和啟動腳本。真正要檢查的是它有沒有完整提供這些檔案,還是只包含啟動器而要使用者另外下載數十 GB 模型。
七、RTX 30/40/50 系列的差異
「支援 30、40、50 顯卡」通常是指 NVIDIA CUDA 路線及相關量化 kernel 有對應版本,不代表三代顯卡速度相同。RTX 30 系列的顯存容量差異很大;RTX 40 系列通常有更好的推理效率;RTX 50 系列可能要依 CUDA、PyTorch、ComfyUI custom node 和 NVFP4 支援版本調整。
購買或下載整合包前應確認:
- 是否要求 Windows 原生、WSL2 或 Linux。
- CUDA、PyTorch、Python 及 ComfyUI 版本。
- 是否使用 FP8、INT8、NVFP4 或 ConvRot 特定 kernel。
- 是否需要 NVIDIA Container Toolkit。
- 你的顯卡是否有足夠 VRAM,而不是只看 GPU 世代。
八、建議的本地測試順序
- 先用官方或可信來源的 T2V workflow,確認 ComfyUI 可以載入模型。
- 以 768p、4–5 秒、單一文字 prompt 開始。
- 確認影片和 24 FPS 音訊輸出正常,再增加到 10–15 秒。
- 加入一張圖片測試 I2V,再測 FL2VA 首尾幀。
- 最後才測 Ref2VA,逐步加入人物圖、場景圖、參考影片和音訊。
- 記錄 VRAM 峰值、RAM、生成時間及是否發生 offload/OOM。
- 不要一開始就使用 2K、多參考檔案和最高品質設定。
九、授權及內容風險
MiniMax H3 使用 MiniMax H3 Community License Agreement。下載模型前應閱讀當前 LICENSE、地域及使用資格要求;官方 README 同時提供 license Q&A 及部分地區的申請表。模型和輸入內容也有自動審核,涉及非法、色情或侵權素材可能被阻擋。
此外,ComfyUI 本身、custom nodes、模型權重和整合包啟動器可能各有不同授權。不要因為整合包能下載,就假設生成內容可以無限制商用。人物照片、品牌、電影角色、音樂及參考影片仍可能涉及肖像權、著作權及商標問題。
十、結論
MiniMax H3 的亮點不是單純把影片拉到 15 秒,而是把文字、圖片、影片和音訊放入同一個參考生成流程,再用 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 分工處理。它能輸出 24 FPS、原生立體聲音訊,Ref2VA 也能處理多種參考檔案。
但「8GB 顯存」應理解為特定量化整合包在受限配置下可能啟動,不是所有功能都能流暢運行的保證;「2K」則要確認是本地完整流程還是經官方 API 的 Regenerate-2K。最穩妥的方式是先從 768p、短片、單參考素材開始,逐步驗證顯存和輸出品質。
來源與核實
- Bilibili 影片:MiniMax H3 一鍵懶人整合包
- MiniMax AI:MiniMax-H3 GitHub
- MiniMaxAI/MiniMax-H3 模型卡
- Comfy-Org/MiniMax-H3 模型檔案
- ComfyUI MiniMax H3 教學
- Comfy-Org workflow templates
- MiniMax H3 Community License
查閱日期:2026-08-06
留言
暫時未有公開留言。
登入後可以留言。