文章定位:深度技術整理|影片來源:Bilibili:WanGP 一鍵本地 AI 影片生成

影片把 WanGP 描述成可本地部署的「AI 視頻生成神器」,支援文字生影片、圖生影片和音訊對口型。這個定位大致正確,但要先分清楚:WanGP 不是單一影片模型,而是 DeepBeepMeep 維護的本地生成工作台。它把多個開放權重的影片、圖片、音訊和語音模型放進同一個網頁介面,並根據硬件挑選量化版本與 workflow。

一、WanGP 是甚麼?

WanGP 的 GitHub repository 名稱是 Wan2GP,README 將它定位為「面向 GPU 資源有限使用者的一站式生成工具」。它提供瀏覽器 UI、模型下載與管理、generation queue、gallery、模板、LoRA 管理、headless batch mode 及 API,不必一開始就自行串接 Python 腳本和 ComfyUI 節點。

它整合的不是只有 Wan 系列;公開 README 列出的範圍包括:

  • 影片:Wan 2.1/2.2 及衍生模型、MiniMax H3、LTX-2、Hunyuan Video、LongCat、Kandinsky、LTXV、MagiHuman 等。
  • 圖片:Qwen Image、Z-Image、Flux 1/2、HiDream 等。
  • 音訊與 TTS:Qwen3 TTS、Ace Step、Omnivoice、Index TTS2、KugelAudio、HearMula、Chatterbox 等。

因此「WanGP 能做甚麼」要看你最後安裝哪個模型與 workflow,而不是把所有能力都歸功於 Wan 本身。

二、文字生影片、圖生影片:背後不是同一條路

文字生影片(T2V)

T2V 由文字描述決定主體、場景、鏡頭、動作、風格和節奏。優點是自由度高;難點是角色一致性與多鏡頭連續性。對本地生成而言,從短片、低解析度開始最穩。

圖生影片(I2V)

I2V 將一張已有構圖、人物或產品圖當作起始條件,再根據 prompt 加入動作和鏡頭。對做內容創作的人,I2V 通常比純 T2V 更容易控制角色外觀、服裝、構圖和品牌視覺。

首尾幀、控制影片與參考素材

不同模型還可能提供首尾幀、控制影片、影像/影片參考、LoRA、姿勢/深度/光流等條件。WanGP 的價值在於把這些素材準備工具和不同模型入口放在一起,但每個功能的品質、顯存需求和授權都取決於實際底層模型。

三、音訊對口型到底由誰完成?

「音訊對口型」不是一般影片生成模型自動保證的功能。典型管線會拆成幾步:

  1. 先生成或準備角色影像/影片。
  2. 準備語音:錄音、TTS 或分離出的對白。
  3. 使用具備音訊條件、talking-head 或 lip-sync 能力的模型/節點,令嘴型與聲音時間軸對齊。
  4. 再加入音訊後製、remux、配樂或聲音替換。

WanGP README 內置的能力包括 speaker diarization、背景噪音/歌曲移除、MMAudio 音軌生成、SeedVC 聲音替換,以及時間和空間 upsampling;這讓它可以組成較完整的「素材 → 影片 → 聲音 → 對齊/後製」流程。不同模型對口型的自然度、長句穩定性、側臉、遮擋和多角色支援會有明顯差異,不能以單一展示片段代表所有情況。

四、為甚麼 WanGP 對低顯存用戶有吸引力?

WanGP 不是讓大型模型不需要顯存,而是提供較多硬件適配方法。README 提到可用 INT8、FP8、GGUF、NVFP4、Nunchaku 等量化 checkpoint,並可按 GPU 架構選擇適合的模型檔案;某些選定模型可在約 6GB VRAM 起步。這個「6GB」應理解為某些模型和設定的最低可能值,不代表所有影片模型、所有解析度或所有特效都適合 6GB。

低顯存策略通常包括:

  • 選擇較小模型或量化 checkpoint。
  • 降低解析度、時長、幀數和 batch size。
  • VAE tiling、model offload、CPU/RAM fallback。
  • 先產生短鏡頭,再用 RIFE、FlashVSR 或後製合成處理。
  • 排隊生成而不是同時開多個高負載任務。

代價是較慢、更多系統 RAM/SSD 壓力及偶發 OOM。對 RTX 3090 Ti 這類 24GB VRAM 卡,WanGP 的量化策略更像是「提高可選模型和並發彈性」,而不是必須為了勉強運行而犧牲品質。

五、對你的單/雙 RTX 3090 Ti 有甚麼意義?

你已有 3090 Ti(24GB VRAM),這個級別比「低顯存入門」更適合跑本地 AI 影片。實際優先順序應是:

  • 單卡:專注完成一條影片 workflow;24GB 足以讓你測試多數量化/中等設定模型,但高解析度、長片、多參考輸入仍可能吃緊。
  • 雙卡:最實用做法是兩個獨立工作位,例如 GPU 0 跑主影片生成,GPU 1 跑圖片起始幀、放大、插幀、TTS 或第二條 queue。
  • 不是自動 48GB:大多數 UI 不會自動把兩張 24GB 卡合併成一張 48GB 卡;模型分片需要底層模型、runtime 和工作流明確支援。
  • 省電:先對 3090 Ti 設 280–320W power limit,再量度影片完成時間與輸出品質;常可明顯降低熱量和電費。

六、WanGP 與 ComfyUI:誰適合你?

項目WanGPComfyUI
開始難度較低,傾向一鍵下載、硬件偵測和表單式操作。較高,要理解節點、模型目錄與 workflow。
模型整合多類模型集中管理,適合快速試不同模型。社群 workflow 和 custom nodes 非常多,細節控制強。
可重現性模板、gallery 和設定擷取較方便。JSON workflow 易於保存、分享和精確比較。
音訊/影片後製內置 queue、音訊後製、gallery 和素材準備工具。通常要自行組節點或加外部工具。
適合情況想先穩定產片、少折騰安裝、管理多模型。想研究模型、精細調參、複製社群 workflow。

最實際的做法不是二選一:WanGP 可當日常生成與模型試用工具;ComfyUI 保留給你需要特定節點、LoRA、控制模型或可分享 workflow 時使用。

七、部署前要知道的三件事

1. 只用官方來源

WanGP README 明確指出官方專案免費在本地使用,且不會收取 license fee、訂閱費或捐款;應使用官方 GitHub deepbeepmeep/Wan2GP 及 README 列出的網站。名稱相近的第三方網站、整合包或 fork 不必然可信。

2. 硬盤空間要預留

影片模型、文字編碼器、VAE、LoRA、快取及輸出檔很快會佔用數十至數百 GB。建議把模型、快取和輸出放在容量足夠的 NVMe SSD,並定期清理不再使用的 checkpoint。

3. 授權依底層模型而變

WanGP 的程式碼與每個被下載的模型不是同一份授權。Wan、MiniMax H3、Hunyuan、LTX、Flux、TTS 模型及 LoRA 都可能有不同的商業使用、地區、署名和內容限制。要公開或商用影片時,需逐一查核模型、音樂、聲音、人物及素材的權利。

八、建議的上手流程

  1. 由官方 WanGP repository 開始,不先下載不明「整合包」。
  2. 以單張 3090 Ti、短影片、低到中解析度建立第一個成功案例。
  3. 先試 I2V:用一張你擁有權利的圖片產生 3–5 秒鏡頭。
  4. 再試 T2V,學習 prompt 對鏡頭、動作和畫面比例的影響。
  5. 加入語音或音樂前,先確認角色與動作穩定。
  6. 需要對口型時,使用擁有授權的角色及語音,並以短句測試。
  7. 記錄模型版本、量化格式、解析度、seed、steps、VRAM 和生成時間,形成自己的可重現模板。

九、結論

WanGP 的強項不是發明一個新的 Wan 基礎模型,而是把多個本地開放生成模型、量化格式、素材準備、音訊後製、queue 和管理介面整合到一個較容易上手的工作台。對想做 AI 影片的人,它能大幅減少在不同工具之間搬運素材的摩擦。

對口型、圖生影片、文生影片都能成為工作流的一部分,但品質仍取決於所選底層模型、輸入素材、顯存、解析度與後製。對你現有的 3090 Ti,最值得的策略是先以單卡建立穩定 template,再讓第二張卡處理起始圖、放大、插幀、TTS 或第二條生成隊列。

來源與核實

查閱日期:2026-08-06