Wan2.2-S2V 音訊驅動影片產生

這個 ComfyUI 工作流程會使用 Wan 2.2 S2V(sound-to-video)模型,把單張參考圖片以及一段音訊轉成同步的影片。它透過 UNETLoader、CLIPLoader 以及 VAELoader 載入 Wan 主幹,並用 ModelSamplingSD3 設定正確的取樣排程。你的文字提示由 CLIPTextEncode 編碼,而音訊則由 AudioEncoderLoader 與 AudioEncoderEncode 處理。這些訊號再加上 LoadImage 載入的圖片,一起驅動 WanSoundImageToVideo 合成符合音訊節奏與語句停頓的動作。KSampler 控制步數、CFG 與 seed;VAEDecode 把潛空間轉成影格;CreateVideo 則組裝成最後的片段。

有兩個工程細節讓這個工作流程更適合量產:首幀穩定化與可延伸的時長。「Fix overbaked first frame」群組會用 LatentCut 與 LatentConcat 複製第一個潛空間影格再解碼,並在解碼後丟棄第一個影格,以避免常見 VAE 在第 0 幀出現的「過烤」外觀。要做長片段時,「Video S2V Extend」子圖可用 LatentCut/LatentConcat 以分段方式串接(預設每段 77 幀),讓你能製作到分鐘等級而不把 VRAM 撐爆。此工作流程也支援 lightning 路徑:搭配 Wan 2.2 lightning LoRA 可用 4 步取樣(建議 CFG 約 1.0)。若你更重視品質與穩定性,使用標準路徑約 20 步(CFG 約 6.0)。

API

從程式碼使用此工作流

每個 Comfy 工作流都是一個 JSON 圖。下方的 payload 就是此工作流,與 ComfyUI 執行時完全相同 — 你可以從此 URL 取得、放入版本控制,或在 ComfyUI 載入並逐節點執行。

video_wan2_2_14B_s2v.json
正在取得工作流 JSON…

使用 Comfy SDK 以 TypeScript 或 Python 執行。相同程式碼可用於 Comfy Cloud 或你自架的 ComfyUI — 只需更改 base URL。

// Install (beta)
npm i @comfyorg/sdk

// Run "Wan2.2-S2V 音訊驅動影片產生" (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });

// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("video_wan2_2_14B_s2v_api.json");

const asset = client.assets.fromFile("input.png");
wf.setInput("52", "image", asset); // LoadImage

wf.setInput("6", "text", "your prompt here"); // CLIPTextEncode

const job = await client.run(wf);
await job.getOutputs("113")[0].toFile("output.png"); // SaveVideo

SDK 需使用 API 格式的工作流:請在 ComfyUI 開啟此工作流,並使用 檔案 → 匯出工作流(API)。

Comfy Cloud API 存取需有 API 金鑰的方案。

常見問題

常見問題

查看所有工作流
Showing 30 of 30 templates