
该 ComfyUI 工作流使用 Wan 2.2 S2V(sound-to-video)模型,将一张参考图与一段音频合成为同步视频。它通过 UNETLoader、CLIPLoader 和 VAELoader 加载 Wan 主干,并用 ModelSamplingSD3 设置正确的采样调度。文本提示词由 CLIPTextEncode 编码;音频则由 AudioEncoderLoader 与 AudioEncoderEncode 处理。随后,这些信号与 LoadImage 提供的图像一起驱动 WanSoundImageToVideo 生成运动,使动作节奏与音频的律动和停顿相匹配。KSampler 控制步数、CFG 与种子;VAEDecode 将 latent 解码为帧;CreateVideo 组装最终视频片段。
两点工程细节让它更适合实际制作:首帧稳定与可扩展时长。Fix overbaked first frame 分组使用 LatentCut 与 LatentConcat 在解码前复制初始 latent 帧,然后在解码后丢弃第一帧,以避免常见的 VAE 在第 0 帧出现“过烘焙/发白”外观。对于长视频,Video S2V Extend 子工作流可将片段按块串联(默认 77 帧一段),通过 LatentCut/LatentConcat 逐段追加,从而在不爆 VRAM 的情况下构建分钟级视频。工作流也支持 lightning 路径:搭配 Wan 2.2 lightning LoRA 可用 4 步采样(建议 CFG ~1.0)。若更偏向质量与稳定性,可使用标准路径约 20 步(CFG ~6.0)。
API
通过代码使用此工作流
每个 Comfy 工作流都是一个 JSON 图。下面的内容就是此工作流的完整数据,ComfyUI 运行时也是如此——你可以从该 URL 获取、放入版本控制,或在 ComfyUI 中加载并逐节点运行。
使用 Comfy SDK 从 TypeScript 或 Python 运行。相同代码可用于 Comfy Cloud 或你自托管的 ComfyUI——只需更改基础 URL。
// Install (beta)
npm i @comfyorg/sdk
// Run "Wan2.2-S2V 音频驱动视频生成" (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
// This workflow, exported in API format (see note below)
const wf = await client.workflows.fromFile("video_wan2_2_14B_s2v_api.json");
const asset = client.assets.fromFile("input.png");
wf.setInput("52", "image", asset); // LoadImage
wf.setInput("6", "text", "your prompt here"); // CLIPTextEncode
const job = await client.run(wf);
await job.getOutputs("113")[0].toFile("output.png"); // SaveVideoSDK 需要 API 格式的工作流:在 ComfyUI 中打开此工作流,使用 文件 → 导出工作流(API)。
常见问题













