该工作流使用 MiniMax H3 将一张静态图像转换为一段短且连贯的视频片段,并生成同步的立体声音频。核心是 MiniMax H3 生成节点(id: 4c314f31-ecda-4b08-ae98-faaba1bf613f),它在一次前向推理中同时合成与场景匹配的视频帧和音频。你通过 LoadImage 提供的图像会确定主体和整体风格;你也可以在 MiniMax H3 节点中可选加入简短的文本引导,用于提示运动、节奏或氛围。
为提升模型运行效率并保持构图一致,工作流会将输入路由到 GetImageSize 和 Use Image Size 组,以保持比例不变。ResolutionSelector 与 ImageScaleToTotalPixels 配合,选择符合 MiniMax H3 推荐百万像素预算的目标尺寸,并满足模型要求的 32 的倍数约束。生成的片段随后由 SaveVideo 写出为单个 MP4,包含视频流(以及在启用时由模型生成的音频),便于快速检查或分享。生成器使用的模型资产包括视频 VAE(minimax_h3_video_vae_fp16.safetensors)和音频 VAE(minimax_h3_audio_vae_fp32.safetensors)。
API
通过代码使用此工作流
每个 Comfy 工作流都是一个 JSON 图。下面的内容就是此工作流的完整数据,ComfyUI 运行时也是如此——你可以从该 URL 获取、放入版本控制,或在 ComfyUI 中加载并逐节点运行。
使用 Comfy SDK 从 TypeScript 或 Python 运行。相同代码可用于 Comfy Cloud 或你自托管的 ComfyUI——只需更改基础 URL。
// Install (beta)
npm i @comfyorg/sdk
// Run this workflow (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
const wf = await client.workflows.fromFile("workflow_api.json");
const job = await client.run(wf);
await job.getOutputs("<output-node-id>")[0].toFile("output.png");SDK 需要 API 格式的工作流:在 ComfyUI 中打开此工作流,使用 文件 → 导出工作流(API)。
常见问题














