此工作流程示範在 ComfyUI 中使用 MiniMax H3 進行 reference-to-video 生成:你提供一段文字提示、最多九張參考圖片、三段短參考影片,以及三段音訊片段,模型會一次產出一個含原生立體聲音訊的 MP4。核心是 MiniMaxH3ReferenceToVideo 節點,它會把多模態脈絡(身分、動作、相機、風格、聲音)與你的提示融合,合成一段約 15 秒、最高 2K 解析度、24fps 的影片。
在底層機制上,「Switch Model and Settings」群組會透過 UNETLoader 與 CLIPLoader 載入 MiniMax H3 的模型堆疊;KSamplerSelect、BasicScheduler、SamplerCustomAdvanced 與 BasicGuider 管理取樣行為(由 RandomNoise 設定種子以便重現)。ResolutionSelector 設定符合 32 倍數的 16:9 尺寸,ComfyMathExpression 搭配 PrimitiveFloat 計算例如由時長與 fps 推得的影格數。生成後,VAELoader 提供影片與音訊的 VAE;VAEDecode 從影片潛空間重建影格,VAEDecodeAudio 重建立體聲波形。CreateVideo 會把影格與音訊封裝在一起,SaveVideo 輸出最終 MP4。這讓工作流程能用於角色一致的動畫、以風格引導的動作,以及含音訊同步的內容製作,而不需要另外做 TTS 或音效設計。
API
從程式碼使用此工作流
每個 Comfy 工作流都是一個 JSON 圖。下方的 payload 就是此工作流,與 ComfyUI 執行時完全相同 — 你可以從此 URL 取得、放入版本控制,或在 ComfyUI 載入並逐節點執行。
使用 Comfy SDK 以 TypeScript 或 Python 執行。相同程式碼可用於 Comfy Cloud 或你自架的 ComfyUI — 只需更改 base URL。
// Install (beta)
npm i @comfyorg/sdk
// Run this workflow (TypeScript)
import { Comfy } from "@comfyorg/sdk";
const client = new Comfy({ apiKey: "comfyui-..." });
const wf = await client.workflows.fromFile("workflow_api.json");
const job = await client.run(wf);
await job.getOutputs("<output-node-id>")[0].toFile("output.png");SDK 需使用 API 格式的工作流:請在 ComfyUI 開啟此工作流,並使用 檔案 → 匯出工作流(API)。
常見問題














