ElevenLabs:语音转文本

本 ComfyUI 工作流利用 ElevenLabs 模型强大的语音识别能力,将音频或视频文件中的语音内容转录为文本。流程从 'LoadAudio' 或 'RecordAudio' 节点开始,用户可上传现有音频文件或直接在界面录制新音频。音频输入后,'ElevenLabsSpeechToText' 节点会处理音频数据,利用先进的语音识别算法将语音转为准确文本。随后,'PreviewAny' 节点支持用户预览和编辑转录结果,确保文本准确无误。该工作流适用于采访、讲座等语音内容的转录,是内容创作者、研究人员和需要高效语音转文本的专业人士的理想工具。

API

通过代码使用此工作流

每个 Comfy 工作流都是一个 JSON 图。下面的内容就是此工作流的完整数据,ComfyUI 运行时也是如此——你可以从该 URL 获取、放入版本控制,或在 ComfyUI 中加载并逐节点运行。

api_elevenLabs_speech_to_text.json
正在获取工作流 JSON…

使用 Comfy SDK 从 TypeScript 或 Python 运行。相同代码可用于 Comfy Cloud 或你自托管的 ComfyUI——只需更改基础 URL。

// Install (beta)
npm i @comfyorg/sdk

// Run this workflow (TypeScript)
import { Comfy } from "@comfyorg/sdk";

const client = new Comfy({ apiKey: "comfyui-..." });
const wf = await client.workflows.fromFile("workflow_api.json");
const job = await client.run(wf);
await job.getOutputs("<output-node-id>")[0].toFile("output.png");

SDK 需要 API 格式的工作流:在 ComfyUI 中打开此工作流,使用 文件 → 导出工作流(API)。

Comfy Cloud API 访问需要包含 API 密钥的套餐。

常见问题

常见问题

查看所有工作流
Showing 30 of 30 templates