Skip to main content
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。
Stable Audio 1.0 是Stability AI推出的首个开源音频生成模型。它接收文本提示并生成音频片段。在ComfyUI中,其工作方式类似于标准文生音频管线:CLIP对提示进行编码,K采样器对Latent进行去噪,VAE将其解码为音频。 相关链接

工作流

Stable Audio 1.0:文本转音频

使用 Stable Audio 根据文本提示生成音频。 Stable Audio 1.0 文本转音频工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索 “Stable Audio 1.0:文本转音频”
该工作流使用标准 ComfyUI 节点:无需自定义节点。它加载 Stable Audio 1.0 checkpoint,通过 CLIP 文本编码器(t5-base)编码你的提示,使用 K采样器对 Latent 音频进行 denoise,并通过模型的 VAE 将其解码为音频。 使用方法
  1. 加载 checkpointCheckpointLoaderSimple 节点使用 stable-audio-open-1.0.safetensors
  2. 编写提示:在 CLIPTextEncode 节点中输入你的描述(例如 “heaven church electronic dance music”)
  3. 设置时长:调整 EmptyLatentAudio 节点的长度值(默认 47.6 秒)
  4. 点击运行Ctrl/Cmd + Enter)生成音频。音频将保存到 ComfyUI/output/audio/

模型下载

加载工作流时,ComfyUI 会提供所有缺失模型的下载链接。若要手动设置,请下载以下文件并放入正确的文件夹。

模型

stable-audio-open-1.0.safetensors

2.3GB。放入 models/checkpoints/ 目录下。
将模型放入:

文本编码器

t5-base.safetensors

用于提示词条件的文本编码器。放入 models/text_encoders/ 目录下。
将文本编码器放入:
放置文件后,在 ComfyUI 中按 R 键刷新节点并加载最新模型。