Skip to main content
Fish Audio 是覆盖文本转语音、声音克隆和语音转文本的语音 AI 服务。在 ComfyUI 中它以四个 partner 节点的形式提供:Text to Speech、Speech to Text、Voice Selector 和 Instant Voice Clone。本页讲解现成的工作流模板和节点连接方式。完整的内联标签参考(情绪、语气、停顿、音素)见 Fish Audio 提示词指南
使用 API 节点需要保证你已经正常登录,并在受许可的网络环境下使用,请参考API 节点总览部分文档来了解使用 API 节点的具体使用要求。
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

在 ComfyUI 中使用 Fish Audio

Fish Audio partner nodes 可以在节点菜单的 partner/audio/Fish Audio 分类下找到。四个节点覆盖完整工作流:
  • Fish Audio Text to Speech:把文本转成语音,输出 AUDIO
  • Fish Audio Speech to Text:把音频转写成文本,输出 textlanguage_codesegments_json
  • Fish Audio Voice Selector:从预设音色中选择,或通过 custom 填入任意 fish.audio 音色模型(即 https://fish.audio/m/<id>/ 中的 ID),输出 voice
  • Fish Audio Instant Voice Clone:从录音克隆私有音色,输出 voice

选择模型

Text to Speech 节点的 model 参数有两个选项:
  • s2.1-pro(推荐):通过 0 到 5 路可扩展的音色输入支持多说话人
  • s1(legacy):接受单个可选音色输入,使用提示词指南中介绍的圆括号情绪标签语法

连接音色

Voice Selector 或 Instant Voice Clone 的 voice 输出连接到 Text to Speech 节点。输入名称取决于所选模型:s2.1-pro(推荐)提供可扩展的 voices 输入(最多 5 路音色),s1 则是单个可选的 voice 输入。只连接一个音色时,节点内部把它作为 reference_id 传递。连接两个或更多时,文本中必须用 @Voice1@Voice2 等标记说话人,且每个已连接的音色都必须在文本中至少出现一次,否则节点会报错。详见提示词指南的多说话人对话

克隆限制

Instant Voice Clone 节点接受 1 到 20 段录音,建议每段 10 到 30 秒,并硬性校验总时长必须小于 270 秒。enhance_audio_quality 选项默认开启。录制技巧见提示词指南的声音克隆质量

账户与价格

这些节点需要登录 ComfyUI 账户,按用量计费。节点上标注的参考价格:文本转语音约 21.45/1M字节文本,语音转文本21.45 / 1M 字节文本,语音转文本 0.00858 / 分钟,声音克隆免费。

可用工作流

三个现成模板覆盖 Fish Audio 的主要流程:文本转语音、声音克隆转语音、语音转文本。可在 ComfyUI 的模板库中打开,或直接在 Comfy Cloud 上运行。声音克隆和语音转文本模板需要 ComfyUI 0.34.0 或更高版本。

Fish Audio:文本转语音

使用预设音色把你的台词生成为语音。按照提示词指南的写法在文本中加入内联标签,然后在 Voice Selector 中换一个预设音色,或连接克隆音色。 Fish Audio:文本转语音工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”Fish Audio: Text to Speech”
输入材料 将该文件上传到对应的 LoadAudio 节点:

fish_audio_example.mp3

LoadAudio 节点 11 · fish_audio_example.mp3

Fish Audio:声音克隆转语音

从一段短录音克隆音色,然后让它朗读任何台词。录制 2 到 3 段、每段 15 到 20 秒的音频,通过 LoadAudio 节点上传(或直接在 RecordAudio 节点中录制),并把 Instant Voice Clone 的输出连接到 Text to Speech 节点。录制技巧见提示词指南的声音克隆质量 Fish Audio:声音克隆转语音工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”Fish Audio: Voice Clone to Speech”
输入材料 将该文件上传到对应的 LoadAudio 节点:

api_fishaudio_voice_clone_tts_fish_audio_example.mp3

LoadAudio 节点 11 · api_fishaudio_voice_clone_tts_fish_audio_example.mp3

Fish Audio:语音转文本

把音频片段转写为文本。自动检测 80 种以上语言,开启 precise_timestamps 后会以 JSON 返回每个片段的起止时间,适合做字幕。 Fish Audio:语音转文本工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON 或在模板库中搜索”Fish Audio: Speech to Text”
输入材料 将该文件上传到对应的 LoadAudio 节点:

fish_audio_example.mp3

LoadAudio 节点 11 · fish_audio_example.mp3

开始使用

  1. 将 ComfyUI 更新到最新版本
  2. 打开上方的工作流模板之一,或从节点菜单的 partner/audio/Fish Audio 分类添加 Fish Audio 节点
  3. 按提示登录 ComfyUI 账户
  4. 按照提示词指南用内联标签编写台词
  5. 运行工作流,预览或保存音频