> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# Fish Audio：文本转语音、声音克隆与语音转文本

> 在 ComfyUI 中运行 Fish Audio TTS、声音克隆和语音转文本工作流：模板教程、节点连接与 Cloud 链接

Fish Audio 是覆盖文本转语音、声音克隆和语音转文本的语音 AI 服务。在 ComfyUI 中它以四个 partner 节点的形式提供：Text to Speech、Speech to Text、Voice Selector 和 Instant Voice Clone。本页讲解现成的工作流模板和节点连接方式。完整的内联标签参考（情绪、语气、停顿、音素）见 [Fish Audio 提示词指南](/zh/tutorials/partner-nodes/fishaudio/prompt-guide)。

<Tip>
  使用 API 节点需要保证你已经正常登录，并在受许可的网络环境下使用，请参考[API 节点总览](/zh/tutorials/partner-nodes/overview)部分文档来了解使用 API 节点的具体使用要求。
</Tip>

<Tip>
  <Tabs>
    <Tab title="本地用户">
      请确保你的 ComfyUI 已经更新。

      * [ComfyUI 下载](https://www.comfy.org/download)
      * [ComfyUI 更新教程](/zh/installation/update_comfyui)

      本指南里的工作流可以在[工作流模板](/zh/interface/features/template)中找到。如果找不到，可能是 ComfyUI 没有更新。

      如果加载工作流时有节点缺失，可能原因有：

      1. 你用的不是最新版（每夜版）。
      2. 启动时有些节点导入失败。
    </Tab>

    <Tab title="云端用户">
      * [Cloud](https://cloud.comfy.org) 会在 ComfyUI 稳定版本发布后更新。

      所以，如果你发现本文档中有任何核心节点缺失，可能是因为新核心节点尚未在最新稳定版中发布。请等待下一个稳定版发布。
    </Tab>
  </Tabs>
</Tip>

## 在 ComfyUI 中使用 Fish Audio

Fish Audio partner nodes 可以在节点菜单的 `partner/audio/Fish Audio` 分类下找到。四个节点覆盖完整工作流：

* **Fish Audio Text to Speech**：把文本转成语音，输出 `AUDIO`
* **Fish Audio Speech to Text**：把音频转写成文本，输出 `text`、`language_code` 和 `segments_json`
* **Fish Audio Voice Selector**：从预设音色中选择，或通过 `custom` 填入任意 fish.audio 音色模型（即 `https://fish.audio/m/<id>/` 中的 ID），输出 `voice`
* **Fish Audio Instant Voice Clone**：从录音克隆私有音色，输出 `voice`

### 选择模型

Text to Speech 节点的 `model` 参数有两个选项：

* `s2.1-pro`（推荐）：通过 0 到 5 路可扩展的音色输入支持多说话人
* `s1`（legacy）：接受单个可选音色输入，使用提示词指南中介绍的圆括号情绪标签语法

### 连接音色

Voice Selector 或 Instant Voice Clone 的 `voice` 输出连接到 Text to Speech 节点。输入名称取决于所选模型：`s2.1-pro`（推荐）提供可扩展的 `voices` 输入（最多 5 路音色），`s1` 则是单个可选的 `voice` 输入。只连接一个音色时，节点内部把它作为 `reference_id` 传递。连接两个或更多时，文本中必须用 `@Voice1`、`@Voice2` 等标记说话人，且每个已连接的音色都必须在文本中至少出现一次，否则节点会报错。详见提示词指南的[多说话人对话](/zh/tutorials/partner-nodes/fishaudio/prompt-guide#多说话人对话)。

### 克隆限制

Instant Voice Clone 节点接受 1 到 20 段录音，建议每段 10 到 30 秒，并硬性校验总时长必须小于 270 秒。`enhance_audio_quality` 选项默认开启。录制技巧见提示词指南的[声音克隆质量](/zh/tutorials/partner-nodes/fishaudio/prompt-guide#声音克隆质量)。

### 账户与价格

这些节点需要登录 ComfyUI 账户，按用量计费。节点上标注的参考价格：文本转语音约 $21.45 / 1M 字节文本，语音转文本 $0.00858 / 分钟，声音克隆免费。

## 可用工作流

三个现成模板覆盖 Fish Audio 的主要流程：文本转语音、声音克隆转语音、语音转文本。可在 ComfyUI 的模板库中打开，或直接在 Comfy Cloud 上运行。声音克隆和语音转文本模板需要 ComfyUI 0.34.0 或更高版本。

<h3 id="api_fishaudio_text_to_speech">
  Fish Audio：文本转语音
</h3>

使用预设音色把你的台词生成为语音。按照[提示词指南](/zh/tutorials/partner-nodes/fishaudio/prompt-guide)的写法在文本中加入内联标签，然后在 Voice Selector 中换一个预设音色，或连接克隆音色。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/api_fishaudio_text_to_speech-1.webp" alt="Fish Audio：文本转语音工作流预览" />

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=api_fishaudio_text_to_speech&utm_source=docs&utm_medium=referral&utm_campaign=fishaudio">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_fishaudio_text_to_speech.json">
    下载 JSON 或在模板库中搜索"Fish Audio: Text to Speech"
  </Card>
</CardGroup>

**输入材料**

将该文件上传到对应的 `LoadAudio` 节点：

<CardGroup cols={2}>
  <Card title="fish_audio_example.mp3" icon="music" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/fish_audio_example.mp3">
    `LoadAudio` 节点 11 · `fish_audio_example.mp3`
  </Card>
</CardGroup>

<h3 id="api_fishaudio_voice_clone_tts">
  Fish Audio：声音克隆转语音
</h3>

从一段短录音克隆音色，然后让它朗读任何台词。录制 2 到 3 段、每段 15 到 20 秒的音频，通过 `LoadAudio` 节点上传（或直接在 `RecordAudio` 节点中录制），并把 Instant Voice Clone 的输出连接到 Text to Speech 节点。录制技巧见提示词指南的[声音克隆质量](/zh/tutorials/partner-nodes/fishaudio/prompt-guide#声音克隆质量)。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/api_fishaudio_voice_clone_tts-1.webp" alt="Fish Audio：声音克隆转语音工作流预览" />

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=api_fishaudio_voice_clone_tts&utm_source=docs&utm_medium=referral&utm_campaign=fishaudio">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_fishaudio_voice_clone_tts.json">
    下载 JSON 或在模板库中搜索"Fish Audio: Voice Clone to Speech"
  </Card>
</CardGroup>

**输入材料**

将该文件上传到对应的 `LoadAudio` 节点：

<CardGroup cols={2}>
  <Card title="api_fishaudio_voice_clone_tts_fish_audio_example.mp3" icon="music" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/api_fishaudio_voice_clone_tts_fish_audio_example.mp3">
    `LoadAudio` 节点 11 · `api_fishaudio_voice_clone_tts_fish_audio_example.mp3`
  </Card>
</CardGroup>

<h3 id="api_fishaudio_speech_to_text">
  Fish Audio：语音转文本
</h3>

把音频片段转写为文本。自动检测 80 种以上语言，开启 `precise_timestamps` 后会以 JSON 返回每个片段的起止时间，适合做字幕。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/api_fishaudio_speech_to_text-1.webp" alt="Fish Audio：语音转文本工作流预览" />

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=api_fishaudio_speech_to_text&utm_source=docs&utm_medium=referral&utm_campaign=fishaudio">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/api_fishaudio_speech_to_text.json">
    下载 JSON 或在模板库中搜索"Fish Audio: Speech to Text"
  </Card>
</CardGroup>

**输入材料**

将该文件上传到对应的 `LoadAudio` 节点：

<CardGroup cols={2}>
  <Card title="fish_audio_example.mp3" icon="music" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/fish_audio_example.mp3">
    `LoadAudio` 节点 11 · `fish_audio_example.mp3`
  </Card>
</CardGroup>

## 开始使用

1. 将 ComfyUI 更新到最新版本
2. 打开上方的工作流模板之一，或从节点菜单的 `partner/audio/Fish Audio` 分类添加 Fish Audio 节点
3. 按提示登录 ComfyUI 账户
4. 按照[提示词指南](/zh/tutorials/partner-nodes/fishaudio/prompt-guide)用内联标签编写台词
5. 运行工作流，预览或保存音频
