> ## Documentation Index
> Fetch the complete documentation index at: https://docs.comfy.org/llms.txt
> Use this file to discover all available pages before exploring further.

# FishAudioTextToSpeech - ComfyUI Built-in Node Documentation

> 此节点使用 Fish Audio 文本转语音模型将书面文字转换为语音音频。

此节点使用 Fish Audio 文本转语音模型将书面文字转换为语音音频。它支持文本中嵌入的情感提示（s2.1-pro 上为 \[happy]、\[whispering]；s1 上为 (happy)），并支持在连接多个音色时使用 @Voice1/@Voice2 标签进行多说话人对话。提供两种模型：s2.1-pro 支持最多五个音色和多说话人对话；s1 使用单个可选音色。

## 输入

### 通用输入

| 参数   | 描述                                                            | 数据类型           | 是否必填 | 范围                   |
| ---- | ------------------------------------------------------------- | -------------- | ---- | -------------------- |
| `文本` | 要转换为语音的文本。当连接两个或更多音色时，使用 @Voice1、@Voice2 等标记说话人切换。不能为空。（默认：空） | STRING         | 是    | 任意非空文本               |
| `模型` | 用于文本转语音的模型。                                                   | DYNAMIC\_COMBO | 是    | "s2.1-pro"<br />"s1" |
| `种子` | 种子控制节点是否应重新运行；无论种子如何，结果都是非确定性的。（默认：42）                        | INT            | 是    | 0 到 2147483647       |

### s2.1-pro 输入

这些输入在选择了 s2.1-pro 模型时出现。

| 参数            | 描述                                                                                                           | 数据类型             | 是否必填 | 范围           |
| ------------- | ------------------------------------------------------------------------------------------------------------ | ---------------- | ---- | ------------ |
| `voices`      | 可增长的插槽：连接 1 到 5 个音色项（`voice_1`、`voice_2`、……）。用于合成的音色。留空则使用默认音色。当连接两个或更多音色时，请在文本中使用 @Voice1、@Voice2 等标记说话人切换。 | FISHAUDIO\_VOICE | 否    | 0 到 5 个音色    |
| `temperature` | 表现力。数值越高变化越多，数值越低一致性越强。（默认：0.7）                                                                              | FLOAT            | 是    | 0.0 到 1.0    |
| `top_p`       | 通过核采样（nucleus sampling）实现的多样性。（默认：0.7）                                                                       | FLOAT            | 是    | 0.01 到 1.0   |
| `speed`       | 语速。1.0 为正常，\<1.0 较慢，>1.0 较快。（默认：1.0）                                                                         | FLOAT            | 是    | 0.5 到 2.0    |
| `volume`      | 以分贝为单位的音量调整。0 表示不变。（默认：0.0）                                                                                  | FLOAT            | 是    | -10.0 到 10.0 |
| `normalize`   | 对英语和中文的数字及文本进行归一化，提高数字和日期的稳定性。（默认：true）                                                                      | BOOLEAN          | 是    | true / false |

### s1 输入

这些输入在选择了 s1 模型时出现。

| 参数            | 描述                                      | 数据类型             | 是否必填 | 范围           |
| ------------- | --------------------------------------- | ---------------- | ---- | ------------ |
| `voice`       | 用于合成的音色。保持未连接以使用默认音色。                   | FISHAUDIO\_VOICE | 否    | 可选的单个音色      |
| `temperature` | 表现力。数值越高变化越多，数值越低一致性越强。（默认：0.7）         | FLOAT            | 是    | 0.0 到 1.0    |
| `top_p`       | 通过核采样（nucleus sampling）实现的多样性。（默认：0.7）  | FLOAT            | 是    | 0.01 到 1.0   |
| `speed`       | 语速。1.0 为正常，\<1.0 较慢，>1.0 较快。（默认：1.0）    | FLOAT            | 是    | 0.5 到 2.0    |
| `volume`      | 以分贝为单位的音量调整。0 表示不变。（默认：0.0）             | FLOAT            | 是    | -10.0 到 10.0 |
| `normalize`   | 对英语和中文的数字及文本进行归一化，提高数字和日期的稳定性。（默认：true） | BOOLEAN          | 是    | true / false |

**注意：** `text` 输入不能为空。说话人标签（@Voice1、@Voice2 等）不区分大小写，且必须指向已连接的音色；标记未连接的音色会引发错误。当连接两个或更多音色时，文本必须至少引用每个已连接音色一次，否则节点会报告缺失的标签。在 s2.1-pro 上，连接 0 个音色将使用默认音色，连接 1 个音色则单独使用该音色，连接 2 个或更多音色可启用多说话人对话。在 s1 上，使用单个可选音色，保持未连接则使用默认音色。情感提示可以放在文本中：在 s2.1-pro 上使用 \[happy] 和 \[whispering]，在 s1 上使用 (happy)。

## 输出

| 输出名称    | 描述         | 数据类型  |
| ------- | ---------- | ----- |
| `audio` | 生成的语音音频文件。 | AUDIO |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/FishAudioTextToSpeech/zh.md)

***

**Source fingerprint (SHA-256):** `6cc005ae76fc7b60d9399b1b0a3c5de40a6eff47cd6f0f0b73b4212c0270ae29`
