text 字段,替换成你自己的台词即可。节点连接、工作流模板与价格见 Fish Audio:文本转语音、声音克隆与语音转文本。
标签的工作方式
Fish Audio S2 模型可以理解写在方括号里的自然语言提示:- 位置即语义。 标签从出现的位置生效,直到下一个标签或句尾。
[whispering] I didn't want to go inside会让整句耳语,而I didn't want to go [whispering] inside只从 “inside” 开始耳语。 - 自由描述也能用。 你不限于固定标签词表。能向配音演员描述的东西,都可以写进方括号:
[tired, end of a long shift]、[voice rough from crying, trying to sound normal]、[professional broadcast tone]。 - 标签可以用你的语言写。 用和台词相同的语言写提示:
[低声说] 不要让他们听见、[ため息をついて] もう一度やり直そう。
s1 模型使用相同的情绪名称,但用圆括号包裹且仅支持固定词表:(happy) What a beautiful day! 当前 s2.1-pro 模型接受方括号提示和自由描述。
情绪标签
基础情绪
进阶情绪
语气标记
语气标记控制音量、强度和重音。把[emphasis] 放在要强调的词或短语前面:
音频效果
音频效果标签添加自然的人类声音。有建议文本的标签,请在其后补上对应的文本:停顿与特殊效果
普通停顿词不需要任何标签也能塑造节奏:“um”、“uh”、“嗯”、“啊”。
标签组合
生理反应标签配情绪标签。[panting]、[whispering] 这类生理标签单独使用也能生效,但配上情绪标签效果更稳定、更自然:
最佳实践
推荐:- 每句话只用一个主情绪
- 情绪与语境逻辑匹配
- 音效标签后补上文本,例如
[laughing]后面写 “Ha ha” - 拉开情绪变化的间隔,更真实
- 在同一个音色上测试不同组合
- 在短文本里滥用标签
- 一句话里混用冲突情绪
- 方括号里的描述写得过长、打断阅读
- 描述性标签后面不跟台词
- 把句级情绪提示放在离它控制的句子很远的地方
多说话人对话
连接两个或更多音色到 Fish Audio Text to Speech 节点,然后在文本中用@Voice1、@Voice2 等标记说话人切换。每个已连接的音色都必须在文本中至少出现一次,否则节点会报错。音色连接方式见 Fish Audio:文本转语音、声音克隆与语音转文本。
音素控制
音素标签可以为名字、多音字、缩写和技术术语指定精确发音。把替换发音包在<|phoneme_start|> 和 <|phoneme_end|> 标签里。音素标签不会被文本规范化改写,所以保持 normalize 开启即可。
英文(CMU Arpabet,替换单个单词):
参数调节
默认值已经调得很好,只在需要时调整:seed 只控制节点是否重跑;无论 seed 值是多少,结果都是非确定性的。
声音克隆质量
对 Fish Audio Instant Voice Clone 节点来说,参考录音的质量决定克隆效果。录音时长限制见 Fish Audio:文本转语音、声音克隆与语音转文本:- 录 2 到 3 段、每段 15 到 20 秒的音频,总共不超过 270 秒
- 只有一个说话人,音量平稳,语气和情绪一致
- 句间留小停顿,约半秒
- 安静的房间,麦克风离嘴约一个手掌宽
- 手机录音或耳麦都可以;避免背景音乐、电视声和回声