输入
参数约束
-
参考模式依赖关系:
reference_mode参数决定了哪些其他输入是必需的:- “text only”:无需额外输入。提示词不得包含 @AudioN 标签。
- “audio reference”:需要至少连接
reference_audio_1、reference_audio_2或reference_audio_3中的一个。参考片段必须按顺序连接,不能有间隔。每个片段最长 30 秒。如果在提示词中使用 @AudioN 标签,编号最高的标签不得超过已连接的参考片段数量。 - “image reference”:需要连接
reference_image。不使用 @AudioN 标签;提示词应仅包含要合成的文本。 - “preset voice”:需要选择预设语音。整个提示词将以所选语音朗读;@AudioN 标签不作为参考使用,@Audio2 或更高的标签会被拒绝。
-
音频参考排序:使用“audio reference”模式时,参考音频输入必须从
reference_audio_1开始顺序连接,不能有间隔。例如,可以连接 _1 和 _2,但不能在没有 _2 的情况下连接 _1 和 _3。 - 最大音频标签数:在“audio reference”模式下,提示词最多可引用 3 个音频片段(@Audio1、@Audio2、@Audio3)。编号最高的标签不得超过已连接的参考音频输入数量。
-
模型差异:
seed-audio-1.0-multilingual模型支持 20 种语言(英语、中文、日语、韩语、墨西哥及卡斯蒂利亚西班牙语、印尼语、德语、巴西葡萄牙语、法语、泰语、越南语、马来语、菲律宾语、意大利语、俄语、荷兰语、波兰语、土耳其语、瑞典语),并支持使用[5.5s:8.0s]格式时间戳进行逐句时间控制。seed-audio-1.0模型仅支持英语和中文,无时间控制。
输出
本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑
Source fingerprint (SHA-256):
cefd5fca496b02c35022d25be3d99d3911c1304b6e3a751751b58841d5895ef7