Skip to main content
使用单个提示词,通过字节跳动 Seed Audio 1.0 生成语音、音乐、音效和多说话人对话。在提示词中描述声音、情感、氛围、背景音乐和音效,并包含要朗读的台词。可选择内置预设语音,从最多 3 个参考片段(在提示词中标记为 @Audio1-3)克隆声音,或从角色图像中衍生声音。每次运行最多可生成 2 分钟音频。

输入

参数约束

  • 参考模式依赖关系reference_mode 参数决定了哪些其他输入是必需的:
    • “text only”:无需额外输入。提示词不得包含 @AudioN 标签。
    • “audio reference”:需要至少连接 reference_audio_1reference_audio_2reference_audio_3 中的一个。参考片段必须按顺序连接,不能有间隔。每个片段最长 30 秒。如果在提示词中使用 @AudioN 标签,编号最高的标签不得超过已连接的参考片段数量。
    • “image reference”:需要连接 reference_image。不使用 @AudioN 标签;提示词应仅包含要合成的文本。
    • “preset voice”:需要选择预设语音。整个提示词将以所选语音朗读;@AudioN 标签不作为参考使用,@Audio2 或更高的标签会被拒绝。
  • 音频参考排序:使用“audio reference”模式时,参考音频输入必须从 reference_audio_1 开始顺序连接,不能有间隔。例如,可以连接 _1 和 _2,但不能在没有 _2 的情况下连接 _1 和 _3。
  • 最大音频标签数:在“audio reference”模式下,提示词最多可引用 3 个音频片段(@Audio1、@Audio2、@Audio3)。编号最高的标签不得超过已连接的参考音频输入数量。
  • 模型差异seed-audio-1.0-multilingual 模型支持 20 种语言(英语、中文、日语、韩语、墨西哥及卡斯蒂利亚西班牙语、印尼语、德语、巴西葡萄牙语、法语、泰语、越南语、马来语、菲律宾语、意大利语、俄语、荷兰语、波兰语、土耳其语、瑞典语),并支持使用 [5.5s:8.0s] 格式时间戳进行逐句时间控制。seed-audio-1.0 模型仅支持英语和中文,无时间控制。

输出

本文档由 AI 生成。如果您发现任何错误或有改进建议,欢迎贡献! 在 GitHub 上编辑

Source fingerprint (SHA-256): cefd5fca496b02c35022d25be3d99d3911c1304b6e3a751751b58841d5895ef7