Skip to main content
ByteDance Seed Audio 1.0 を使用すると、1つのプロンプトから音声、音楽、効果音、複数話者による対話を生成できます。プロンプトには、音声、感情、雰囲気、BGM、効果音を記述し、発話する台詞も含めてください。必要に応じて、内蔵プリセット音声を選択するか、最大3つのリファレンスクリップ(プロンプト内で @Audio1-3 とタグ付け)から音声をクローンするか、キャラクター画像から音声を派生させることもできます。1回の実行につき最大2分間の音声を生成できます。多言語モデルは20言語に対応し、タイムスタンプによるタイミング制御もサポートしています。

入力

パラメータの制約事項

  • リファレンスモードの依存関係: reference_mode パラメータは、他にどの入力が必要かを決定します。
    • “text only”: 追加の入力は不要です。プロンプトに @AudioN タグを含めてはなりません。
    • “audio reference”: reference_audio_1reference_audio_2reference_audio_3 のうち少なくとも1つを接続する必要があります。リファレンスクリップは、順番に、欠落なく接続してください。各クリップは最大30秒です。プロンプト内で @AudioN タグを使用する場合、最大のタグ番号は接続されたリファレンスクリップ数を超えてはなりません。
    • “image reference”: reference_image を接続する必要があります。@AudioN タグは使用しません。プロンプトには合成するテキストのみを含めてください。
    • “preset voice”: プリセット音声を選択する必要があります。プロンプト全体が選択した音声で読み上げられます。@AudioN タグはリファレンスとして使用されず、@Audio2 以上のタグは拒否されます。
  • 音声リファレンスの順序: 「audio reference」モードでは、音声リファレンス入力は reference_audio_1 から順番に、欠落なく接続する必要があります。例えば、reference_audio_1reference_audio_2 は接続できますが、reference_audio_2 なしで reference_audio_1reference_audio_3 を接続することはできません。
  • 音声タグの最大数: 「audio reference」モードでは、最大3つのリファレンスクリップ(@Audio1、@Audio2、@Audio3)を接続でき、プロンプト内の @AudioN タグの最大番号は、接続されたリファレンス音声入力を超えてはなりません。
  • モデルの違い: seed-audio-1.0-multilingual モデルは20言語(英語、中国語、日本語、韓国語、メキシコスペイン語、カスティーリャスペイン語、インドネシア語、ドイツ語、ブラジルポルトガル語、フランス語、タイ語、ベトナム語、マレー語、フィリピン語、イタリア語、ロシア語、オランダ語、ポーランド語、トルコ語、スウェーデン語)に対応し、さらに [5.5s:8.0s] 形式のタイムスタンプを使用した文単位のタイミング制御にも対応しています。seed-audio-1.0 モデルは英語と中国語のみに対応し、タイミング制御には対応していません。

出力

このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集

Source fingerprint (SHA-256): e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163