入力
パラメータの制約事項
-
リファレンスモードの依存関係:
reference_modeパラメータは、他にどの入力が必要かを決定します。- “text only”: 追加の入力は不要です。プロンプトに @AudioN タグを含めてはなりません。
- “audio reference”:
reference_audio_1、reference_audio_2、reference_audio_3のうち少なくとも1つを接続する必要があります。リファレンスクリップは、順番に、欠落なく接続してください。各クリップは最大30秒です。プロンプト内で @AudioN タグを使用する場合、最大のタグ番号は接続されたリファレンスクリップ数を超えてはなりません。 - “image reference”:
reference_imageを接続する必要があります。@AudioN タグは使用しません。プロンプトには合成するテキストのみを含めてください。 - “preset voice”: プリセット音声を選択する必要があります。プロンプト全体が選択した音声で読み上げられます。@AudioN タグはリファレンスとして使用されず、@Audio2 以上のタグは拒否されます。
-
音声リファレンスの順序: 「audio reference」モードでは、音声リファレンス入力は
reference_audio_1から順番に、欠落なく接続する必要があります。例えば、reference_audio_1とreference_audio_2は接続できますが、reference_audio_2なしでreference_audio_1とreference_audio_3を接続することはできません。 - 音声タグの最大数: 「audio reference」モードでは、最大3つのリファレンスクリップ(@Audio1、@Audio2、@Audio3)を接続でき、プロンプト内の @AudioN タグの最大番号は、接続されたリファレンス音声入力を超えてはなりません。
-
モデルの違い:
seed-audio-1.0-multilingualモデルは20言語(英語、中国語、日本語、韓国語、メキシコスペイン語、カスティーリャスペイン語、インドネシア語、ドイツ語、ブラジルポルトガル語、フランス語、タイ語、ベトナム語、マレー語、フィリピン語、イタリア語、ロシア語、オランダ語、ポーランド語、トルコ語、スウェーデン語)に対応し、さらに[5.5s:8.0s]形式のタイムスタンプを使用した文単位のタイミング制御にも対応しています。seed-audio-1.0モデルは英語と中国語のみに対応し、タイミング制御には対応していません。
出力
このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください! GitHub で編集
Source fingerprint (SHA-256):
e86e4edde424b4427d864350a9d3b082e271fbd2b1e335175637a9cc3ad51163