Skip to main content
ByteDance Seed Audio 1.0을 사용하여 단일 프롬프트로 음성, 음악, 음향 효과 및 다중 화자 대화를 생성합니다. 프롬프트에 음성, 감정, 분위기, 배경 음악 및 음향 효과를 설명하고, 말할 대사를 포함하세요. 선택적으로 내장된 사전 설정 음성을 선택하거나, 최대 3개의 참조 클립(프롬프트에서 @Audio1-3으로 태그 지정)에서 음성을 복제하거나, 캐릭터 이미지에서 음성을 추출할 수 있습니다. 실행당 최대 2분의 오디오를 생성합니다.

입력

  • “audio reference”: reference_audio_1, reference_audio_2 또는 reference_audio_3 중 하나 이상이 연결되어야 합니다. 참조 클립은 순서대로 연결해야 하며 중간에 비면 안 됩니다. 각 클립은 최대 30초로 제한됩니다. 프롬프트에서 @AudioN 태그를 사용하는 경우, 가장 높은 태그 번호는 연결된 참조 클립 수를 초과할 수 없습니다. | reference_audio_1 | 음성 복제를 위한 참조 클립이며, 프롬프트에서 @Audio1로 태그 지정됩니다. 최대 30초입니다. reference_mode가 “audio reference”인 경우에만 사용 가능합니다. | AUDIO | 아니요 | 최대 30초 | | reference_audio_2 | 프롬프트에서 @Audio2로 태그 지정된 참조 클립입니다. 최대 30초입니다. reference_mode가 “audio reference”인 경우에만 사용 가능합니다. | AUDIO | 아니요 | 최대 30초 | | reference_audio_3 | 프롬프트에서 @Audio3로 태그 지정된 참조 클립입니다. 최대 30초입니다. reference_mode가 “audio reference”인 경우에만 사용 가능합니다. | AUDIO | 아니요 | 최대 30초 |
  • “image reference”: reference_image가 연결되어야 합니다. @AudioN 태그는 사용되지 않으며, 프롬프트에는 합성할 텍스트만 포함되어야 합니다.
  • “preset voice”: 사전 설정 음성을 선택해야 합니다. 전체 프롬프트가 선택한 음성으로 읽히며, @AudioN 태그는 참조로 사용되지 않고 @Audio2 이상의 태그는 거부됩니다. | sample_rate | 출력 샘플 속도(Hz)입니다. (기본값: “24000”) | COMBO | 예 | "8000"
    "16000"
    "24000"
    "32000"
    "44100"
    "48000" | | speech_rate | 말하기 속도입니다. 0 = 보통, 100 = 2.0배, -50 = 0.5배입니다. (기본값: 0) | INT | 예 | -50 ~ 100 | | loudness_rate | 음량입니다. 0 = 보통, 100 = 2.0배, -50 = 0.5배입니다. (기본값: 0) | INT | 예 | -50 ~ 100 | | pitch_rate | 반음 단위의 피치 이동(-12 ~ 12)입니다. (기본값: 0) | INT | 예 | -12 ~ 12 | | seed | 시드는 노드 재실행 여부를 제어합니다. 시드와 관계없이 결과는 비결정적입니다. (기본값: 42) | INT | 예 | 0 ~ 2147483647 | | model | 모델 버전입니다. seed-audio-1.0-multilingual은 20개 언어와 [5.5s:8.0s] 타임스탬프를 통한 문장별 시간 제어를 지원합니다. seed-audio-1.0은 영어와 중국어만 지원하며 시간 제어가 없습니다. (기본값: “seed-audio-1.0-multilingual”) | COMBO | 아니요 | "seed-audio-1.0-multilingual"
    "seed-audio-1.0" |

매개변수 제약 조건

  • 참조 모드 종속성: reference_mode 매개변수는 필요한 다른 입력을 결정합니다.
    • “text only”: 추가 입력이 필요하지 않습니다. 프롬프트에 @AudioN 태그가 포함되어서는 안 됩니다.
    • “audio reference”: reference_audio_1, reference_audio_2 또는 reference_audio_3 중 하나 이상이 연결되어야 합니다. 참조 클립은 순서대로 연결되어야 하며 중간에 비어 있으면 안 됩니다(예: _1, 그 다음 _2, 그 다음 _3). 각 클립은 최대 30초로 제한됩니다. 프롬프트는 @Audio1, @Audio2, @Audio3 태그를 사용하여 연결된 클립을 참조해야 합니다.
    • “image reference”: reference_image가 연결되어야 합니다. 프롬프트에 @AudioN 태그가 포함되어서는 안 됩니다.
    • “preset voice”: preset_voice가 선택되어야 합니다. 프롬프트에 @AudioN 태그가 포함되어서는 안 됩니다(전체 프롬프트가 선택된 음성으로 읽힙니다).
  • 오디오 참조 순서: “audio reference” 모드를 사용할 때, 참조 오디오 입력은 reference_audio_1부터 시작하여 순차적으로 연결되어야 하며 중간에 비어 있으면 안 됩니다. 예를 들어, _1과 _2는 연결할 수 있지만, _2 없이 _1과 _3만 연결할 수는 없습니다.
  • 최대 오디오 태그: “audio reference” 모드에서 프롬프트는 최대 3개의 오디오 클립(@Audio1, @Audio2, @Audio3)을 참조할 수 있으며, 프롬프트에서 가장 높은 @AudioN 태그는 연결된 참조 오디오 입력 수를 초과할 수 없습니다.
  • 모델 차이: seed-audio-1.0-multilingual 모델은 20개 언어(영어, 중국어, 일본어, 한국어, 멕시코 및 카스티야 스페인어, 인도네시아어, 독일어, 브라질 포르투갈어, 프랑스어, 태국어, 베트남어, 말레이어, 필리핀어, 이탈리아어, 러시아어, 네덜란드어, 폴란드어, 터키어, 스웨덴어)와 [5.5s:8.0s] 형식 타임스탬프를 사용한 문장별 시간 제어를 지원합니다. seed-audio-1.0 모델은 영어와 중국어만 지원하며 시간 제어가 없습니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): cefd5fca496b02c35022d25be3d99d3911c1304b6e3a751751b58841d5895ef7