주요 기능
- 멀티모달 오디오 생성: 하나의 프롬프트로 음성, 음악, 효과음, 주변 오디오 생성. 듣고 있는 내용을 설명하면 Seed Audio가 생성합니다.
- 음성 복제: 최대 3개의 참조 클립(프롬프트에서
@Audio1,@Audio2,@Audio3로 태그 지정)에서 음성을 복제하여 다중 캐릭터 대화 또는 일관된 내레이션 구현 - 사전 설정 음성: 참조 클립 없이 안정적이고 고품질의 내레이션이 필요할 때 내장 TTS 2.0 음성에서 선택
- 이미지 기반 음성: 캐릭터 이미지에서 음성을 도출하여 시각적 대상에 어울리는 톤과 스타일 매칭
- 세밀한 제어: 각 생성물에 대해 말하기 속도, 피치, 음량, 샘플 레이트를 독립적으로 조정
- 다중 화자 대화: 프롬프트에서 인라인으로 캐릭터 이름을 지정하면 Seed Audio가 음성 할당, 차례 전환, 감정 표현을 처리
- 실행당 최대 2분: 내레이션, 팟캐스트 클립, 비디오 더빙, 사운드 디자인에 적합한 긴 오디오 클립 생성
사용 가능한 워크플로
Seed Audio 1.0: 텍스트-오디오
텍스트 프롬프트를 입력하여 음성, 대화, 배경 음악 및 음향 효과를 하나의 오디오 파일로 생성합니다.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON 다운로드 또는 템플릿 라이브러리에서 “Seed Audio 1.0: Text to Audio” 검색
Seed Audio 1.0: 텍스트 + 오디오-오디오
참조 오디오 클립을 업로드하고 텍스트 프롬프트를 작성하여 음성을 새 장면으로 복제합니다.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON 다운로드 또는 템플릿 라이브러리에서 “Seed Audio 1.0: Text + Audio to Audio” 검색
LoadAudio 노드에 업로드하세요:
seed_audio_ref_audio1.mp3
LoadAudio 노드 8 · seed_audio_ref_audio1.mp3Seed Audio 1.0: 텍스트 + 이미지-오디오
캐릭터 이미지를 업로드하고 텍스트 프롬프트를 작성하여 시각적 대상과 일치하는 음성 스타일로 오디오를 생성합니다.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON 다운로드 또는 템플릿 라이브러리에서 “Seed Audio 1.0: Text + Image to Audio” 검색
LoadImage 노드에 업로드하세요:
girl_and_fish.png
LoadImage 노드 6 · girl_and_fish.png
ComfyUI에서 Seed Audio 1.0 사용 방법
Seed Audio 1.0은 ByteDanceSeedAudio 내장 노드로 제공됩니다. ByteDance 아래의 노드 메뉴에서 찾을 수 있습니다.참조 모드 선택
노드는 생성되는 음성의 조건을 결정하는 네 가지 참조 모드를 제공합니다.프롬프트 구조
최상의 결과를 위해 프롬프트를 구성하여 오디오 장면을 설명하세요.- 음성 및 감정 — 톤, 연령, 성별, 악센트 또는 감정 전달을 설명
- 분위기 및 배경 — 음향 환경(조용한 스튜디오, 번화한 거리, 콘서트홀)을 설명
- 음향 효과 — 타임라인의 적절한 지점에서 특정 소리를 설명
- 대사 — 말할 대사를 작성하고, 다중 화자 장면을 위해 캐릭터 이름 지정
차분하고 따뜻한 남성 음성이 자신 있게 말합니다. 배경에 부드러운 빗소리가 들리고 가끔 먼 천둥소리가 납니다. “Seed Audio 1.0은 템포, 피치, 존재감을 완전히 제어하여 자연스러운 음성을 생성합니다.”ReferenceTimbreAudio를 사용한 다중 화자 대화 예시:
@Audio1이 긴장한 듯 낮고 빠른 속삭임으로 말합니다: “그거 봤어?” @Audio2는 차분하고 느린 말투로 대답합니다: “뭘? 그냥 바람이야.” 가벼운 바람 분위기가 계속됩니다.
파라미터 조정
입력을 연결한 후, 원하는 출력을 위해 다음 파라미터를 조정하세요.- 말하기 속도 — 기본값 0 (노멀(normal)). 범위 -50 (0.5배) ~ 100 (2.0배). 네거티브 값은 편안한 내레이션에, 양수 값은 에너지 넘치는 보이스오버에 사용
- 피치 — 반음 단위 이동 (-12 ~ +12). 캐릭터 음성이나 특정 음역대 매칭에 유용
- 음량 — 기본값 0 (노멀(normal)). 범위 -50 (0.5배) ~ 100 (2.0배). 다양한 소스 자료에서 일관된 볼륨을 위해 조정
- 샘플 레이트 — 8kHz에서 48kHz까지 선택 가능. 24kHz는 음성에 좋은 기본값; 음악은 44.1kHz 또는 48kHz
- 시드 — 노드 재실행 여부 제어; 시드 값과 관계없이 결과는 비결정적
엣지 케이스 및 제한 사항
- 참조 클립 지속 시간: ReferenceTimbreAudio 클립은 각각 최대 30초입니다. 더 긴 참조 자료의 경우, 연결 전에 클립을 자르거나 편집하세요.
- ReferenceTimbreAudio 참조 순서: 참조 입력은 순차적으로(1, 2, 3) 연결되어야 하며, 중간에 비어 있으면 안 됩니다.
- 태그 제한: 단일 프롬프트에서 최대 3개의
@AudioN태그가 지원됩니다. - 글자 수 제한: 프롬프트는 최대 3000자로 제한됩니다.
- 지속 시간 제한: 실행당 최대 2분의 오디오입니다.
시작하기
- ComfyUI를 최신 버전으로 업데이트하세요
- 노드 메뉴에서 ByteDanceSeedAudio 노드를 추가하거나 위의 워크플로 템플릿 중 하나를 열어보세요
- 참조 모드를 선택하고 입력을 연결하세요
- 오디오 장면과 대화를 설명하는 프롬프트를 작성하세요
- 워크플로를 실행하세요