Skip to main content
Fish Audio TTS는 텍스트 안에 직접 작성하는 인라인 태그로 음성의 들리는 방식을 직접 제어할 수 있습니다. 이 가이드는 모델이 이해하는 모든 태그 카테고리, 배치 방법, 조합 방법을 다룹니다. 아래 예제는 Fish Audio Text to Speech 노드에서 바로 사용할 수 있습니다. text 필드에 입력하고 샘플 문장을 자신의 대사로 바꾸세요. 노드 연결, 워크플로 템플릿, 가격은 Fish Audio: 텍스트-음성, 보이스 클론, 음성-텍스트를 참고하세요.

태그 작동 방식

Fish Audio S2 모델은 대괄호로 작성된 자연어 지시를 해석합니다:
이 시스템에는 세 가지 특징이 있습니다:
  • 위치가 곧 의미입니다. 태그는 나타난 위치부터 다음 태그 또는 문장 끝까지 적용됩니다. [whispering] I didn't want to go inside는 전체를 속삭이고, I didn't want to go [whispering] inside는 “inside”부터 속삭이기 시작합니다.
  • 자유로운 설명도 됩니다. 고정된 태그 세트에 제한되지 않습니다. 성우에게 설명할 수 있는 것은 무엇이든 대괄호에 쓸 수 있습니다: [tired, end of a long shift], [voice rough from crying, trying to sound normal], [professional broadcast tone].
  • 태그는 자신의 언어로 쓸 수 있습니다. 대사와 같은 언어로 지시를 작성하세요: [低声说] 不要让他们听见, [ため息をついて] もう一度やり直そう.
레거시 s1 모델은 같은 감정 이름을 소괄호로 감싸며 고정 태그 세트만 지원합니다: (happy) What a beautiful day! 현재 s2.1-pro 모델은 대괄호 지시와 자유로운 설명을 받습니다.

감정 태그

기본 감정

심화 감정

톤 마커

톤 마커는 음량, 강도, 강세를 제어합니다. [emphasis]는 강조할 단어나 구 바로 앞에 놓습니다:

오디오 이펙트

오디오 이펙트 태그는 자연스러운 사람 소리를 추가합니다. 권장 텍스트가 있는 태그는 뒤에 해당 텍스트를 이어 주세요:

멈춤과 특수 이펙트

일반 연결어(“um”, “uh”, “嗯”, “啊”)도 태그 없이 리듬을 만듭니다.

태그 조합

신체 반응 태그와 감정 태그를 짝지으세요. [panting], [whispering] 같은 신체 태그는 단독으로도 작동하지만, 감정 태그와 조합하면 더 일관되고 자연스럽습니다:
감정을 겹쳐 복잡한 표현을 만드세요. 문장당 조합은 3개 이하로 유지합니다:
감정 전환을 문장에 걸친 자연스러운 흐름으로 작성하세요:
배경 이펙트로 분위기를 더하세요:
강도 수식어로 감정의 세기를 조절하세요:

모범 사례

권장:
  • 문장마다 주요 감정을 하나만 사용
  • 감정을 문맥과 논리적으로 일치
  • 효과음 태그 뒤에 텍스트 추가 (예: [laughing] 뒤에 “Ha ha”)
  • 감정 변화 간격을 띄워 현실감 확보
  • 같은 목소리로 다양한 조합 테스트
비권장:
  • 짧은 텍스트에서 태그 남용
  • 한 문장에 상충하는 감정 혼합
  • 대괄호 설명이 너무 길어 흐름을 해치는 것
  • 설명 태그 뒤에 대사를 두지 않는 것
  • 문장 수준 감정 지시를 제어할 문장에서 멀리 두는 것
출력이 부자연스럽게 들리면 감정 변화 간격을 띄우거나, 강도를 낮추거나, 다른 목소리를 시도하세요. 같은 태그도 목소리에 따라 효과가 다릅니다.

다중 화자 대화

Fish Audio Text to Speech 노드에 두 개 이상의 목소리를 연결하고, 텍스트에서 @Voice1, @Voice2 등으로 화자 전환을 표시합니다. 연결된 모든 목소리가 텍스트에 최소 한 번은 나타나야 하며, 그렇지 않으면 노드가 오류를 냅니다. 목소리 연결 방법은 Fish Audio: 텍스트-음성, 보이스 클론, 음성-텍스트를 참고하세요.

음소 제어

음소 태그는 이름, 다자(多字), 두문자어, 전문 용어의 정확한 발음을 지정합니다. 대체 발음을 <|phoneme_start|><|phoneme_end|> 태그로 감쌉니다. 음소 태그는 텍스트 정규화에서도 보존되므로 normalize를 켜 두면 됩니다. 영어 (CMU Arpabet, 단어 1개 대체):
중국어 (성조 표기 병음, 글자 1개 또는 음절 대체, 다자(多音字)와 고유명사에 유용):
일본어 (OpenJTalk 방식 로마자+억양 번호):
음소 제어는 다른 태그와 같은 텍스트에서 조합할 수 있습니다:

파라미터 조정

기본값은 잘 조정되어 있습니다. 필요할 때만 변경하세요: seed는 노드 재실행 여부만 제어합니다. seed 값과 무관하게 결과는 비결정적입니다.

보이스 클론 품질

Fish Audio Instant Voice Clone 노드에서는 참조 녹음 품질이 결과를 결정합니다. 녹음 제한은 Fish Audio: 텍스트-음성, 보이스 클론, 음성-텍스트를 참고하세요:
  • 1520초 클립 23개, 총 270초 이내
  • 화자는 한 명만, 일정한 음량, 일관된 톤과 감정
  • 문장 사이에 0.5초 정도의 짧은 멈춤
  • 조용한 방, 마이크는 입에서 한 뼘 정도
  • 휴대폰 녹음이나 헤드셋 마이크로도 충분합니다. 배경 음악, TV, 잔향은 피하세요
클론한 목소리가 로봇처럼 들리면 총 30~60초로 소재를 늘리고, 멈춤을 넣으며 자연스럽게 말하세요. 자신의 목소리, 또는 명시적 허락을 받은 사람의 목소리처럼 사용 권한이 있는 목소리만 클론하세요.

참고 자료