text 필드에 입력하고 샘플 문장을 자신의 대사로 바꾸세요. 노드 연결, 워크플로 템플릿, 가격은 Fish Audio: 텍스트-음성, 보이스 클론, 음성-텍스트를 참고하세요.
태그 작동 방식
Fish Audio S2 모델은 대괄호로 작성된 자연어 지시를 해석합니다:- 위치가 곧 의미입니다. 태그는 나타난 위치부터 다음 태그 또는 문장 끝까지 적용됩니다.
[whispering] I didn't want to go inside는 전체를 속삭이고,I didn't want to go [whispering] inside는 “inside”부터 속삭이기 시작합니다. - 자유로운 설명도 됩니다. 고정된 태그 세트에 제한되지 않습니다. 성우에게 설명할 수 있는 것은 무엇이든 대괄호에 쓸 수 있습니다:
[tired, end of a long shift],[voice rough from crying, trying to sound normal],[professional broadcast tone]. - 태그는 자신의 언어로 쓸 수 있습니다. 대사와 같은 언어로 지시를 작성하세요:
[低声说] 不要让他们听见,[ため息をついて] もう一度やり直そう.
s1 모델은 같은 감정 이름을 소괄호로 감싸며 고정 태그 세트만 지원합니다: (happy) What a beautiful day! 현재 s2.1-pro 모델은 대괄호 지시와 자유로운 설명을 받습니다.
감정 태그
기본 감정
심화 감정
톤 마커
톤 마커는 음량, 강도, 강세를 제어합니다.[emphasis]는 강조할 단어나 구 바로 앞에 놓습니다:
오디오 이펙트
오디오 이펙트 태그는 자연스러운 사람 소리를 추가합니다. 권장 텍스트가 있는 태그는 뒤에 해당 텍스트를 이어 주세요:멈춤과 특수 이펙트
일반 연결어(“um”, “uh”, “嗯”, “啊”)도 태그 없이 리듬을 만듭니다.
태그 조합
신체 반응 태그와 감정 태그를 짝지으세요.[panting], [whispering] 같은 신체 태그는 단독으로도 작동하지만, 감정 태그와 조합하면 더 일관되고 자연스럽습니다:
모범 사례
권장:- 문장마다 주요 감정을 하나만 사용
- 감정을 문맥과 논리적으로 일치
- 효과음 태그 뒤에 텍스트 추가 (예:
[laughing]뒤에 “Ha ha”) - 감정 변화 간격을 띄워 현실감 확보
- 같은 목소리로 다양한 조합 테스트
- 짧은 텍스트에서 태그 남용
- 한 문장에 상충하는 감정 혼합
- 대괄호 설명이 너무 길어 흐름을 해치는 것
- 설명 태그 뒤에 대사를 두지 않는 것
- 문장 수준 감정 지시를 제어할 문장에서 멀리 두는 것
다중 화자 대화
Fish Audio Text to Speech 노드에 두 개 이상의 목소리를 연결하고, 텍스트에서@Voice1, @Voice2 등으로 화자 전환을 표시합니다. 연결된 모든 목소리가 텍스트에 최소 한 번은 나타나야 하며, 그렇지 않으면 노드가 오류를 냅니다. 목소리 연결 방법은 Fish Audio: 텍스트-음성, 보이스 클론, 음성-텍스트를 참고하세요.
음소 제어
음소 태그는 이름, 다자(多字), 두문자어, 전문 용어의 정확한 발음을 지정합니다. 대체 발음을<|phoneme_start|>와 <|phoneme_end|> 태그로 감쌉니다. 음소 태그는 텍스트 정규화에서도 보존되므로 normalize를 켜 두면 됩니다.
영어 (CMU Arpabet, 단어 1개 대체):
파라미터 조정
기본값은 잘 조정되어 있습니다. 필요할 때만 변경하세요:seed는 노드 재실행 여부만 제어합니다. seed 값과 무관하게 결과는 비결정적입니다.
보이스 클론 품질
Fish Audio Instant Voice Clone 노드에서는 참조 녹음 품질이 결과를 결정합니다. 녹음 제한은 Fish Audio: 텍스트-음성, 보이스 클론, 음성-텍스트를 참고하세요:- 15
20초 클립 23개, 총 270초 이내 - 화자는 한 명만, 일정한 음량, 일관된 톤과 감정
- 문장 사이에 0.5초 정도의 짧은 멈춤
- 조용한 방, 마이크는 입에서 한 뼘 정도
- 휴대폰 녹음이나 헤드셋 마이크로도 충분합니다. 배경 음악, TV, 잔향은 피하세요