ComfyUI에서 Fish Audio 사용하기
Fish Audio partner nodes는 노드 메뉴의partner/audio/Fish Audio 카테고리에 있습니다. 4개의 노드가 워크플로를 다룹니다:
- Fish Audio Text to Speech: 텍스트를 음성으로 변환합니다. 출력은
AUDIO - Fish Audio Speech to Text: 오디오를 텍스트로 전사합니다. 출력은
text,language_code,segments_json - Fish Audio Voice Selector: 프리셋 목소리에서 선택하거나,
custom으로 임의의 fish.audio 음성 모델을 입력합니다 (https://fish.audio/m/<id>/의 ID). 출력은voice - Fish Audio Instant Voice Clone: 녹음으로 비공개 클론 목소리를 만듭니다. 출력은
voice
모델 선택
Text to Speech 노드의model 파라미터에는 두 가지 옵션이 있습니다:
s2.1-pro(권장): 0~5개로 확장 가능한 음성 입력으로 다중 화자를 지원합니다s1(legacy): 단일 선택 음성 입력을 받으며, 프롬프트 가이드에서 설명하는 괄호 감정 태그 구문을 사용합니다
목소리 연결
Voice Selector 또는 Instant Voice Clone의voice 출력을 Text to Speech 노드에 연결합니다. 입력 이름은 모델에 따라 다릅니다: s2.1-pro(권장)는 확장 가능한 voices 입력(최대 5개 슬롯)을, s1은 단일 선택 voice 입력을 제공합니다. 음성이 하나뿐이면 노드는 내부적으로 reference_id로 전달합니다. 두 개 이상 연결할 때는 텍스트에 @Voice1, @Voice2 등으로 화자를 표시해야 하며, 연결된 모든 음성이 텍스트에 최소 한 번은 등장해야 합니다. 그렇지 않으면 노드가 오류를 냅니다. 자세한 내용은 프롬프트 가이드의 다중 화자 대화를 참고하세요.
클론 제한
Instant Voice Clone 노드는 1enhance_audio_quality 옵션은 기본적으로 활성화되어 있습니다. 녹음 팁은 프롬프트 가이드의 보이스 클론 품질을 참고하세요.
계정 및 가격
이 노드들은 ComfyUI 계정 로그인이 필요하며 사용량에 따라 과금됩니다. 노드에 표시된 참고 가격: 텍스트→음성은 텍스트 1M 바이트당 약 0.00858, 보이스 클론은 무료입니다.사용 가능한 워크플로
3개의 템플릿이 Fish Audio의 주요 흐름을 다룹니다: 텍스트→음성, 보이스 클론→음성, 음성→텍스트. ComfyUI의 템플릿 라이브러리에서 열거나 Comfy Cloud에서 바로 실행할 수 있습니다. 보이스 클론과 음성→텍스트 템플릿은 ComfyUI 0.34.0 이상이 필요합니다.Fish Audio: 텍스트-음성
프리셋 목소리로 대사를 음성으로 생성합니다. 프롬프트 가이드의 인라인 태그를 텍스트에 작성하고, Voice Selector에서 다른 프리셋을 고르거나 클론 목소리를 연결하세요.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON 다운로드 또는 템플릿 라이브러리에서 “Fish Audio: Text to Speech” 검색
LoadAudio 노드에 업로드하세요:
fish_audio_example.mp3
LoadAudio 노드 11 · fish_audio_example.mp3Fish Audio: 보이스 클론-음성
짧은 녹음에서 목소리를 클론하고, 그 목소리로 어떤 대사든 말하게 합니다. 15LoadAudio 노드로 업로드하거나(RecordAudio 노드에서 직접 녹음도 가능), Instant Voice Clone 출력을 Text to Speech 노드에 연결하세요. 녹음 팁은 프롬프트 가이드의 보이스 클론 품질을 참고하세요.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON 다운로드 또는 템플릿 라이브러리에서 “Fish Audio: Voice Clone to Speech” 검색
LoadAudio 노드에 업로드하세요:
api_fishaudio_voice_clone_tts_fish_audio_example.mp3
LoadAudio 노드 11 · api_fishaudio_voice_clone_tts_fish_audio_example.mp3Fish Audio: 음성-텍스트
오디오 클립을 텍스트로 전사합니다. 80개 이상의 언어가 자동 감지되며,precise_timestamps를 활성화하면 세그먼트별 시작·종료 시간이 JSON으로 반환되어 자막 제작에 유용합니다.
Comfy Cloud에서 실행
Comfy Cloud에서 열기
워크플로 다운로드
JSON 다운로드 또는 템플릿 라이브러리에서 “Fish Audio: Speech to Text” 검색
LoadAudio 노드에 업로드하세요:
fish_audio_example.mp3
LoadAudio 노드 11 · fish_audio_example.mp3시작하기
- ComfyUI를 최신 버전으로 업데이트합니다
- 위의 워크플로 템플릿을 열거나, 노드 메뉴의
partner/audio/Fish Audio카테고리에서 Fish Audio 노드를 추가합니다 - 안내가 뜨면 ComfyUI 계정에 로그인합니다
- 프롬프트 가이드의 인라인 태그로 대사를 작성합니다
- 워크플로를 실행하고 오디오를 미리 듣거나 저장합니다