Skip to main content
Fish Audio는 텍스트→음성, 보이스 클론, 음성→텍스트를 아우르는 음성 AI 서비스입니다. ComfyUI에서는 4개의 partner 노드(Text to Speech, Speech to Text, Voice Selector, Instant Voice Clone)로 제공됩니다. 이 페이지는 준비된 워크플로 템플릿과 노드 연결 방법을 다룹니다. 인라인 태그(감정·톤·멈춤·음소)의 전체 레퍼런스는 Fish Audio 프롬프트 가이드를 참고하세요.
파트너 노드를 사용하려면 올바르게 로그인되어 있고 허가된 네트워크 환경을 사용하고 있는지 확인해야 합니다. 파트너 노드를 사용하기 위한 구체적인 요구사항은 문서의 파트너 노드 개요 섹션을 참조해 주세요.
ComfyUI가 최신 버전으로 업데이트되었는지 확인하세요.이 가이드의 워크플로는 워크플로 템플릿에서 확인할 수 있습니다. 템플릿에서 찾을 수 없다면, 귀하의 ComfyUI가 오래된 버전일 수 있습니다.워크플로를 로드할 때 노드가 누락되는 경우, 가능한 원인:
  1. 최신 ComfyUI 버전(최신 테스트 버전(nightly))을 사용하고 있지 않음
  2. 일부 노드가 시작 시 가져오기에 실패함

ComfyUI에서 Fish Audio 사용하기

Fish Audio partner nodes는 노드 메뉴의 partner/audio/Fish Audio 카테고리에 있습니다. 4개의 노드가 워크플로를 다룹니다:
  • Fish Audio Text to Speech: 텍스트를 음성으로 변환합니다. 출력은 AUDIO
  • Fish Audio Speech to Text: 오디오를 텍스트로 전사합니다. 출력은 text, language_code, segments_json
  • Fish Audio Voice Selector: 프리셋 목소리에서 선택하거나, custom으로 임의의 fish.audio 음성 모델을 입력합니다 (https://fish.audio/m/<id>/의 ID). 출력은 voice
  • Fish Audio Instant Voice Clone: 녹음으로 비공개 클론 목소리를 만듭니다. 출력은 voice

모델 선택

Text to Speech 노드의 model 파라미터에는 두 가지 옵션이 있습니다:
  • s2.1-pro(권장): 0~5개로 확장 가능한 음성 입력으로 다중 화자를 지원합니다
  • s1(legacy): 단일 선택 음성 입력을 받으며, 프롬프트 가이드에서 설명하는 괄호 감정 태그 구문을 사용합니다

목소리 연결

Voice Selector 또는 Instant Voice Clone의 voice 출력을 Text to Speech 노드에 연결합니다. 입력 이름은 모델에 따라 다릅니다: s2.1-pro(권장)는 확장 가능한 voices 입력(최대 5개 슬롯)을, s1은 단일 선택 voice 입력을 제공합니다. 음성이 하나뿐이면 노드는 내부적으로 reference_id로 전달합니다. 두 개 이상 연결할 때는 텍스트에 @Voice1, @Voice2 등으로 화자를 표시해야 하며, 연결된 모든 음성이 텍스트에 최소 한 번은 등장해야 합니다. 그렇지 않으면 노드가 오류를 냅니다. 자세한 내용은 프롬프트 가이드의 다중 화자 대화를 참고하세요.

클론 제한

Instant Voice Clone 노드는 120개의 녹음을 받으며, 클립당 1030초를 권장하고 총 길이가 270초 미만인지 하드 검증합니다. enhance_audio_quality 옵션은 기본적으로 활성화되어 있습니다. 녹음 팁은 프롬프트 가이드의 보이스 클론 품질을 참고하세요.

계정 및 가격

이 노드들은 ComfyUI 계정 로그인이 필요하며 사용량에 따라 과금됩니다. 노드에 표시된 참고 가격: 텍스트→음성은 텍스트 1M 바이트당 약 21.45,음성텍스트는분당21.45, 음성→텍스트는 분당 0.00858, 보이스 클론은 무료입니다.

사용 가능한 워크플로

3개의 템플릿이 Fish Audio의 주요 흐름을 다룹니다: 텍스트→음성, 보이스 클론→음성, 음성→텍스트. ComfyUI의 템플릿 라이브러리에서 열거나 Comfy Cloud에서 바로 실행할 수 있습니다. 보이스 클론과 음성→텍스트 템플릿은 ComfyUI 0.34.0 이상이 필요합니다.

Fish Audio: 텍스트-음성

프리셋 목소리로 대사를 음성으로 생성합니다. 프롬프트 가이드의 인라인 태그를 텍스트에 작성하고, Voice Selector에서 다른 프리셋을 고르거나 클론 목소리를 연결하세요. Fish Audio: 텍스트-음성 워크플로 미리보기

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “Fish Audio: Text to Speech” 검색
입력 자료 이 파일을 해당 LoadAudio 노드에 업로드하세요:

fish_audio_example.mp3

LoadAudio 노드 11 · fish_audio_example.mp3

Fish Audio: 보이스 클론-음성

짧은 녹음에서 목소리를 클론하고, 그 목소리로 어떤 대사든 말하게 합니다. 1520초 길이의 클립을 23개 녹음해 LoadAudio 노드로 업로드하거나(RecordAudio 노드에서 직접 녹음도 가능), Instant Voice Clone 출력을 Text to Speech 노드에 연결하세요. 녹음 팁은 프롬프트 가이드의 보이스 클론 품질을 참고하세요. Fish Audio: 보이스 클론-음성 워크플로 미리보기

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “Fish Audio: Voice Clone to Speech” 검색
입력 자료 이 파일을 해당 LoadAudio 노드에 업로드하세요:

api_fishaudio_voice_clone_tts_fish_audio_example.mp3

LoadAudio 노드 11 · api_fishaudio_voice_clone_tts_fish_audio_example.mp3

Fish Audio: 음성-텍스트

오디오 클립을 텍스트로 전사합니다. 80개 이상의 언어가 자동 감지되며, precise_timestamps를 활성화하면 세그먼트별 시작·종료 시간이 JSON으로 반환되어 자막 제작에 유용합니다. Fish Audio: 음성-텍스트 워크플로 미리보기

Comfy Cloud에서 실행

Comfy Cloud에서 열기

워크플로 다운로드

JSON 다운로드 또는 템플릿 라이브러리에서 “Fish Audio: Speech to Text” 검색
입력 자료 이 파일을 해당 LoadAudio 노드에 업로드하세요:

fish_audio_example.mp3

LoadAudio 노드 11 · fish_audio_example.mp3

시작하기

  1. ComfyUI를 최신 버전으로 업데이트합니다
  2. 위의 워크플로 템플릿을 열거나, 노드 메뉴의 partner/audio/Fish Audio 카테고리에서 Fish Audio 노드를 추가합니다
  3. 안내가 뜨면 ComfyUI 계정에 로그인합니다
  4. 프롬프트 가이드의 인라인 태그로 대사를 작성합니다
  5. 워크플로를 실행하고 오디오를 미리 듣거나 저장합니다