- Small-SFX — 効果音や短いアンビエンス、最大2分。CPUでも動作可能な小型モデル。
- Small-Music — 短い音楽ループ、デバイス上での使用に最適、最大2分。
- Medium — より長い楽曲、構造と音楽性に優れ、最大約6分20秒。GPUが必要。
利用可能なワークフロー
Stable Audio 3.0 Medium
短いテキストアイデア、任意の再生時間、シード、カテゴリを入力して、Stable Audio 3 でステレオオーディオ(音楽、SFX、または楽器)を生成します。AI によるテキスト拡張はオプションで利用できます。
Comfy Cloud で実行
Comfy Cloud で開く
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで “Stable Audio 3.0 Medium” を検索
- テキストアイデア:生成したいサウンド、音楽、または効果の短い説明を入力します(例:「重いベースのアップテンポなエレクトロニックダンストラック」)
- 再生時間:希望するクリップの長さ(秒)を設定します(デフォルトは異なる場合があります)
- シード:シード値を調整して再現性を制御します
- カテゴリ:リプロンプトプリセットを選択します:Music(音楽)、Instrument(楽器)、SFX(効果音)、または One-shot(単発音)
- リプロンプトを有効化:
use_repromptをオンにして、生成前に Qwen が短いアイデアを詳細なプロンプトに展開できるようにします - 実行(
Ctrl/Cmd + Enter)をクリックして生成します。オーディオはComfyUI/output/audio/に保存されます
Stable Audio 3.0 Medium Base
サウンド、音楽、または効果の短いテキスト説明を入力します。ワークフローは Qwen でプロンプトを拡張し、Stable Audio 3 からステレオオーディオクリップを生成します。
Comfy Cloud で実行
Comfy Cloud で開く
ワークフローをダウンロード
JSON をダウンロードするか、テンプレートライブラリで “Stable Audio 3.0 Medium Base” を検索
- テキストプロンプト:生成したいオーディオの詳細な説明を入力します
- 再生時間:クリップの長さ(秒)を設定します
- シード:再現性を制御します
- 実行(
Ctrl/Cmd + Enter)をクリックして生成します
モデルダウンロード
ワークフローを読み込むと、モデルがない場合に ComfyUI がダウンロードリンクを提示します。手動で設定する場合、以下のファイルをダウンロードして適切なフォルダに配置してください。チェックポイント
stable_audio_3_medium.safetensors
Medium ワークフロー用。models/checkpoints/ に配置
stable_audio_3_medium_base.safetensors
Medium Base ワークフロー用。models/checkpoints/ に配置
テキストエンコーダー
t5gemma_b_b_ul2.safetensors
すべての Stable Audio 3 ワークフローで必要。models/text_encoders/ に配置
qwen3.5_2b_bf16.safetensors
Medium ワークフローで必要(Qwen リプロンプト)。models/text_encoders/ に配置