diff --git a/README.md b/README.md index 49dad0c..dbb463b 100644 --- a/README.md +++ b/README.md @@ -30,13 +30,32 @@ SaveAudioMP3 → final podcast audio - `vibevoice-1.5B` ⚠️ — Partially downloaded (incomplete files) ### Qwen3-TTS -- `Qwen3-TTS-12Hz-1.7B-Base` ❌ — Needs download (voice cloning) -- `Qwen3-TTS-12Hz-1.7B-CustomVoice` ❌ — Needs download (preset voices) -- `Qwen3-TTS-12Hz-1.7B-VoiceDesign` ❌ — Needs download (voice design via description) +- `Qwen3-TTS-12Hz-1.7B-Base` ❌ — Needs download (3.9GB, voice cloning) +- `Qwen3-TTS-12Hz-1.7B-CustomVoice` ❌ — Needs download (3.8GB, preset voices) +- `Qwen3-TTS-12Hz-1.7B-VoiceDesign` ❌ — **CRITICAL** — Needs download (3.8GB, voice design via description) + +**To download on the ComfyUI server:** +```bash +# SSH into ComfyUI server or run via ComfyUI Manager +# Models go in: models/TTS/Qwen3-TTS/ + +# VoiceDesign model (for generating character voices from descriptions) +huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign \ + --local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-VoiceDesign + +# Base model (for voice cloning from reference audio) +huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-Base \ + --local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-Base + +# CustomVoice model (for preset voices with instruction control) +huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice \ + --local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-CustomVoice +``` -To download, put models in: `ComfyUI/models/TTS/Qwen3-TTS/` Source: https://huggingface.co/collections/Qwen/qwen3-tts +**Note:** The ComfyUI-Qwen3-TTS node (by DarioFT) expects models in the TTS folder. The VoiceDesign model is essential for our pipeline — it converts natural language voice descriptions into reference audio. + ## Available TTS Engines (TTS Audio Suite) | Engine | Multi-Speaker | VRAM | Use Case |