docs: add exact Qwen3-TTS download commands and model sizes

This commit is contained in:
Hermes Cron Job
2026-07-18 13:46:46 +00:00
parent a865d76c81
commit 5bbb965267
+23 -4
View File
@@ -30,13 +30,32 @@ SaveAudioMP3 → final podcast audio
- `vibevoice-1.5B` ⚠️ — Partially downloaded (incomplete files)
### Qwen3-TTS
- `Qwen3-TTS-12Hz-1.7B-Base` ❌ — Needs download (voice cloning)
- `Qwen3-TTS-12Hz-1.7B-CustomVoice` ❌ — Needs download (preset voices)
- `Qwen3-TTS-12Hz-1.7B-VoiceDesign` ❌ — Needs download (voice design via description)
- `Qwen3-TTS-12Hz-1.7B-Base` ❌ — Needs download (3.9GB, voice cloning)
- `Qwen3-TTS-12Hz-1.7B-CustomVoice` ❌ — Needs download (3.8GB, preset voices)
- `Qwen3-TTS-12Hz-1.7B-VoiceDesign` ❌ — **CRITICAL** Needs download (3.8GB, voice design via description)
**To download on the ComfyUI server:**
```bash
# SSH into ComfyUI server or run via ComfyUI Manager
# Models go in: models/TTS/Qwen3-TTS/
# VoiceDesign model (for generating character voices from descriptions)
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign \
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-VoiceDesign
# Base model (for voice cloning from reference audio)
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-Base \
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-Base
# CustomVoice model (for preset voices with instruction control)
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice \
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-CustomVoice
```
To download, put models in: `ComfyUI/models/TTS/Qwen3-TTS/`
Source: https://huggingface.co/collections/Qwen/qwen3-tts
**Note:** The ComfyUI-Qwen3-TTS node (by DarioFT) expects models in the TTS folder. The VoiceDesign model is essential for our pipeline — it converts natural language voice descriptions into reference audio.
## Available TTS Engines (TTS Audio Suite)
| Engine | Multi-Speaker | VRAM | Use Case |