docs: add exact Qwen3-TTS download commands and model sizes
This commit is contained in:
@@ -30,13 +30,32 @@ SaveAudioMP3 → final podcast audio
|
||||
- `vibevoice-1.5B` ⚠️ — Partially downloaded (incomplete files)
|
||||
|
||||
### Qwen3-TTS
|
||||
- `Qwen3-TTS-12Hz-1.7B-Base` ❌ — Needs download (voice cloning)
|
||||
- `Qwen3-TTS-12Hz-1.7B-CustomVoice` ❌ — Needs download (preset voices)
|
||||
- `Qwen3-TTS-12Hz-1.7B-VoiceDesign` ❌ — Needs download (voice design via description)
|
||||
- `Qwen3-TTS-12Hz-1.7B-Base` ❌ — Needs download (3.9GB, voice cloning)
|
||||
- `Qwen3-TTS-12Hz-1.7B-CustomVoice` ❌ — Needs download (3.8GB, preset voices)
|
||||
- `Qwen3-TTS-12Hz-1.7B-VoiceDesign` ❌ — **CRITICAL** — Needs download (3.8GB, voice design via description)
|
||||
|
||||
**To download on the ComfyUI server:**
|
||||
```bash
|
||||
# SSH into ComfyUI server or run via ComfyUI Manager
|
||||
# Models go in: models/TTS/Qwen3-TTS/
|
||||
|
||||
# VoiceDesign model (for generating character voices from descriptions)
|
||||
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign \
|
||||
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-VoiceDesign
|
||||
|
||||
# Base model (for voice cloning from reference audio)
|
||||
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-Base \
|
||||
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-Base
|
||||
|
||||
# CustomVoice model (for preset voices with instruction control)
|
||||
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice \
|
||||
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-CustomVoice
|
||||
```
|
||||
|
||||
To download, put models in: `ComfyUI/models/TTS/Qwen3-TTS/`
|
||||
Source: https://huggingface.co/collections/Qwen/qwen3-tts
|
||||
|
||||
**Note:** The ComfyUI-Qwen3-TTS node (by DarioFT) expects models in the TTS folder. The VoiceDesign model is essential for our pipeline — it converts natural language voice descriptions into reference audio.
|
||||
|
||||
## Available TTS Engines (TTS Audio Suite)
|
||||
|
||||
| Engine | Multi-Speaker | VRAM | Use Case |
|
||||
|
||||
Reference in New Issue
Block a user