docs: add exact Qwen3-TTS download commands and model sizes
This commit is contained in:
@@ -30,13 +30,32 @@ SaveAudioMP3 → final podcast audio
|
|||||||
- `vibevoice-1.5B` ⚠️ — Partially downloaded (incomplete files)
|
- `vibevoice-1.5B` ⚠️ — Partially downloaded (incomplete files)
|
||||||
|
|
||||||
### Qwen3-TTS
|
### Qwen3-TTS
|
||||||
- `Qwen3-TTS-12Hz-1.7B-Base` ❌ — Needs download (voice cloning)
|
- `Qwen3-TTS-12Hz-1.7B-Base` ❌ — Needs download (3.9GB, voice cloning)
|
||||||
- `Qwen3-TTS-12Hz-1.7B-CustomVoice` ❌ — Needs download (preset voices)
|
- `Qwen3-TTS-12Hz-1.7B-CustomVoice` ❌ — Needs download (3.8GB, preset voices)
|
||||||
- `Qwen3-TTS-12Hz-1.7B-VoiceDesign` ❌ — Needs download (voice design via description)
|
- `Qwen3-TTS-12Hz-1.7B-VoiceDesign` ❌ — **CRITICAL** — Needs download (3.8GB, voice design via description)
|
||||||
|
|
||||||
|
**To download on the ComfyUI server:**
|
||||||
|
```bash
|
||||||
|
# SSH into ComfyUI server or run via ComfyUI Manager
|
||||||
|
# Models go in: models/TTS/Qwen3-TTS/
|
||||||
|
|
||||||
|
# VoiceDesign model (for generating character voices from descriptions)
|
||||||
|
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign \
|
||||||
|
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-VoiceDesign
|
||||||
|
|
||||||
|
# Base model (for voice cloning from reference audio)
|
||||||
|
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-Base \
|
||||||
|
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-Base
|
||||||
|
|
||||||
|
# CustomVoice model (for preset voices with instruction control)
|
||||||
|
huggingface-cli download Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice \
|
||||||
|
--local-dir /path/to/ComfyUI/models/TTS/Qwen3-TTS/Qwen3-TTS-12Hz-1.7B-CustomVoice
|
||||||
|
```
|
||||||
|
|
||||||
To download, put models in: `ComfyUI/models/TTS/Qwen3-TTS/`
|
|
||||||
Source: https://huggingface.co/collections/Qwen/qwen3-tts
|
Source: https://huggingface.co/collections/Qwen/qwen3-tts
|
||||||
|
|
||||||
|
**Note:** The ComfyUI-Qwen3-TTS node (by DarioFT) expects models in the TTS folder. The VoiceDesign model is essential for our pipeline — it converts natural language voice descriptions into reference audio.
|
||||||
|
|
||||||
## Available TTS Engines (TTS Audio Suite)
|
## Available TTS Engines (TTS Audio Suite)
|
||||||
|
|
||||||
| Engine | Multi-Speaker | VRAM | Use Case |
|
| Engine | Multi-Speaker | VRAM | Use Case |
|
||||||
|
|||||||
Reference in New Issue
Block a user