Qwen3-TTS
Qwen3-TTS est un modèle open source d'Alibaba qui génère des voix synthétiques, clone une voix en 3 secondes et conçoit des voix sur description textuelle, en 10 langues dont le français, avec licence commerciale gratuite.
Présentation
Qwen3-TTS génère des narrations audio en quelques secondes depuis un GPU local ou via l'API cloud d'Alibaba, sans abonnement mensuel, avec des voix synthétiques que les benchmarks situent parmi les meilleures de la catégorie open source.
Contrairement à ElevenLabs ou Murf qui facturent à l'usage sous abonnement, Qwen3-TTS s'installe localement sous licence Apache 2.0 — le coût marginal tombe à zéro pour les volumes élevés, à condition de disposer d'un GPU compatible.
L'outil convient aux développeurs et équipes techniques capables de gérer un déploiement local, bien que l'absence d'interface no-code et l'exigence d'un GPU NVIDIA en fassent un outil réservé aux profils techniques.
✅ Points forts
- ✓Gratuit en auto-hébergement licence Apache 2.0
- ✓Clonage vocal depuis 3 secondes d'audio seulement
- ✓Contrôle émotionnel via instructions en langage naturel
- ✓Parmi les meilleurs TTS open source sur benchmarks
- ✓API pay-as-you-go dès 0,10$/10 000 caractères
⚠️ Limites
- ✗GPU NVIDIA requis — inaccessible sans matériel adapté
- ✗Pas d'interface no-code ni de studio en ligne
- ✗Français correct mais chinois reste la langue phare
- ✗10 langues seulement contre 70+ chez ElevenLabs
- ✗Support limité à GitHub Issues et documentation officielle
Notes détaillées
- Naturalité de la voix7.5/10
- Clonage vocal (ressemblance)8.5/10
- Émotions & intonation8.0/10
- Prononciation & accent français7.0/10
- Qualité sonore & export7.5/10
- Cohérence sur texte long7.5/10
- Rapport qualité-prix9.0/10
Détail des plans
- •Auto-hébergement — Gratuit — modèles 0,6B et 1,7B, licence Apache 2.0, usage commercial inclus, GPU NVIDIA requis (4 Go VRAM minimum).
- •qwen3-tts-flash (API) — 0,10$/10 000 caractères — synthèse standard, streaming disponible.
- •qwen3-tts-instruct-flash (API) — 0,115$/10 000 caractères — contrôle émotionnel via langage naturel.
- •qwen3-tts-vc (API) — 0,115$/10 000 caractères — clonage vocal (Voice Clone).
- •qwen3-tts-vd (API) — 0,115$/10 000 caractères — création de voix par description textuelle (Voice Design).
- •qwen3-tts-flash-realtime (API) — 0,13$/10 000 caractères — synthèse temps réel basse latence.
- •→ Quota d'essai gratuit disponible à l'inscription (région Singapore — Alibaba Cloud Model Studio).
Caractéristiques clés
- ★Clonage vocal zéro-shot depuis 3 secondes d'audio
- ★Voice Design : création de voix par description textuelle
- ★Contrôle prosodie et émotions via langage naturel (Instruct-Flash)
- ★Streaming audio temps réel via WebSocket (97ms premier paquet)
- ★Deux variants : 0,6B (léger) et 1,7B (haute fidélité)