Chatterbox
Chatterbox est le modèle TTS open source de Resemble AI, MIT-licensé, avec contrôle émotionnel, clonage vocal depuis 5 secondes et support de 23 langues dont le français, gratuit en auto-hébergement.
Présentation
Chatterbox génère des narrations audio depuis un GPU local ou via l'API Resemble AI, avec un paramètre d'exagération émotionnelle unique permettant d'ajuster l'intensité expressive de monotone à dramatique en une seule valeur numérique.
Là où Qwen3-TTS couvre 10 langues, Chatterbox Multilingual V3 en supporte 23 avec clonage vocal zéro-shot intégré, sous licence MIT, sans abonnement ni dépendance fournisseur.
L'outil convient aux développeurs cherchant un TTS open source production-grade, bien que les benchmarks indépendants le situent en retrait d'ElevenLabs sur la qualité vocale brute et que la qualité française reste peu documentée.
✅ Points forts
- ✓Gratuit en auto-hébergement licence MIT commerciale
- ✓Premier TTS open source avec contrôle émotionnel par paramètre
- ✓23 langues avec clonage zéro-shot depuis 5 secondes
- ✓PerTh watermarking neural intégré par défaut
- ✓API Flex sans minimum ni expiration de crédits
⚠️ Limites
- ✗ELO Artificial Analysis inférieur à ElevenLabs Eleven v3
- ✗Benchmark Podonos commandité par Resemble AI
- ✗Qualité française peu documentée indépendamment
- ✗GPU recommandé pour auto-hébergement production
- ✗Pas d'interface studio no-code en dehors de Hugging Face
Notes détaillées
- Naturalité de la voix7.5/10
- Clonage vocal (ressemblance)8.0/10
- Émotions & intonation8.0/10
- Prononciation & accent français6.5/10
- Qualité sonore & export7.5/10
- Cohérence sur texte long7.0/10
- Rapport qualité-prix9.5/10
Détail des plans
- •Auto-hébergement — Gratuit — modèles Chatterbox (0,5B), Turbo (350M) et Multilingual V3 (0,5B), licence MIT, usage commercial inclus, GPU recommandé.
- •Resemble AI Flex (API managée) — 0$ pour démarrer, pay-as-you-go, crédits sans expiration, sans abonnement minimum.
- •Text-to-speech (API) — 0,0005$/seconde d'audio généré.
- •Voice agents (API) — 0,001$/seconde.
- •AI voice changer (API) — 0,0005$/seconde.
- •Rapid Voice Clone (add-on) — 2$/mois/voix — clonage depuis 10 secondes d'audio.
- •Pro Voice Clone (add-on) — 5$/mois/voix — clonage haute fidélité 10–25+ minutes.
- •Voice Design (add-on) — 2$/mois/voix.
- •Team seat (add-on) — 20$/mois/utilisateur.
- •Enterprise — sur demande — fine-tuning personnalisé, SLA, déploiement on-premise, remises jusqu'à 80%.
- •→ Exemple : 300 000 secondes TTS/mois = 150$/mois sur Flex.
Caractéristiques clés
- ★Chatterbox Turbo : 350M paramètres, ~75ms latence, tags paralinguistiques
- ★Multilingual V3 : 23 langues, clonage zéro-shot voix préservée cross-langue
- ★Paramètre exaggeration (0–1) : contrôle émotionnel en une valeur
- ★PerTh watermarking : filigrane imperceptible robuste à la compression MP3
- ★Déploiement cloud, on-premise ou air-gapped via Resemble AI Enterprise