← Retour au comparateur
🗣️
Audio

Chatterbox

Chatterbox est le modèle TTS open source de Resemble AI, MIT-licensé, avec contrôle émotionnel, clonage vocal depuis 5 secondes et support de 23 langues dont le français, gratuit en auto-hébergement.

★ 7.7/10Gratuit

Présentation

Chatterbox génère des narrations audio depuis un GPU local ou via l'API Resemble AI, avec un paramètre d'exagération émotionnelle unique permettant d'ajuster l'intensité expressive de monotone à dramatique en une seule valeur numérique.

Là où Qwen3-TTS couvre 10 langues, Chatterbox Multilingual V3 en supporte 23 avec clonage vocal zéro-shot intégré, sous licence MIT, sans abonnement ni dépendance fournisseur.

L'outil convient aux développeurs cherchant un TTS open source production-grade, bien que les benchmarks indépendants le situent en retrait d'ElevenLabs sur la qualité vocale brute et que la qualité française reste peu documentée.

✅ Points forts

  • Gratuit en auto-hébergement licence MIT commerciale
  • Premier TTS open source avec contrôle émotionnel par paramètre
  • 23 langues avec clonage zéro-shot depuis 5 secondes
  • PerTh watermarking neural intégré par défaut
  • API Flex sans minimum ni expiration de crédits

⚠️ Limites

  • ELO Artificial Analysis inférieur à ElevenLabs Eleven v3
  • Benchmark Podonos commandité par Resemble AI
  • Qualité française peu documentée indépendamment
  • GPU recommandé pour auto-hébergement production
  • Pas d'interface studio no-code en dehors de Hugging Face

Notes détaillées

Note globale
7.7 / 10
  • Naturalité de la voix
    7.5/10
  • Clonage vocal (ressemblance)
    8.0/10
  • Émotions & intonation
    8.0/10
  • Prononciation & accent français
    6.5/10
  • Qualité sonore & export
    7.5/10
  • Cohérence sur texte long
    7.0/10
  • Rapport qualité-prix
    9.5/10

Détail des plans

  • Auto-hébergement — Gratuit — modèles Chatterbox (0,5B), Turbo (350M) et Multilingual V3 (0,5B), licence MIT, usage commercial inclus, GPU recommandé.
  • Resemble AI Flex (API managée) — 0$ pour démarrer, pay-as-you-go, crédits sans expiration, sans abonnement minimum.
  • Text-to-speech (API) — 0,0005$/seconde d'audio généré.
  • Voice agents (API) — 0,001$/seconde.
  • AI voice changer (API) — 0,0005$/seconde.
  • Rapid Voice Clone (add-on) — 2$/mois/voix — clonage depuis 10 secondes d'audio.
  • Pro Voice Clone (add-on) — 5$/mois/voix — clonage haute fidélité 10–25+ minutes.
  • Voice Design (add-on) — 2$/mois/voix.
  • Team seat (add-on) — 20$/mois/utilisateur.
  • Enterprise — sur demande — fine-tuning personnalisé, SLA, déploiement on-premise, remises jusqu'à 80%.
  • → Exemple : 300 000 secondes TTS/mois = 150$/mois sur Flex.

Caractéristiques clés

  • Chatterbox Turbo : 350M paramètres, ~75ms latence, tags paralinguistiques
  • Multilingual V3 : 23 langues, clonage zéro-shot voix préservée cross-langue
  • Paramètre exaggeration (0–1) : contrôle émotionnel en une valeur
  • PerTh watermarking : filigrane imperceptible robuste à la compression MP3
  • Déploiement cloud, on-premise ou air-gapped via Resemble AI Enterprise