Gradium AI lance un modèle TTS précis et ultra-rapide
Les agents vocaux produisent enfin un rendu fiable sur les phrases les plus problématiques : numéros de commande, chiffres de rappel, adresses e-mail. Gradium AI vient de déployer un nouveau modèle par défaut de synthèse vocale (TTS) affichant un taux de réussite de 81,0 % (évalué par des humains) sur un ensemble de 500 phrases complexes dans cinq langues. Ce résultat dépasse ceux de Cartesia Sonic 3.6 (75,1 %) et ElevenLabs v3 Conversational (65,4 %). Parallèlement, il atteint un temps médian de 216 ms pour la première émission audio sur le benchmark de Coval, soit 170 ms plus rapide que son prédécesseur, avec une dispersion interquartile serrée de 30 ms.
Conçu pour les cas critiques qui paralysent les autres systèmes
L’ensemble d’évaluation de Gradium repose sur dix critères stricts en anglais, allemand, français, espagnol et portugais : orthographe, acronymes, jetons alphanumériques, dates, nombres de toutes tailles et adresses e-mail. Chaque phrase doit être prononcée sans erreur par des locuteurs natifs indépendants ; une seule lettre ou chiffre manquant entraîne l’échec du test. L’entreprise a open-sourcé ce jeu de données sur Hugging Face sous licence CC BY 4.0, invitant à une vérification externe et à des améliorations continues.
Aucune migration, aucune interruption
Les clients existants continuent d’utiliser les mêmes identifiants vocaux et points d’accès ; le nouveau modèle est devenu la référence par défaut dans l’API et Studio de Gradium depuis le 31 août 2026. Les nouveaux utilisateurs peuvent s’intégrer via le SDK Python et se connecter au point d’accès WebSocket TTS sans modifier leurs flux de travail. Gradium offre également un million de crédits aux utilisateurs qui soumettent des rapports d’échec complets sur son Discord, renforçant une boucle de rétroaction susceptible d’affiner encore la précision.
Pourquoi c’est important
Pour toute entreprise utilisant des agents vocaux, la différence entre 65 % et 81 % de précision sur des phrases critiques se traduit directement par une réduction des rappels et une meilleure résolution dès le premier appel. Par ailleurs, le passage d’un temps de réponse d’environ 386 ms à 216 ms diminue la latence perçue par les appelants, améliorant concrètement l’expérience utilisateur. En combinant des benchmarks stricts validés par des humains, des données ouvertes et un déploiement transparent, Gradium pousse l’industrie à adopter des modèles à la fois fiables et suffisamment rapides pour des interactions en temps réel.
Source : MarkTechPost. Synthèse éditoriale assistée par IA — TechnoExpress.

