Aller au contenu

Speko : le routeur intelligent qui optimise vos agents vocaux IA

En août 2026, les agents vocaux alimentés par l'IA se sont imposés comme une composante essentielle de la relation client. Pourtant, la plupart des entreprises utilisent encore les modèles du trimestre précédent, alors que des alternatives plus performantes et économiques sont disponibles. Speko, une startup issue de Y Combinator, propose une solution élégante : un routeur intelligent qui sélectionne automatiquement la meilleure combinaison de modèles de reconnaissance vocale, de traitement du langage et de synthèse vocale selon vos contraintes.

L'architecture complexe des agents vocaux modernes

Un agent vocal en production repose sur trois composants fondamentaux : un modèle de reconnaissance vocale (STT, speech-to-text), un grand modèle de langage (LLM) et un modèle de synthèse vocale (TTS, text-to-speech). Chaque couche compte une douzaine de fournisseurs crédibles, et de nouveaux modèles apparaissent chaque mois.

Le problème ? La plupart des équipes évaluent une fois, choisissent une pile technologique, puis n'y reviennent jamais. Changer de fournisseur implique une nouvelle intégration technique et des débats sans fin sur les métriques de performance. Cette inertie coûte cher : pendant que vous utilisez les modèles du trimestre dernier, des options meilleures et moins coûteuses sont déjà sur le marché.

Cette problématique dépasse le seul domaine vocal. Comme l'expliquent les experts en communication d'entreprise assistée par IA, l'optimisation continue des modèles devient un enjeu stratégique majeur pour maintenir sa compétitivité.

Comment fonctionne le routeur Speko

Speko transforme ce processus d'évaluation permanent en un simple appel API. Vous envoyez une requête avec vos critères d'optimisation (précision, latence, coût ou équilibré), la langue et la région. Le routeur filtre les modèles mesurés pour cette combinaison de contraintes, les compare, sélectionne le vainqueur et renvoie une réponse avec les en-têtes contenant le fournisseur, les noms des modèles et les scores.

L'architecture technique est particulièrement astucieuse : la passerelle pré-récupère les plans de session signés, permettant à une nouvelle session de se connecter directement au fournisseur depuis la mémoire, sans aller-retour dans le plan de contrôle pendant que l'appelant patiente.

Le basculement automatique (failover) n'intervient que pendant la phase d'établissement de connexion : si le fournisseur refuse la tentative de connexion, Speko se connecte automatiquement aux seconds choix.

Une approche open source et transparente

Speko a également publié sa passerelle en open source sous licence MIT (disponible sur GitHub). Cette approche permet aux équipes qui souhaitent éviter un saut réseau supplémentaire sur le chemin audio et ne veulent pas partager leurs clés API avec le cloud de Speko de déployer la solution localement.

Un seul binaire Go, fonctionnant comme un sidecar dans le conteneur de votre agent, communique via un protocole local sur socket Unix, épingle les hôtes fournisseurs et attache vos clés. En mode BYOK (Bring Your Own Key), la passerelle ne communique pas du tout avec les serveurs de Speko.

Des benchmarks publics et impartiaux

La partie mesure est entièrement publique : Speko passe les mêmes entrées à chaque modèle dans une région donnée lors d'exécutions datées différentes et publie les tableaux de bord, y compris ceux où leurs sélections sont moins performantes que les alternatives.

Critère de mesureMéthodologieCas d'usage
Précision STT200+ clips audio réels, taux d'erreur de mots (WER)Transcription médicale, juridique
Naturalité TTSTests A/B aveugles avec locuteurs natifsAssistants vocaux, audioguides
Détection de tour de parole94% de précision vs 46,9% pour un VAD simpleConversations téléphoniques
Latence de bout en boutMesures sur clips de 10 minutesSupport client en temps réel

Un exemple révélateur : une démo de lancement demande quel clip de 30 secondes sonne le mieux, mais la production pose une question différente : quel modèle tient le coup à la huitième minute ? Speko teste donc la parole spontanée, la reconnaissance des montants et des dates, des enregistrements de dix minutes, et les classements changent radicalement.

Illustration 1 sur Speko

Pour la naturalité TTS, Speko a entraîné un système de notation automatique basé sur des votes d'écoute en tête-à-tête aveugles. Sur des fournisseurs jamais vus auparavant, ce système sélectionne le même vainqueur que les évaluateurs humains aussi souvent que les évaluateurs sont d'accord entre eux.

Cette approche méthodique rappelle l'importance des meilleures pratiques de développement partagées lors des grandes conférences techniques internationales.

Cas d'usage concrets et résultats mesurables

Plusieurs entreprises ont déjà adopté Speko avec des résultats probants :

  • Startup en démarrage : Un fondateur ne sachant pas quels modèles choisir a fourni son cas d'usage et route désormais tout son trafic via la plateforme
  • Gestion immobilière : Une société utilisant LiveKit en Python n'avait pas mis à jour ses modèles STT et TTS depuis son lancement. Elle ignorait que son STT avait des taux d'erreur élevés et que de meilleures options existaient. Le changement semblait toujours être un projet de R&D
  • Service médical : Une équipe cherchait quel STT gérait le mieux le vocabulaire médical spécialisé
  • Support multilingue : Une entreprise ne savait pas quels modèles sélectionner pour l'espagnol

Dans chaque cas, Speko a aidé à identifier la pile technologique appropriée à partir des benchmarks, et ces entreprises routent maintenant leur trafic via la plateforme.

Optimisation des coûts et des ressources

L'optimisation ne concerne pas seulement la qualité, mais aussi l'efficacité des ressources. Comme le montre l'exemple d'optimisation de la capacité GPU, chaque pourcentage d'amélioration se traduit par des économies substantielles à l'échelle.

Une équipe effectuant des milliers d'appels par jour a témoigné : "Nous pouvons littéralement aller sur ce tableau de bord, changer le modèle, et la plateforme le fait pour nous." Cette simplicité opérationnelle libère les équipes techniques pour se concentrer sur l'innovation plutôt que sur la maintenance.

Défis techniques et compromis

Le routage pour la voix présente des défis spécifiques absents du routage textuel. L'espace de contraintes est plus complexe : budget de latence (aller-retour vs streaming), taux d'erreur de mots (WER) sur la parole accentuée, et naturalité TTS s'échangent de manière non linéaire.

La question du transport et de la langue

Un point crucial souvent négligé : la qualification "adapté au temps réel" s'avère être une propriété du transport, pas du modèle. Un utilisateur avait écarté un TTS comme trop lent selon les recommandations du fournisseur, puis l'a mesuré à nouveau sur un chemin de streaming et a obtenu environ 0,9 seconde là où l'appel non-streaming avait pris 5 secondes. Même modèle, même fournisseur, résultats radicalement différents.

Autre piège : les défaillances hors anglais n'apparaissent pas dans les chiffres de qualité globale. Les niveaux optimisés pour la vitesse (classe flash/turbo) fonctionnent bien en anglais mais s'effondrent dans d'autres langues comme le japonais, avec des mots confidemment erronés qui changent le sens de la phrase.

Illustration 2 sur Speko

Cette complexité multilingue se retrouve dans d'autres domaines de l'IA, notamment dans les technologies de clonage vocal où la fidélité phonétique varie considérablement selon les langues.

Modèle économique et adoption

La passerelle et la configuration BYOK resteront gratuites pour toujours. Speko facture le routeur hébergé et les clés gérées avec facturation consolidée. Depuis le début du batch Y Combinator fin juin 2026, l'utilisation externe a augmenté d'environ 25 % par semaine en moyenne, avec une concentration sur les semaines de lancement.

Impartialité garantie

Un élément crucial de la proposition de valeur : Speko ne forme ni ne vend ses propres modèles. C'est précisément ce qui maintient l'impartialité de leurs classements. Cette approche neutre inspire confiance dans un secteur où les conflits d'intérêts sont monnaie courante.

L'entreprise rejoint ainsi d'autres acteurs français qui misent sur la transparence et l'excellence technique, comme le montre la stratégie française en IA qui privilégie la souveraineté et l'ouverture.

Perspectives et évolution du marché

Le marché des agents vocaux connaît une croissance explosive. Les cas d'usage se multiplient : service client automatisé, assistants médicaux, tuteurs éducatifs, interfaces bancaires. Chaque secteur présente des exigences spécifiques en termes de précision, de latence et de naturalité.

Les modèles évoluent rapidement. DeepSeek-V4-Pro combiné à un petit STT dédié peut battre un modèle vocal frontalier de bout en bout sur le coût par minute d'un facteur 10, tout en restant dans un budget de latence ajoutée de 300 ms. Cette capacité à mixer et assortir les composants devient un avantage compétitif déterminant.

L'importance de la méthodologie

Un service de "recherche de la combinaison optimale" vit ou meurt par sa méthodologie. Les chiffres de WER ne sont comparables qu'au sein du même ensemble d'évaluation. Speko expose les benchmarks par composant (WER du STT, MOS du TTS) séparément, pas seulement les scores combinés, offrant ainsi une granularité essentielle pour les décisions techniques.

Cette rigueur méthodologique s'inscrit dans une tendance plus large où l'expertise technique approfondie devient un différenciateur clé face à l'automatisation croissante.

Illustration 3 sur Speko

Au-delà du routage : l'écosystème complet

Speko ne se limite pas au simple routage. La plateforme propose également des benchmarks sur la détection de tour de parole, un élément critique souvent négligé. Le meilleur détecteur atteint 94,0 % de précision sur les décisions fin-vs-attente (le locuteur a-t-il fini de parler ou est-il simplement en pause ?), contre 46,9 % pour un simple temporisateur VAD basé sur le silence.

L'entreprise expérimente également le fractionnement entre modèles rapides et intelligents : un petit modèle rapide maintient la conversation pendant qu'un modèle plus large travaille en arrière-plan. La plupart des tours de parole dans un appel téléphonique ne nécessitent pas un modèle de frontière, et les modèles les plus rapides du tableau LLM de Speko sont tous petits.

Cette approche hybride optimise à la fois la réactivité perçue et le coût réel, une équation économique qui devient centrale alors que les volumes d'appels augmentent exponentiellement.

Questions ouvertes et défis futurs

Malgré les progrès, plusieurs défis subsistent. Les modes vocaux de ChatGPT et Claude, bien qu'utilisables, présentent encore des problèmes : hallucinations sur ce que l'utilisateur a dit, bugs autour de l'appel d'outils, erreurs d'audition fréquentes. La plupart ne supportent qu'un seul modèle premium, sans option pour augmenter la vitesse de parole.

La communauté technique se pose des questions légitimes :

  • Comment faire confiance à un benchmark tiers sans reproduire soi-même toutes les mesures ?
  • Les benchmarks par langue et par transport sont-ils suffisamment granulaires ?
  • Comment modéliser le taux de réussite du cache et la distribution du contexte pour calculer le coût effectif plutôt que le tarif affiché ?
  • Comment scorer spécifiquement les corrections et les disfluences ("rendez-vous mardi, non attendez, mercredi") plutôt que de les intégrer dans la précision globale ?

Ces questions reflètent la maturité croissante du secteur et l'exigence accrue des équipes techniques qui déploient ces systèmes en production à grande échelle.

Les enjeux rejoignent ceux d'autres domaines de pointe comme la découverte médicamenteuse par IA, où la rigueur méthodologique et la reproductibilité des résultats sont essentielles.

Conclusion : vers une optimisation continue automatisée

Speko incarne une évolution importante dans l'infrastructure IA : le passage de l'intégration manuelle ponctuelle à l'optimisation continue automatisée. En transformant le processus fastidieux d'évaluation et de sélection de modèles en un simple appel API, la plateforme permet aux équipes de se concentrer sur leur valeur métier plutôt que sur la plomberie technique.

L'approche open source pour la passerelle, combinée à des benchmarks publics et impartiaux, établit un nouveau standard de transparence dans un secteur souvent opaque. Alors que les modèles continuent d'évoluer à un rythme soutenu, cette infrastructure d'optimisation automatique devient aussi essentielle que les modèles eux-mêmes.

Pour les entreprises déployant des agents vocaux en production, la question n'est plus de savoir s'il faut optimiser continuellement, mais comment le faire efficacement. Speko propose une réponse pragmatique et technique à ce défi. Pour aller plus loin dans l'optimisation de vos projets IA, créez votre compte gratuit sur Roboto et découvrez notre plateforme complète de génération de contenu assistée par intelligence artificielle.