Amazon Polly avis 2026 : prix, voix françaises et API TTS

Amazon Polly test 2026
Dernière vérification : 
API Text-to-Speech AWS, SSML, streaming et facturation au caractère

Amazon Polly est le service de synthèse vocale d’AWS. Il convertit un texte ou un document SSML en audio depuis la console, une API, la ligne de commande ou un SDK, puis permet d’intégrer la voix dans une application, un site, un serveur vocal, une formation ou un produit connecté.

Dans cet avis, nous examinons les moteurs Standard, Neural, Long-Form et Generative, les voix françaises, les formats audio, les limites techniques, le fonctionnement du SSML, la nouvelle offre gratuite AWS et les coûts réels selon le volume.

Notre verdict en bref

Amazon Polly est particulièrement pertinent lorsque la voix doit être générée automatiquement, à grande échelle et intégrée à une infrastructure existante. Sa tarification au caractère est transparente et les fichiers déjà générés peuvent être mis en cache puis rejoués sans nouvelle facturation Polly.

Le service demande toutefois davantage de configuration qu’un studio destiné aux créateurs. Le choix de la région, du moteur, de la voix, du format, des quotas et du stockage S3 doit être prévu avant la mise en production.

4 moteurs TTS
Voix françaises
SSML et lexiques
MP3, OGG et PCM
Speech Marks
API et streaming
Resume

Comment avons-nous analysé Amazon Polly ?

Cette analyse repose sur la grille tarifaire, la documentation du développeur, les tableaux de voix, les quotas et les pages consacrées aux différents moteurs publiés officiellement par AWS à la date indiquée en haut de l’article.

Nous avons distingué les fonctions disponibles selon le moteur et la région. Une voix proposée dans Amazon Polly ne prend pas nécessairement en charge tous les moteurs, styles SSML, formats de métadonnées ou modes de streaming.

Service étudié
TTS cloud
Conversion de texte vers la parole depuis AWS Console, API, CLI et SDK.

Facturation
Caractères traités
Le prix varie selon le moteur Standard, Neural, Generative ou Long-Form.

Intégration
Applications
Sites, applications mobiles, e-learning, IVR, objets connectés et expériences synchronisées.

Point critique
Compatibilité régionale
Les moteurs avancés et certaines voix ne sont pas disponibles dans toutes les régions AWS.

Qu’est-ce qu’Amazon Polly ?

Amazon Polly reçoit un texte brut ou balisé en SSML, le traite avec une voix et un moteur choisis, puis renvoie un flux audio ou des métadonnées de synchronisation.

Le service est conçu pour être intégré plutôt que pour fournir un espace complet de montage vidéo. Un créateur peut utiliser la console pour générer ponctuellement un fichier, mais la vraie force de Polly apparaît lorsqu’une application automatise les requêtes et stocke les résultats.

Génération d’un fichier audio depuis la console Amazon Polly
La console permet de choisir le moteur, la langue, la voix, le format et le texte à synthétiser.

Différence essentielle : Amazon Polly n’est pas un lecteur de PDF ni un studio vidéo. C’est une brique cloud que l’on combine généralement avec Amazon S3, une application, un CMS, un LMS ou un système téléphonique.

À qui Amazon Polly convient-il réellement ?

Applications
Voix à la demande
Pour lire des messages, notifications, réponses ou contenus générés dynamiquement.

E-learning
Cours automatisés
Pour produire et mettre à jour des narrations depuis des scripts ou une base de contenu.

Téléphonie
IVR et centres d’appels
Pour générer des messages dynamiques dans des formats et fréquences adaptés au téléphone.

Expériences visuelles
Synchronisation
Pour surligner les mots, animer des lèvres ou synchroniser une interface avec la parole.

Amazon Polly est particulièrement intéressant si vous :

  • développez une application ou un service qui doit générer de la voix automatiquement ;
  • voulez payer selon le volume réellement synthétisé ;
  • avez besoin de contrôler la prononciation avec SSML ou des lexiques ;
  • souhaitez stocker et rejouer les fichiers déjà générés ;
  • travaillez déjà avec AWS, IAM, S3, CloudWatch ou d’autres services cloud ;
  • devez produire des métadonnées de synchronisation pour une interface ou une animation.

Amazon Polly est moins adapté si vous :

  • cherchez une timeline visuelle pour monter directement une vidéo ;
  • voulez importer un PDF puis l’écouter sans développer de workflow ;
  • souhaitez cloner rapidement votre propre voix depuis une interface grand public ;
  • avez besoin de avatars, stock vidéo, musique et sous-titres dans un seul outil ;
  • ne voulez pas gérer de compte AWS, de région, de permissions ou de stockage ;
  • recherchez une voix créative très expressive sans tester plusieurs moteurs et réglages.

Les quatre moteurs de voix d’Amazon Polly

Amazon Polly propose quatre moteurs qui ne répondent pas exactement aux mêmes besoins. Ils possèdent des tarifs, voix, régions et compatibilités SSML différents.

Moteur Prix par million de caractères Usage principal Limite importante
Standard 4 $ Messages simples, téléphonie, grand volume et faible coût Rendu moins avancé que les moteurs récents
Neural 16 $ Narration naturelle, applications et contenus professionnels Disponibilité variable selon la voix et la région
Generative 30 $ Voix proches de l’humain, assistants, formation et publicité Le rendu peut légèrement évoluer après une mise à jour du modèle
Long-Form 100 $ Livres, articles longs, podcasts et narration prolongée Catalogue et disponibilité régionale très limités

Standard

Le moteur Standard utilise une synthèse par concaténation de phonèmes. Il reste le choix le moins coûteux et possède des quotas de requêtes plus élevés, ce qui le rend pertinent pour les messages courts et répétitifs.

Neural

Le moteur Neural utilise des modèles neuronaux afin d’améliorer le naturel et la fluidité. Il constitue souvent le meilleur compromis entre qualité, disponibilité et prix.

Generative

Le moteur Generative est proposé avec 43 voix au moment de notre vérification, dont plusieurs voix françaises. AWS précise que les mises à jour du modèle peuvent entraîner de légères différences de rendu entre des fichiers générés à des dates éloignées.

Long-Form

Le moteur Long-Form est spécialement conçu pour maintenir un ton naturel sur des passages longs. Il reste cependant disponible uniquement dans la région Virginie du Nord et avec un nombre réduit de voix anglaises et espagnoles.

Choix pragmatique : testez Neural avant de payer Generative ou Long-Form. Le moteur le plus cher n’est pas automatiquement nécessaire pour un message court, un menu téléphonique ou une notification.

Quelles voix françaises sont disponibles ?

Amazon Polly prend en charge le français de France, de Belgique et du Canada. Le choix du moteur varie selon chaque voix.

Variante Voix principales Moteurs disponibles
Français de France Ambre, Céline, Florian, Léa, Mathieu et Rémi Standard, Neural ou Generative selon la voix
Français de Belgique Isabelle Neural et Generative
Français du Canada Chantal, Gabrielle et Liam Standard, Neural ou Generative selon la voix

Une voix française n’est pas disponible automatiquement dans chaque région AWS. Le moteur Generative possède notamment une liste de régions précises, tandis que Long-Form ne propose actuellement aucune voix française.

Test recommandé : comparez le même paragraphe avec une voix Neural et une voix Generative dans la région réellement utilisée par votre application.

SSML : contrôler la prononciation et le rythme

Le Speech Synthesis Markup Language permet d’indiquer non seulement ce que la voix doit dire, mais aussi comment elle doit le prononcer. Le document est placé dans une balise speak, puis enrichi avec des balises compatibles.

Break
Pauses
Ajout de respirations ou de silences pouvant atteindre dix secondes par balise.

Prosody
Rythme et hauteur
Modification du débit, du volume et de la hauteur avec les limites propres au moteur.

Phoneme
Prononciation
Utilisation de l’IPA ou de X-SAMPA pour imposer la prononciation d’un mot.

Lang
Passage multilingue
Indication de la langue d’un mot ou d’un passage inséré dans un autre texte.

Say-as
Dates et nombres
Lecture contrôlée des dates, heures, chiffres, unités, adresses ou caractères.

Mark
Synchronisation
Insertion d’un repère récupérable dans les Speech Marks pour synchroniser une application.

Toutes les balises ne fonctionnent pas avec tous les moteurs

Le moteur Standard prend en charge davantage de balises historiques. Les moteurs Neural, Long-Form et Generative ne prennent notamment pas en charge certaines fonctions comme emphasis, le chuchotement ou les respirations automatiques.

Une balise non prise en charge peut provoquer une erreur au lieu d’être simplement ignorée. La compatibilité du moteur doit donc être vérifiée avant de réutiliser un modèle SSML dans toute l’application.

Conseil de rédaction : commencez par un texte bien ponctué. Utilisez ensuite SSML uniquement pour les passages que la ponctuation et le choix de la voix ne corrigent pas suffisamment.

Lexiques de prononciation personnalisés

Les lexiques permettent d’enregistrer des règles de prononciation réutilisables pour des noms de marque, acronymes, produits et termes spécialisés. Ils suivent la norme Pronunciation Lexicon Specification du W3C.

Un compte peut stocker jusqu’à 100 lexiques par région. Chaque lexique peut contenir jusqu’à 40 000 caractères et jusqu’à cinq lexiques peuvent être appliqués à une même requête de synthèse.

Quand préférer un lexique au SSML ?

  • lorsqu’un mot revient dans de nombreux scripts ;
  • lorsque plusieurs applications doivent utiliser la même prononciation ;
  • lorsqu’une marque ou un acronyme possède une lecture officielle ;
  • lorsque vous voulez corriger le mot sans modifier chaque texte source ;
  • lorsque la règle doit être maintenue séparément du contenu éditorial.

Limite régionale : les lexiques sont stockés dans une région AWS et ne sont pas automatiquement disponibles dans les autres régions.

Formats audio, fréquence et téléphonie

Amazon Polly peut renvoyer du MP3, de l’OGG Vorbis, de l’OGG Opus, du PCM brut ainsi que des formats μ-law et A-law adaptés à certains systèmes téléphoniques.

Format Usage principal À retenir
MP3 Web, application, podcast et téléchargement Format compressé et largement compatible
OGG Vorbis ou Opus Diffusion Web et applications compatibles Bon rapport qualité-poids selon l’environnement
PCM Traitement audio, objets connectés et pipelines techniques Flux non compressé nécessitant un conteneur ou un traitement approprié
μ-law ou A-law Téléphonie et systèmes IVR Formats conçus pour les contraintes des réseaux téléphoniques

Les moteurs Standard, Neural et Long-Form utilisent généralement des fréquences de 8, 16, 22,05 ou 24 kHz selon la voix et le format. Il faut choisir la fréquence en fonction du canal final plutôt que de sélectionner systématiquement la valeur maximale.

Speech Marks : synchroniser le texte, les mots et les lèvres

Les Speech Marks sont des métadonnées temporelles générées à partir du texte. Elles indiquent notamment le début des phrases, des mots, des phonèmes visuels ou des repères SSML.

Sentence
Phrases
Indique la position et le moment de lecture d’une phrase complète.

Word
Surlignage
Permet de mettre en évidence chaque mot au moment où il est prononcé.

Viseme
Animation faciale
Décrit les formes de bouche correspondant aux sons pour faciliter le lip-sync.

SSML
Repères
Renvoie les marques personnalisées ajoutées au texte avec la balise mark.

Une requête de Speech Marks renvoie des métadonnées JSON à la place du fichier audio. L’application doit donc effectuer une requête séparée pour obtenir l’audio correspondant.

Les Speech Marks sont disponibles avec les moteurs Standard, Neural et Long-Form. La documentation actuelle indique qu’ils ne sont pas pris en charge par le moteur Generative.

Temps réel, fichiers longs et streaming

SynthesizeSpeech pour les réponses rapides

L’opération SynthesizeSpeech accepte jusqu’à 3 000 caractères facturés ou 6 000 caractères au total avec les balises SSML. Le flux audio produit est limité à dix minutes.

StartSpeechSynthesisTask pour les documents longs

La synthèse asynchrone accepte jusqu’à 100 000 caractères facturés ou 200 000 caractères au total. Le résultat est enregistré dans un compartiment Amazon S3 et une notification SNS peut être envoyée lorsque le traitement est terminé.

Streaming bidirectionnel pour les interactions

Le moteur Generative propose une API de streaming bidirectionnel dans certaines régions. L’application peut envoyer progressivement le texte et recevoir l’audio sans attendre que le message complet soit connu.

Mode Limite de texte Sortie Cas d’usage
SynthesizeSpeech 3 000 caractères facturés Flux audio immédiat Réponse courte, notification et application interactive
StartSpeechSynthesisTask 100 000 caractères facturés Fichier enregistré dans S3 Article long, chapitre, cours ou traitement par lot
StartSpeechSynthesisStream Flux d’entrée progressif Flux audio bidirectionnel Agent et réponse générée progressivement

Tarifs d’Amazon Polly en 2026

Amazon Polly facture le nombre de caractères traités. Les balises SSML ne sont pas comptées comme caractères facturés, mais le texte qu’elles contiennent l’est.

Moteur Prix pour 1 million de caractères Durée indicative AWS
Standard 4 $ Environ 23 heures et 8 minutes
Neural 16 $ Environ 23 heures et 8 minutes
Generative 30 $ Environ 23 heures et 8 minutes
Long-Form 100 $ Environ 23 heures et 8 minutes

Exemple : convertir 100 articles de 6 500 caractères

Un lot de 100 articles de cette taille représente 650 000 caractères, hors répétitions et Speech Marks.

Moteur Coût estimé Observation
Standard 2,60 $ Choix économique pour une lecture fonctionnelle
Neural 10,40 $ Compromis intéressant pour une narration plus naturelle
Generative 19,50 $ À réserver aux contenus où le gain qualitatif est perceptible
Long-Form 65 $ Peu pertinent si les articles n’utilisent pas une voix Long-Form compatible
Grille de tarification des moteurs Amazon Polly
Le coût augmente fortement entre Standard, Neural, Generative et Long-Form pour un même texte.

Peut-on rejouer gratuitement un fichier déjà généré ?

Oui. AWS indique que l’audio généré peut être mis en cache et rejoué sans nouvelle facturation Amazon Polly. Il peut cependant rester des coûts de stockage S3, de CDN, de transfert de données ou d’infrastructure.

Économie principale : ne générez pas le même texte à chaque écoute. Créez une clé basée sur le texte, la voix, le moteur et les paramètres, puis réutilisez le fichier lorsqu’aucun élément n’a changé.

Comment fonctionne l’offre gratuite AWS ?

La page tarifaire de Polly affiche toujours des quotas mensuels pendant les douze premiers mois : cinq millions de caractères Standard, un million Neural, 500 000 Long-Form et 100 000 Generative.

AWS précise cependant qu’un nouveau modèle Free Tier s’applique aux clients créant un compte depuis le 15 juillet 2025. Ces comptes peuvent recevoir jusqu’à 200 dollars de crédits et choisir un plan gratuit disponible pendant six mois ou un plan payant. Les crédits doivent être utilisés dans les douze mois suivant la création du compte.

Ces deux présentations coexistent actuellement sur la même page. L’éligibilité réelle dépend donc de la date de création du compte, du plan choisi et des crédits visibles dans AWS Billing.

Ne basez pas un projet sur une estimation générique : ouvrez la console Billing and Cost Management, vérifiez vos crédits et créez un budget avant d’automatiser un volume important.

Architecture recommandée pour éviter les coûts inutiles

Un workflow de production efficace ne doit pas appeler Polly à chaque lecture. Il doit vérifier si un fichier correspondant au texte et aux paramètres existe déjà.

  1. Normalisez le texte et les paramètres de voix reçus par l’application.
  2. Calculez un identifiant unique à partir du texte, du moteur, de la voix, du format et de la vitesse.
  3. Recherchez cet identifiant dans la base ou le stockage avant d’appeler Polly.
  4. Générez le fichier uniquement lorsqu’aucune version valide n’existe.
  5. Stockez l’audio dans Amazon S3 avec des métadonnées permettant de retrouver ses paramètres.
  6. Diffusez le fichier par une URL contrôlée ou un CDN selon les besoins.
  7. Utilisez CloudWatch et AWS Budgets pour surveiller les appels, erreurs et dépenses.
  8. Supprimez ou archivez les fichiers obsolètes selon une règle de cycle de vie S3.
Résultat : la même narration peut être écoutée des milliers de fois sans effectuer des milliers de nouvelles synthèses.

Sécurité et contrôle des accès

Amazon Polly s’utilise avec AWS Identity and Access Management. Les applications doivent recevoir uniquement les autorisations nécessaires à la synthèse, à la consultation des voix et au stockage des fichiers.

Pour les synthèses longues, le compartiment S3 doit autoriser l’écriture depuis le processus concerné. Le chiffrement du compartiment, les politiques de rétention et les journaux d’accès doivent être configurés selon la sensibilité du contenu.

Bonnes pratiques

  • ne jamais intégrer une clé AWS permanente dans du JavaScript public ou une application distribuée ;
  • utiliser des rôles IAM et des identifiants temporaires lorsque cela est possible ;
  • restreindre l’accès aux compartiments contenant les fichiers privés ;
  • activer des budgets et alertes de facturation ;
  • journaliser les erreurs et les pics de requêtes ;
  • appliquer un mécanisme de retry avec délai progressif en cas de limitation.

Les limites d’Amazon Polly à connaître

1. Ce n’est pas un studio pour créateurs

La console génère des fichiers, mais elle ne remplace pas une timeline vidéo, une bibliothèque de médias ou un outil de collaboration éditoriale.

2. La compatibilité varie selon la voix et la région

Une voix peut être Standard, Neural ou Generative sans être proposée dans tous les moteurs ou toutes les régions.

3. Les moteurs avancés ne prennent pas toutes les balises SSML

Certains effets disponibles avec Standard sont refusés avec Neural, Long-Form ou Generative.

4. Le moteur Long-Form est très limité

Il est nettement plus cher, disponible dans une seule région et ne possède actuellement aucune voix française.

5. La limite de 3 000 caractères impose un découpage

Les réponses en temps réel doivent être segmentées. Les textes plus longs nécessitent une tâche asynchrone et un compartiment S3.

6. Polly ne propose pas un clonage vocal grand public

AWS propose Brand Voice comme service personnalisé destiné aux entreprises, et non comme une fonction instantanée accessible depuis la console standard.

7. La facture AWS dépasse parfois le seul TTS

Le stockage, la diffusion, les journaux, le réseau et les autres services de l’architecture peuvent représenter un coût supérieur à la synthèse elle-même.

Comment créer un premier fichier avec Amazon Polly ?

  1. Créez ou ouvrez un compte AWS puis sélectionnez une région compatible avec le moteur prévu.
  2. Ouvrez Amazon Polly dans la console AWS.
  3. Choisissez Standard, Neural, Generative ou Long-Form selon les voix disponibles.
  4. Sélectionnez la langue française et comparez plusieurs voix sur le même extrait.
  5. Commencez avec du texte brut avant d’ajouter des balises SSML.
  6. Choisissez MP3 pour un usage courant, PCM pour le traitement ou un format téléphonique pour un IVR.
  7. Écoutez le résultat puis corrigez la ponctuation et les prononciations difficiles.
  8. Utilisez une tâche S3 lorsque le texte dépasse la limite de synthèse immédiate.
  9. Stockez le fichier et réutilisez-le plutôt que de relancer la même requête.
  10. Créez un budget AWS et une alerte avant le passage en production.

Quelles alternatives à Amazon Polly examiner ?

Amazon Polly est une infrastructure TTS. Les alternatives les plus pertinentes dépendent donc du besoin de création, de clonage, de sécurité ou de collaboration.

Priorité Outil à comparer Différence principale
Voix créatives et clonage ElevenLabs Studio et API orientés vers le réalisme, le clonage et la production multilingue
Génération et sécurité Resemble AI Clonage, Speech-to-Speech, agents, détection deepfake et filigrane
Studio pour équipes Murf AI Interface de création destinée aux formations, présentations et workflows collaboratifs
Studio voix et vidéo Genny by LOVO AI Création vocale, sous-titres, ressources média et montage dans une interface unique
API vocale et clonage PlayHT Alternative orientée voix, intégration et production audio

Questions fréquentes sur Amazon Polly

Combien coûte Amazon Polly ?

Amazon Polly coûte 4 dollars par million de caractères avec Standard, 16 dollars avec Neural, 30 dollars avec Generative et 100 dollars avec Long-Form, hors offre gratuite et tarification GovCloud.

Amazon Polly possède-t-il une offre gratuite ?

Oui, mais les règles dépendent de la date de création du compte. La page Polly affiche des quotas pendant douze mois et précise aussi que les nouveaux clients depuis le 15 juillet 2025 peuvent recevoir des crédits AWS avec un plan gratuit limité à six mois.

Amazon Polly fonctionne-t-il en français ?

Oui. Le service propose des voix de France, de Belgique et du Canada avec des moteurs Standard, Neural ou Generative selon la voix.

Peut-on générer un livre ou un long document ?

Oui. StartSpeechSynthesisTask accepte jusqu’à 100 000 caractères facturés et enregistre le résultat dans Amazon S3. Le texte doit être découpé si cette limite est dépassée.

Peut-on conserver et rejouer les fichiers générés ?

Oui. AWS autorise la mise en cache et le rejeu de l’audio sans nouvelle facturation Polly. Des frais de stockage, de CDN ou de transfert peuvent toutefois s’appliquer.

Quels formats audio sont disponibles ?

Amazon Polly prend en charge MP3, OGG Vorbis, OGG Opus, PCM, μ-law et A-law selon l’opération et le moteur utilisés.

Amazon Polly permet-il de cloner une voix ?

Il ne propose pas de clonage instantané grand public. AWS offre Brand Voice comme service personnalisé permettant à une entreprise de créer une voix exclusive avec l’équipe Amazon Polly.

Quelle est la différence entre Speech Marks et l’audio ?

L’audio contient la parole synthétisée. Les Speech Marks sont des métadonnées temporelles utilisées pour le surlignage, les sous-titres synchronisés, les animations faciales et les repères SSML.

Conclusion : notre avis sur Amazon Polly

Amazon Polly est une solution fiable et économique lorsque la synthèse vocale doit être intégrée à une application ou générée automatiquement à grande échelle.

Le moteur Neural offre généralement le meilleur équilibre pour commencer. Standard réduit fortement les coûts, Generative améliore le réalisme dans les régions compatibles et Long-Form reste réservé à des projets très spécifiques.

Avant le déploiement, vérifiez la voix française, la région, les balises SSML compatibles et le nouveau régime Free Tier de votre compte. Mettez ensuite les fichiers en cache afin que la diffusion répétée ne provoque pas de nouvelles synthèses inutiles.

Sources officielles vérifiées

Retour en haut