Amazon Polly est le service de synthèse vocale d’AWS. Il convertit un texte ou un document SSML en audio depuis la console, une API, la ligne de commande ou un SDK, puis permet d’intégrer la voix dans une application, un site, un serveur vocal, une formation ou un produit connecté.
Dans cet avis, nous examinons les moteurs Standard, Neural, Long-Form et Generative, les voix françaises, les formats audio, les limites techniques, le fonctionnement du SSML, la nouvelle offre gratuite AWS et les coûts réels selon le volume.
Notre verdict en bref
Amazon Polly est particulièrement pertinent lorsque la voix doit être générée automatiquement, à grande échelle et intégrée à une infrastructure existante. Sa tarification au caractère est transparente et les fichiers déjà générés peuvent être mis en cache puis rejoués sans nouvelle facturation Polly.
Le service demande toutefois davantage de configuration qu’un studio destiné aux créateurs. Le choix de la région, du moteur, de la voix, du format, des quotas et du stockage S3 doit être prévu avant la mise en production.
Voix françaises
SSML et lexiques
MP3, OGG et PCM
Speech Marks
API et streaming
Comment avons-nous analysé Amazon Polly ?
Cette analyse repose sur la grille tarifaire, la documentation du développeur, les tableaux de voix, les quotas et les pages consacrées aux différents moteurs publiés officiellement par AWS à la date indiquée en haut de l’article.
Nous avons distingué les fonctions disponibles selon le moteur et la région. Une voix proposée dans Amazon Polly ne prend pas nécessairement en charge tous les moteurs, styles SSML, formats de métadonnées ou modes de streaming.
Qu’est-ce qu’Amazon Polly ?
Amazon Polly reçoit un texte brut ou balisé en SSML, le traite avec une voix et un moteur choisis, puis renvoie un flux audio ou des métadonnées de synchronisation.
Le service est conçu pour être intégré plutôt que pour fournir un espace complet de montage vidéo. Un créateur peut utiliser la console pour générer ponctuellement un fichier, mais la vraie force de Polly apparaît lorsqu’une application automatise les requêtes et stocke les résultats.

Différence essentielle : Amazon Polly n’est pas un lecteur de PDF ni un studio vidéo. C’est une brique cloud que l’on combine généralement avec Amazon S3, une application, un CMS, un LMS ou un système téléphonique.
À qui Amazon Polly convient-il réellement ?
Amazon Polly est particulièrement intéressant si vous :
- développez une application ou un service qui doit générer de la voix automatiquement ;
- voulez payer selon le volume réellement synthétisé ;
- avez besoin de contrôler la prononciation avec SSML ou des lexiques ;
- souhaitez stocker et rejouer les fichiers déjà générés ;
- travaillez déjà avec AWS, IAM, S3, CloudWatch ou d’autres services cloud ;
- devez produire des métadonnées de synchronisation pour une interface ou une animation.
Amazon Polly est moins adapté si vous :
- cherchez une timeline visuelle pour monter directement une vidéo ;
- voulez importer un PDF puis l’écouter sans développer de workflow ;
- souhaitez cloner rapidement votre propre voix depuis une interface grand public ;
- avez besoin de avatars, stock vidéo, musique et sous-titres dans un seul outil ;
- ne voulez pas gérer de compte AWS, de région, de permissions ou de stockage ;
- recherchez une voix créative très expressive sans tester plusieurs moteurs et réglages.
Les quatre moteurs de voix d’Amazon Polly
Amazon Polly propose quatre moteurs qui ne répondent pas exactement aux mêmes besoins. Ils possèdent des tarifs, voix, régions et compatibilités SSML différents.
| Moteur | Prix par million de caractères | Usage principal | Limite importante |
|---|---|---|---|
| Standard | 4 $ | Messages simples, téléphonie, grand volume et faible coût | Rendu moins avancé que les moteurs récents |
| Neural | 16 $ | Narration naturelle, applications et contenus professionnels | Disponibilité variable selon la voix et la région |
| Generative | 30 $ | Voix proches de l’humain, assistants, formation et publicité | Le rendu peut légèrement évoluer après une mise à jour du modèle |
| Long-Form | 100 $ | Livres, articles longs, podcasts et narration prolongée | Catalogue et disponibilité régionale très limités |
Standard
Le moteur Standard utilise une synthèse par concaténation de phonèmes. Il reste le choix le moins coûteux et possède des quotas de requêtes plus élevés, ce qui le rend pertinent pour les messages courts et répétitifs.
Neural
Le moteur Neural utilise des modèles neuronaux afin d’améliorer le naturel et la fluidité. Il constitue souvent le meilleur compromis entre qualité, disponibilité et prix.
Generative
Le moteur Generative est proposé avec 43 voix au moment de notre vérification, dont plusieurs voix françaises. AWS précise que les mises à jour du modèle peuvent entraîner de légères différences de rendu entre des fichiers générés à des dates éloignées.
Long-Form
Le moteur Long-Form est spécialement conçu pour maintenir un ton naturel sur des passages longs. Il reste cependant disponible uniquement dans la région Virginie du Nord et avec un nombre réduit de voix anglaises et espagnoles.
Choix pragmatique : testez Neural avant de payer Generative ou Long-Form. Le moteur le plus cher n’est pas automatiquement nécessaire pour un message court, un menu téléphonique ou une notification.
Quelles voix françaises sont disponibles ?
Amazon Polly prend en charge le français de France, de Belgique et du Canada. Le choix du moteur varie selon chaque voix.
| Variante | Voix principales | Moteurs disponibles |
|---|---|---|
| Français de France | Ambre, Céline, Florian, Léa, Mathieu et Rémi | Standard, Neural ou Generative selon la voix |
| Français de Belgique | Isabelle | Neural et Generative |
| Français du Canada | Chantal, Gabrielle et Liam | Standard, Neural ou Generative selon la voix |
Une voix française n’est pas disponible automatiquement dans chaque région AWS. Le moteur Generative possède notamment une liste de régions précises, tandis que Long-Form ne propose actuellement aucune voix française.
SSML : contrôler la prononciation et le rythme
Le Speech Synthesis Markup Language permet d’indiquer non seulement ce que la voix doit dire, mais aussi comment elle doit le prononcer. Le document est placé dans une balise speak, puis enrichi avec des balises compatibles.
Toutes les balises ne fonctionnent pas avec tous les moteurs
Le moteur Standard prend en charge davantage de balises historiques. Les moteurs Neural, Long-Form et Generative ne prennent notamment pas en charge certaines fonctions comme emphasis, le chuchotement ou les respirations automatiques.
Une balise non prise en charge peut provoquer une erreur au lieu d’être simplement ignorée. La compatibilité du moteur doit donc être vérifiée avant de réutiliser un modèle SSML dans toute l’application.
Conseil de rédaction : commencez par un texte bien ponctué. Utilisez ensuite SSML uniquement pour les passages que la ponctuation et le choix de la voix ne corrigent pas suffisamment.
Lexiques de prononciation personnalisés
Les lexiques permettent d’enregistrer des règles de prononciation réutilisables pour des noms de marque, acronymes, produits et termes spécialisés. Ils suivent la norme Pronunciation Lexicon Specification du W3C.
Un compte peut stocker jusqu’à 100 lexiques par région. Chaque lexique peut contenir jusqu’à 40 000 caractères et jusqu’à cinq lexiques peuvent être appliqués à une même requête de synthèse.
Quand préférer un lexique au SSML ?
- lorsqu’un mot revient dans de nombreux scripts ;
- lorsque plusieurs applications doivent utiliser la même prononciation ;
- lorsqu’une marque ou un acronyme possède une lecture officielle ;
- lorsque vous voulez corriger le mot sans modifier chaque texte source ;
- lorsque la règle doit être maintenue séparément du contenu éditorial.
Limite régionale : les lexiques sont stockés dans une région AWS et ne sont pas automatiquement disponibles dans les autres régions.
Formats audio, fréquence et téléphonie
Amazon Polly peut renvoyer du MP3, de l’OGG Vorbis, de l’OGG Opus, du PCM brut ainsi que des formats μ-law et A-law adaptés à certains systèmes téléphoniques.
| Format | Usage principal | À retenir |
|---|---|---|
| MP3 | Web, application, podcast et téléchargement | Format compressé et largement compatible |
| OGG Vorbis ou Opus | Diffusion Web et applications compatibles | Bon rapport qualité-poids selon l’environnement |
| PCM | Traitement audio, objets connectés et pipelines techniques | Flux non compressé nécessitant un conteneur ou un traitement approprié |
| μ-law ou A-law | Téléphonie et systèmes IVR | Formats conçus pour les contraintes des réseaux téléphoniques |
Les moteurs Standard, Neural et Long-Form utilisent généralement des fréquences de 8, 16, 22,05 ou 24 kHz selon la voix et le format. Il faut choisir la fréquence en fonction du canal final plutôt que de sélectionner systématiquement la valeur maximale.
Speech Marks : synchroniser le texte, les mots et les lèvres
Les Speech Marks sont des métadonnées temporelles générées à partir du texte. Elles indiquent notamment le début des phrases, des mots, des phonèmes visuels ou des repères SSML.
Une requête de Speech Marks renvoie des métadonnées JSON à la place du fichier audio. L’application doit donc effectuer une requête séparée pour obtenir l’audio correspondant.
Les Speech Marks sont disponibles avec les moteurs Standard, Neural et Long-Form. La documentation actuelle indique qu’ils ne sont pas pris en charge par le moteur Generative.
Temps réel, fichiers longs et streaming
SynthesizeSpeech pour les réponses rapides
L’opération SynthesizeSpeech accepte jusqu’à 3 000 caractères facturés ou 6 000 caractères au total avec les balises SSML. Le flux audio produit est limité à dix minutes.
StartSpeechSynthesisTask pour les documents longs
La synthèse asynchrone accepte jusqu’à 100 000 caractères facturés ou 200 000 caractères au total. Le résultat est enregistré dans un compartiment Amazon S3 et une notification SNS peut être envoyée lorsque le traitement est terminé.
Streaming bidirectionnel pour les interactions
Le moteur Generative propose une API de streaming bidirectionnel dans certaines régions. L’application peut envoyer progressivement le texte et recevoir l’audio sans attendre que le message complet soit connu.
| Mode | Limite de texte | Sortie | Cas d’usage |
|---|---|---|---|
| SynthesizeSpeech | 3 000 caractères facturés | Flux audio immédiat | Réponse courte, notification et application interactive |
| StartSpeechSynthesisTask | 100 000 caractères facturés | Fichier enregistré dans S3 | Article long, chapitre, cours ou traitement par lot |
| StartSpeechSynthesisStream | Flux d’entrée progressif | Flux audio bidirectionnel | Agent et réponse générée progressivement |
Tarifs d’Amazon Polly en 2026
Amazon Polly facture le nombre de caractères traités. Les balises SSML ne sont pas comptées comme caractères facturés, mais le texte qu’elles contiennent l’est.
| Moteur | Prix pour 1 million de caractères | Durée indicative AWS |
|---|---|---|
| Standard | 4 $ | Environ 23 heures et 8 minutes |
| Neural | 16 $ | Environ 23 heures et 8 minutes |
| Generative | 30 $ | Environ 23 heures et 8 minutes |
| Long-Form | 100 $ | Environ 23 heures et 8 minutes |
Exemple : convertir 100 articles de 6 500 caractères
Un lot de 100 articles de cette taille représente 650 000 caractères, hors répétitions et Speech Marks.
| Moteur | Coût estimé | Observation |
|---|---|---|
| Standard | 2,60 $ | Choix économique pour une lecture fonctionnelle |
| Neural | 10,40 $ | Compromis intéressant pour une narration plus naturelle |
| Generative | 19,50 $ | À réserver aux contenus où le gain qualitatif est perceptible |
| Long-Form | 65 $ | Peu pertinent si les articles n’utilisent pas une voix Long-Form compatible |

Peut-on rejouer gratuitement un fichier déjà généré ?
Oui. AWS indique que l’audio généré peut être mis en cache et rejoué sans nouvelle facturation Amazon Polly. Il peut cependant rester des coûts de stockage S3, de CDN, de transfert de données ou d’infrastructure.
Économie principale : ne générez pas le même texte à chaque écoute. Créez une clé basée sur le texte, la voix, le moteur et les paramètres, puis réutilisez le fichier lorsqu’aucun élément n’a changé.
Comment fonctionne l’offre gratuite AWS ?
La page tarifaire de Polly affiche toujours des quotas mensuels pendant les douze premiers mois : cinq millions de caractères Standard, un million Neural, 500 000 Long-Form et 100 000 Generative.
AWS précise cependant qu’un nouveau modèle Free Tier s’applique aux clients créant un compte depuis le 15 juillet 2025. Ces comptes peuvent recevoir jusqu’à 200 dollars de crédits et choisir un plan gratuit disponible pendant six mois ou un plan payant. Les crédits doivent être utilisés dans les douze mois suivant la création du compte.
Ces deux présentations coexistent actuellement sur la même page. L’éligibilité réelle dépend donc de la date de création du compte, du plan choisi et des crédits visibles dans AWS Billing.
Ne basez pas un projet sur une estimation générique : ouvrez la console Billing and Cost Management, vérifiez vos crédits et créez un budget avant d’automatiser un volume important.
Architecture recommandée pour éviter les coûts inutiles
Un workflow de production efficace ne doit pas appeler Polly à chaque lecture. Il doit vérifier si un fichier correspondant au texte et aux paramètres existe déjà.
- Normalisez le texte et les paramètres de voix reçus par l’application.
- Calculez un identifiant unique à partir du texte, du moteur, de la voix, du format et de la vitesse.
- Recherchez cet identifiant dans la base ou le stockage avant d’appeler Polly.
- Générez le fichier uniquement lorsqu’aucune version valide n’existe.
- Stockez l’audio dans Amazon S3 avec des métadonnées permettant de retrouver ses paramètres.
- Diffusez le fichier par une URL contrôlée ou un CDN selon les besoins.
- Utilisez CloudWatch et AWS Budgets pour surveiller les appels, erreurs et dépenses.
- Supprimez ou archivez les fichiers obsolètes selon une règle de cycle de vie S3.
Sécurité et contrôle des accès
Amazon Polly s’utilise avec AWS Identity and Access Management. Les applications doivent recevoir uniquement les autorisations nécessaires à la synthèse, à la consultation des voix et au stockage des fichiers.
Pour les synthèses longues, le compartiment S3 doit autoriser l’écriture depuis le processus concerné. Le chiffrement du compartiment, les politiques de rétention et les journaux d’accès doivent être configurés selon la sensibilité du contenu.
Bonnes pratiques
- ne jamais intégrer une clé AWS permanente dans du JavaScript public ou une application distribuée ;
- utiliser des rôles IAM et des identifiants temporaires lorsque cela est possible ;
- restreindre l’accès aux compartiments contenant les fichiers privés ;
- activer des budgets et alertes de facturation ;
- journaliser les erreurs et les pics de requêtes ;
- appliquer un mécanisme de retry avec délai progressif en cas de limitation.
Les limites d’Amazon Polly à connaître
1. Ce n’est pas un studio pour créateurs
La console génère des fichiers, mais elle ne remplace pas une timeline vidéo, une bibliothèque de médias ou un outil de collaboration éditoriale.
2. La compatibilité varie selon la voix et la région
Une voix peut être Standard, Neural ou Generative sans être proposée dans tous les moteurs ou toutes les régions.
3. Les moteurs avancés ne prennent pas toutes les balises SSML
Certains effets disponibles avec Standard sont refusés avec Neural, Long-Form ou Generative.
4. Le moteur Long-Form est très limité
Il est nettement plus cher, disponible dans une seule région et ne possède actuellement aucune voix française.
5. La limite de 3 000 caractères impose un découpage
Les réponses en temps réel doivent être segmentées. Les textes plus longs nécessitent une tâche asynchrone et un compartiment S3.
6. Polly ne propose pas un clonage vocal grand public
AWS propose Brand Voice comme service personnalisé destiné aux entreprises, et non comme une fonction instantanée accessible depuis la console standard.
7. La facture AWS dépasse parfois le seul TTS
Le stockage, la diffusion, les journaux, le réseau et les autres services de l’architecture peuvent représenter un coût supérieur à la synthèse elle-même.
Comment créer un premier fichier avec Amazon Polly ?
- Créez ou ouvrez un compte AWS puis sélectionnez une région compatible avec le moteur prévu.
- Ouvrez Amazon Polly dans la console AWS.
- Choisissez Standard, Neural, Generative ou Long-Form selon les voix disponibles.
- Sélectionnez la langue française et comparez plusieurs voix sur le même extrait.
- Commencez avec du texte brut avant d’ajouter des balises SSML.
- Choisissez MP3 pour un usage courant, PCM pour le traitement ou un format téléphonique pour un IVR.
- Écoutez le résultat puis corrigez la ponctuation et les prononciations difficiles.
- Utilisez une tâche S3 lorsque le texte dépasse la limite de synthèse immédiate.
- Stockez le fichier et réutilisez-le plutôt que de relancer la même requête.
- Créez un budget AWS et une alerte avant le passage en production.
Quelles alternatives à Amazon Polly examiner ?
Amazon Polly est une infrastructure TTS. Les alternatives les plus pertinentes dépendent donc du besoin de création, de clonage, de sécurité ou de collaboration.
| Priorité | Outil à comparer | Différence principale |
|---|---|---|
| Voix créatives et clonage | ElevenLabs | Studio et API orientés vers le réalisme, le clonage et la production multilingue |
| Génération et sécurité | Resemble AI | Clonage, Speech-to-Speech, agents, détection deepfake et filigrane |
| Studio pour équipes | Murf AI | Interface de création destinée aux formations, présentations et workflows collaboratifs |
| Studio voix et vidéo | Genny by LOVO AI | Création vocale, sous-titres, ressources média et montage dans une interface unique |
| API vocale et clonage | PlayHT | Alternative orientée voix, intégration et production audio |
Questions fréquentes sur Amazon Polly
Combien coûte Amazon Polly ?
Amazon Polly coûte 4 dollars par million de caractères avec Standard, 16 dollars avec Neural, 30 dollars avec Generative et 100 dollars avec Long-Form, hors offre gratuite et tarification GovCloud.
Amazon Polly possède-t-il une offre gratuite ?
Oui, mais les règles dépendent de la date de création du compte. La page Polly affiche des quotas pendant douze mois et précise aussi que les nouveaux clients depuis le 15 juillet 2025 peuvent recevoir des crédits AWS avec un plan gratuit limité à six mois.
Amazon Polly fonctionne-t-il en français ?
Oui. Le service propose des voix de France, de Belgique et du Canada avec des moteurs Standard, Neural ou Generative selon la voix.
Peut-on générer un livre ou un long document ?
Oui. StartSpeechSynthesisTask accepte jusqu’à 100 000 caractères facturés et enregistre le résultat dans Amazon S3. Le texte doit être découpé si cette limite est dépassée.
Peut-on conserver et rejouer les fichiers générés ?
Oui. AWS autorise la mise en cache et le rejeu de l’audio sans nouvelle facturation Polly. Des frais de stockage, de CDN ou de transfert peuvent toutefois s’appliquer.
Quels formats audio sont disponibles ?
Amazon Polly prend en charge MP3, OGG Vorbis, OGG Opus, PCM, μ-law et A-law selon l’opération et le moteur utilisés.
Amazon Polly permet-il de cloner une voix ?
Il ne propose pas de clonage instantané grand public. AWS offre Brand Voice comme service personnalisé permettant à une entreprise de créer une voix exclusive avec l’équipe Amazon Polly.
Quelle est la différence entre Speech Marks et l’audio ?
L’audio contient la parole synthétisée. Les Speech Marks sont des métadonnées temporelles utilisées pour le surlignage, les sous-titres synchronisés, les animations faciales et les repères SSML.
Sources officielles vérifiées








