Was ist Amazon Polly?
Amazon Polly ist ein Cloud-Service von AWS, der Text in natürlich klingende Sprache umwandelt. Der Service eignet sich für Anwendungen, Accessibility-Features und automatisierte Content-Erstellung und unterstützt zahlreiche Sprachen.
Polly bietet vier Stimmentypen: klassische Standard-Stimmen, Neural-TTS-Stimmen mit natürlicherer Betonung durch Deep Learning, Long-Form-Stimmen für gleichmäßige Vorlesequalität bei längeren Texten sowie generative Stimmen, die aktuell die ausdrucksstärkste und menschenähnlichste Sprachqualität liefern. Die einfache API ermöglicht eine schnelle Integration in eigene Anwendungen.
Kernfunktionen
- Vier Stimmentypen: Standard, Neural, Long-Form und generative Stimmen für unterschiedliche Qualitäts- und Anwendungsanforderungen
- Viele Sprachen: Darunter Deutsch, Englisch, Französisch, Spanisch und weitere
- SSML-Support: Feinsteuerung von Aussprache, Pausen und Betonung
- Speech Marks: Timing-Informationen für Lip-Sync und Texthervorhebung
- Lexicons: Benutzerdefinierte Aussprachewörterbücher
- Caching erlaubt: Erzeugte Sprachausgaben dürfen ohne zusätzliche Kosten zwischengespeichert und wiederverwendet werden
Typische Anwendungsfälle
Voice Assistants: Sprachausgabe für Chatbots, IVR-Systeme und Smart-Home-Geräte. Neural- und generative Stimmen sorgen für natürlichere Konversationen.
Accessibility: Vorlesen von Web-Inhalten, Dokumenten und Apps für sehbehinderte Nutzer als Audio-Alternative zu Text.
Content-Erstellung: Audio-Versionen von Artikeln, E-Learning-Inhalten und Podcasts. Automatisierte Produktion spart Zeit und Kosten gegenüber manueller Vertonung.
Vorteile
- Mehrere Stimmentypen für unterschiedliche Qualitäts- und Budgetanforderungen
- Nutzungsabhängige Abrechnung pro Zeichen
- Einfache REST-API für schnelle Integration
- Unterstützung für deutsche Stimmen
Integration mit innFactory
Als AWS Reseller unterstützt innFactory Sie bei Amazon Polly: Wir helfen bei der Auswahl des passenden Stimmentyps, der Integration in Ihre Anwendungen, der Optimierung der Sprachqualität mit SSML und der Kombination mit anderen AWS-Services wie Lex und Connect.
Typische Anwendungsfälle
Häufig gestellte Fragen
Was ist Amazon Polly?
Amazon Polly ist ein Text-to-Speech-Service von AWS, der Text in natürlich klingende Sprache umwandelt. Er bietet Stimmen in vielen Sprachen über vier Technologiestufen: Standard, Neural, Long-Form und generative Stimmen.
Was unterscheidet die Stimmentypen?
Standard-Stimmen nutzen klassische Sprachsynthese, Neural-TTS klingt durch Deep Learning natürlicher, Long-Form-Stimmen sind für lange, gleichmäßige Vorlesetexte optimiert und generative Stimmen liefern die ausdrucksstärkste, menschenähnlichste Sprachqualität.
Was kostet Amazon Polly?
Polly wird nutzungsabhängig pro synthetisiertem Zeichen abgerechnet, wobei sich der Preis je nach gewähltem Stimmentyp unterscheidet (Standard, Neural, Long-Form, Generative). Erzeugte Audiodateien dürfen ohne zusätzliche Kosten zwischengespeichert und wiederverwendet werden. Details zu aktuellen Kontingenten und Preisen stehen auf der offiziellen Pricing-Seite.
Wie kann ich die Aussprache anpassen?
SSML-Tags ermöglichen Kontrolle über Pausen, Betonung, Aussprache und Sprechgeschwindigkeit. Lexicons speichern benutzerdefinierte Aussprachewörterbücher.
Welche Ausgabeformate werden unterstützt?
Amazon Polly liefert Audio in Formaten wie MP3, OGG Vorbis und PCM sowie JSON mit Speech Marks für Timing-Informationen, etwa für Lip-Sync oder Texthervorhebung.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von AWS (offizielle Dokumentation). Diese Seite stellt kein Angebot von AWS dar.