Speech-to-Text wandelt gesprochene Sprache in Text um. Die aktuelle API-Generation (v2) setzt auf die Chirp-Modellfamilie mit hoher Erkennungsgenauigkeit und Unterstützung für Echtzeit-Streaming.
Was ist Google Cloud Speech-to-Text?
Speech-to-Text ist ein vollständig verwalteter KI-Service für automatische Spracherkennung (ASR). Der Service wandelt Audio in Text um und unterstützt eine breite Palette an Sprachen und Varianten. Mit der Speech-to-Text API v2 hat Google die Modellarchitektur überarbeitet: Anstelle der früheren Modelle Standard, Enhanced, Phone Call, Video und Medical stehen heute die Chirp-Modelle (Chirp 2, Chirp 3) sowie das spezialisierte Modell telephony für Telefonaudio zur Verfügung. Chirp basiert auf großen, universellen Sprachmodellen und bietet automatische Spracherkennung, Diarization sowie multilinguale Verarbeitung.
Der Service bietet verschiedene Verarbeitungsmodi: synchrone Erkennung für kurze Audio-Clips, asynchrone Verarbeitung für längere Dateien und Echtzeit-Streaming für Live-Audio. Streaming-Erkennung liefert Ergebnisse mit niedriger Latenz, ideal für Sprachassistenten, Live-Untertitel oder Sprachbefehle. Batch-Verarbeitung eignet sich für die Transkription großer Audio-Archive. Die Vorgängerversion der API (v1) steht weiterhin zur Verfügung, für neue Projekte empfiehlt sich jedoch v2 mit den aktuellen Chirp-Modellen.
Kernfunktionen
- Chirp-Modellfamilie: Aktuelle Generation großer Sprachmodelle für hohe Genauigkeit und multilinguale Erkennung
- Telephony-Modell: Spezialisiert auf Telefonaudio (typischerweise 8 kHz), geeignet für Call Center und IVR-Systeme
- Automatische Zeichensetzung und Diarization: Erkennung von Satzzeichen und Unterscheidung mehrerer Sprecher
- Echtzeit-Streaming und Batch-Verarbeitung: Flexible Verarbeitung je nach Anwendungsfall
- Wortgenaue Zeitstempel: Für präzise Synchronisation, etwa bei Untertiteln
Typische Anwendungsfälle
Call Center Transkription
Ein Kundenservice-Center transkribiert Anrufe mit dem telephony-Modell, das speziell für Telefonaudio optimiert ist. Transkripte werden automatisch analysiert für Qualitätssicherung, Sentiment-Analyse und Compliance-Prüfung.
Meeting-Transkription
Ein Unternehmen transkribiert interne Meetings automatisch. Diarization identifiziert einzelne Sprecher, Transkripte werden archiviert und durchsuchbar gemacht.
Sprachassistenten und Chatbots
Eine Plattform integriert Sprachbefehle über Streaming-Erkennung, die Nutzer-Sprache in Echtzeit verarbeitet. Kunden können Produkte suchen, bestellen und Fragen per Sprache stellen.
Barrierefreiheit und Untertitel
Ein Medienunternehmen erstellt automatische Untertitel für Videos. Wortgenaue Zeitstempel ermöglichen präzise Untertitel-Synchronisation, auch für Live-Events.
Vorteile
- Aktuelle Chirp-Modelle mit hoher Erkennungsgenauigkeit auf Basis großer Sprachmodelle
- Flexible Verarbeitung: Streaming und Batch
- Spezialisierte Modelle für Telefonie-Anwendungsfälle
- Integration mit dem Google-Cloud-KI-Ökosystem
Integration mit innFactory
Als zertifizierter Google Cloud Partner unterstützt innFactory Sie bei Speech-to-Text: API-Integration, Migration auf die aktuelle API v2 mit Chirp-Modellen, Streaming-Implementierung und Optimierung der Erkennungsgenauigkeit.
Kontaktieren Sie uns für eine Beratung zu Speech-to-Text und Google Cloud AI.
Verfügbare Varianten & Optionen
Chirp (v2/v3)
- Hohe Genauigkeit durch große Sprachmodelle
- Multilinguale Erkennung
- Automatische Spracherkennung und Diarization
- Nicht für jede Sprache/Region identisch verfügbar
Telephony
- Optimiert für Telefonaudio (8 kHz)
- Geeignet für Call Center und IVR
- Speziell auf Telefonie-Anwendungsfälle zugeschnitten
Typische Anwendungsfälle
Technische Spezifikationen
Häufig gestellte Fragen
Was ist Google Cloud Speech-to-Text?
Speech-to-Text ist ein KI-Service, der gesprochene Sprache in Text umwandelt. Der aktuelle Speech-to-Text API v2 setzt auf die Chirp-Modellfamilie, die auf großen Sprachmodellen basiert, und bietet automatische Zeichensetzung, Sprechererkennung sowie Verarbeitung aufgezeichneter Dateien und Echtzeit-Audio.
Welche Modelle stehen heute zur Verfügung?
Die aktuelle Modellgeneration heißt Chirp (Chirp 2 und Chirp 3) und bietet hohe Genauigkeit sowie multilinguale Erkennung. Für Telefonaudio steht das spezialisierte Modell telephony zur Verfügung. Die früheren Bezeichnungen Standard, Enhanced, Phone Call, Video und Medical wurden im Rahmen der API-v2-Weiterentwicklung durch diese neuen Modelle abgelöst.
Welche Sprachen werden unterstützt?
Speech-to-Text unterstützt eine große Zahl an Sprachen und Varianten; die genaue, aktuelle Liste ist in der offiziellen Dokumentation zu den unterstützten Sprachen gepflegt, da sich der Umfang laufend erweitert.
Unterstützt Speech-to-Text Echtzeit-Streaming?
Ja, Speech-to-Text bietet Echtzeit-Streaming-Transkription mit niedriger Latenz. Audio wird kontinuierlich verarbeitet und Ergebnisse werden fortlaufend zurückgegeben, ideal für Live-Untertitel, Sprachassistenten und Sprachbefehle.
Kann ich die Erkennung für Fachvokabular anpassen?
Ja, Speech-to-Text bietet Mechanismen zur Anpassung der Erkennung an Fachbegriffe, Produktnamen oder branchenspezifische Terminologie, was die Genauigkeit für spezialisierte Anwendungen verbessert.
Wie wird Speech-to-Text abgerechnet?
Die Abrechnung erfolgt nutzungsbasiert nach verarbeiteter Audiodauer, wobei sich die Rate je nach eingesetztem Modell unterscheidet. Aktuelle Details und mögliche kostenlose Kontingente sind der offiziellen Pricing-Seite zu entnehmen.
Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.
