Zum Hauptinhalt springen
Cloud / Google Cloud / Produkte / Speech-to-Text - Spracherkennung mit Chirp-Modellen

Speech-to-Text - Spracherkennung mit Chirp-Modellen

Speech-to-Text wandelt gesprochene Sprache in Text um, mit Chirp-Modellen und Unterstützung zahlreicher Sprachen. EU-Regionen verfügbar.

AI/ML
Preismodell Bezahlung nach Nutzung (pro Audio-Minute bzw. -Sekunde, je nach Modell)
Verfügbarkeit Global mit EU-Regionen
Datensouveränität EU-Regionen verfügbar
Zuverlässigkeit SLA gemäß Anbieter (siehe offizielle SLA-Seite) SLA

Speech-to-Text wandelt gesprochene Sprache in Text um. Die aktuelle API-Generation (v2) setzt auf die Chirp-Modellfamilie mit hoher Erkennungsgenauigkeit und Unterstützung für Echtzeit-Streaming.

Was ist Google Cloud Speech-to-Text?

Speech-to-Text ist ein vollständig verwalteter KI-Service für automatische Spracherkennung (ASR). Der Service wandelt Audio in Text um und unterstützt eine breite Palette an Sprachen und Varianten. Mit der Speech-to-Text API v2 hat Google die Modellarchitektur überarbeitet: Anstelle der früheren Modelle Standard, Enhanced, Phone Call, Video und Medical stehen heute die Chirp-Modelle (Chirp 2, Chirp 3) sowie das spezialisierte Modell telephony für Telefonaudio zur Verfügung. Chirp basiert auf großen, universellen Sprachmodellen und bietet automatische Spracherkennung, Diarization sowie multilinguale Verarbeitung.

Der Service bietet verschiedene Verarbeitungsmodi: synchrone Erkennung für kurze Audio-Clips, asynchrone Verarbeitung für längere Dateien und Echtzeit-Streaming für Live-Audio. Streaming-Erkennung liefert Ergebnisse mit niedriger Latenz, ideal für Sprachassistenten, Live-Untertitel oder Sprachbefehle. Batch-Verarbeitung eignet sich für die Transkription großer Audio-Archive. Die Vorgängerversion der API (v1) steht weiterhin zur Verfügung, für neue Projekte empfiehlt sich jedoch v2 mit den aktuellen Chirp-Modellen.

Kernfunktionen

  • Chirp-Modellfamilie: Aktuelle Generation großer Sprachmodelle für hohe Genauigkeit und multilinguale Erkennung
  • Telephony-Modell: Spezialisiert auf Telefonaudio (typischerweise 8 kHz), geeignet für Call Center und IVR-Systeme
  • Automatische Zeichensetzung und Diarization: Erkennung von Satzzeichen und Unterscheidung mehrerer Sprecher
  • Echtzeit-Streaming und Batch-Verarbeitung: Flexible Verarbeitung je nach Anwendungsfall
  • Wortgenaue Zeitstempel: Für präzise Synchronisation, etwa bei Untertiteln

Typische Anwendungsfälle

Call Center Transkription

Ein Kundenservice-Center transkribiert Anrufe mit dem telephony-Modell, das speziell für Telefonaudio optimiert ist. Transkripte werden automatisch analysiert für Qualitätssicherung, Sentiment-Analyse und Compliance-Prüfung.

Meeting-Transkription

Ein Unternehmen transkribiert interne Meetings automatisch. Diarization identifiziert einzelne Sprecher, Transkripte werden archiviert und durchsuchbar gemacht.

Sprachassistenten und Chatbots

Eine Plattform integriert Sprachbefehle über Streaming-Erkennung, die Nutzer-Sprache in Echtzeit verarbeitet. Kunden können Produkte suchen, bestellen und Fragen per Sprache stellen.

Barrierefreiheit und Untertitel

Ein Medienunternehmen erstellt automatische Untertitel für Videos. Wortgenaue Zeitstempel ermöglichen präzise Untertitel-Synchronisation, auch für Live-Events.

Vorteile

  • Aktuelle Chirp-Modelle mit hoher Erkennungsgenauigkeit auf Basis großer Sprachmodelle
  • Flexible Verarbeitung: Streaming und Batch
  • Spezialisierte Modelle für Telefonie-Anwendungsfälle
  • Integration mit dem Google-Cloud-KI-Ökosystem

Integration mit innFactory

Als zertifizierter Google Cloud Partner unterstützt innFactory Sie bei Speech-to-Text: API-Integration, Migration auf die aktuelle API v2 mit Chirp-Modellen, Streaming-Implementierung und Optimierung der Erkennungsgenauigkeit.

Kontaktieren Sie uns für eine Beratung zu Speech-to-Text und Google Cloud AI.

Verfügbare Varianten & Optionen

Telephony

Stärken
  • Optimiert für Telefonaudio (8 kHz)
  • Geeignet für Call Center und IVR
Einschränkungen
  • Speziell auf Telefonie-Anwendungsfälle zugeschnitten

Typische Anwendungsfälle

Call Center Transkription
Sprachbefehle
Meeting-Transkription
Barrierefreiheit
Voice Search

Technische Spezifikationen

API Speech-to-Text API v2 (v1 weiterhin verfügbar), RESTful API, gRPC, Client-Bibliotheken
Features Automatische Zeichensetzung, Sprechererkennung (Diarization), wortgenaue Zeitstempel
Integration Native Google Cloud Integration
Models Chirp 2, Chirp 3, telephony (Nachfolger der früheren Standard/Enhanced/Phone-Call/Medical-Modelle)
Security Verschlüsselung im Ruhezustand und bei der Übertragung
Streaming Echtzeit-Streaming und Batch-Verarbeitung

Häufig gestellte Fragen

Was ist Google Cloud Speech-to-Text?

Speech-to-Text ist ein KI-Service, der gesprochene Sprache in Text umwandelt. Der aktuelle Speech-to-Text API v2 setzt auf die Chirp-Modellfamilie, die auf großen Sprachmodellen basiert, und bietet automatische Zeichensetzung, Sprechererkennung sowie Verarbeitung aufgezeichneter Dateien und Echtzeit-Audio.

Welche Modelle stehen heute zur Verfügung?

Die aktuelle Modellgeneration heißt Chirp (Chirp 2 und Chirp 3) und bietet hohe Genauigkeit sowie multilinguale Erkennung. Für Telefonaudio steht das spezialisierte Modell telephony zur Verfügung. Die früheren Bezeichnungen Standard, Enhanced, Phone Call, Video und Medical wurden im Rahmen der API-v2-Weiterentwicklung durch diese neuen Modelle abgelöst.

Welche Sprachen werden unterstützt?

Speech-to-Text unterstützt eine große Zahl an Sprachen und Varianten; die genaue, aktuelle Liste ist in der offiziellen Dokumentation zu den unterstützten Sprachen gepflegt, da sich der Umfang laufend erweitert.

Unterstützt Speech-to-Text Echtzeit-Streaming?

Ja, Speech-to-Text bietet Echtzeit-Streaming-Transkription mit niedriger Latenz. Audio wird kontinuierlich verarbeitet und Ergebnisse werden fortlaufend zurückgegeben, ideal für Live-Untertitel, Sprachassistenten und Sprachbefehle.

Kann ich die Erkennung für Fachvokabular anpassen?

Ja, Speech-to-Text bietet Mechanismen zur Anpassung der Erkennung an Fachbegriffe, Produktnamen oder branchenspezifische Terminologie, was die Genauigkeit für spezialisierte Anwendungen verbessert.

Wie wird Speech-to-Text abgerechnet?

Die Abrechnung erfolgt nutzungsbasiert nach verarbeiteter Audiodauer, wobei sich die Rate je nach eingesetztem Modell unterscheidet. Aktuelle Details und mögliche kostenlose Kontingente sind der offiziellen Pricing-Seite zu entnehmen.

Hinweis: Alle Produktinformationen auf dieser Seite wurden sorgfältig zusammengestellt, sind jedoch ohne Gewähr und können veraltet oder unvollständig sein. Cloud-Services entwickeln sich schnell weiter — Funktionen, Preise, SLAs und Verfügbarkeit ändern sich laufend. Verbindliche und aktuelle Informationen finden Sie ausschließlich auf der offiziellen Produktseite von Google Cloud (offizielle Dokumentation). Diese Seite stellt kein Angebot von Google Cloud dar.

Google Cloud Partner

innFactory ist zertifizierter Google Cloud Partner. Wir bieten Beratung, Implementierung und Managed Services.

Google Cloud Partner

Bereit, mit Speech-to-Text - Spracherkennung mit Chirp-Modellen zu starten?

Unsere zertifizierten Google Cloud Experten helfen bei Architektur, Integration und Optimierung.

Beratung vereinbaren