
AssemblyAI
Speech-to-Text- und Voice-AI-APIs
AssemblyAI ist eine Voice-AI-Plattform, die genaue Spracherkennung (Speech-to-Text), Echtzeit-Transkription und Voice-Agent-APIs für Entwickler bietet.
Was ist AssemblyAI?
AssemblyAI ist eine Voice-AI-Plattform, die Sprache aus Anrufen, Meetings, Podcasts und Sprachagenten mithilfe einfacher Entwickler-APIs in genauen Text umwandelt. Sie bietet sowohl Transkription von aufgezeichneten Dateien als auch Echtzeit-Transkription, sodass du gespeicherte Audiodateien verarbeiten oder Live-Gespräche in Echtzeit erfassen kannst.
Das Flaggschiff-Modell Universal-3.5 Pro liefert hohe Genauigkeit in 18 Sprachen, erkennt mehrere Sprecher und versteht medizinische und technische Begriffe. Über die reine Transkription hinaus bietet die Plattform Verständnisfunktionen wie Zusammenfassungen, Stimmungsanalyse, Themen und Übersetzung.
Für Teams, die Sprachagenten entwickeln, bündelt AssemblyAI Spracherkennung, ein abgestimmtes Sprachmodell und Text-to-Speech zu einer einzigen Voice Agent API, sodass keine Notwendigkeit besteht, separate Tools zusammenzusetzen.
Die Preisgestaltung erfolgt nutzungsbasiert, abgerechnet pro Stunde verarbeiteten Audios, mit individuellen Plänen für größere Teams, die höheres Volumen oder zusätzlichen Support benötigen.
Funktionen von AssemblyAI
Spracherkennung für aufgezeichnete Audiodateien und Echtzeit
Sync API mit einem Aufruf für kurze Clips
Sprecher-Diarisierung und Beschriftung
Unterstützung für bis zu 99 Sprachen
Zusammenfassungen, Stimmung und Themenerkennung
Übersetzung und Entitätserkennung
Schwärzung personenbezogener Daten und Inhaltsmoderation
End-to-end-Voice-Agent-API
Medical-Modus für Gesundheitsaudio
Python- und JavaScript-SDKs
AssemblyAI Preise
Pre-recorded Speech-to-Text
- Universal-2-Modell ab 0,15 $/Stunde
- Universal-3.5-Pro-Modell ab 0,21 $/Stunde
- Sprecher-Diarisierung als Add-on
- Keyword-Prompting und Medical-Modus verfügbar
Realtime Speech-to-Text
- Universal-Streaming ab 0,15 $/Stunde
- Universal-3.5 Pro Realtime ab 0,45 $/Stunde
- Mehrsprachiges Streaming
- Live-Transkripte mit niedriger Latenz
Sync API
- Transkripte mit einem Aufruf für kurze Audiodateien
- Keyword-Prompting enthalten
- Gesprächskontext enthalten
- Schnelle Antwortzeiten
Voice Agent API
- Spracherkennung, LLM und TTS enthalten
- Erweiterte Turn- und Unterbrechungserkennung
- Aufnahmen und Transkripte enthalten
- Telefonie- und SIP-Trunking-Unterstützung
Enterprise
- Individuelle Ratenlimits und Parallelverarbeitung
- Mengenrabatte
- Dedizierter Support für Voice-Agent-Kunden
- Individuelle Stimmen für Voice Agent
AssemblyAI Anwendungsfälle
Häufig gestellte Fragen zu AssemblyAI
Sehen Sie, was Benutzer über sagen AssemblyAI
0 Bewertungen
Noch keine Bewertungen
Seien Sie der Erste, der bewertet AssemblyAI









