ToolQuestor Logo
AssemblyAI

AssemblyAI

API speech-to-text e Voice AI

Aggiunto:8/24/2026
Prezzi:
Basato sull'utilizzoPersonalizzato
Tipo di strumento:
Web AppAPICLI ToolNo-Code Tool
Connetti:
OpenArt AI

OpenArt AI

FEATURED
Granola

Granola

FEATURED
Vidnoz AI

Vidnoz AI

FEATURED

Cos'è AssemblyAI?

AssemblyAI è una piattaforma Voice AI che trasforma il parlato proveniente da chiamate, riunioni, podcast e agenti vocali in testo accurato tramite semplici API per sviluppatori. Offre sia trascrizione pre-registrata che in tempo reale, così puoi elaborare file audio salvati o catturare conversazioni dal vivo mentre accadono.

Il suo modello di punta Universal-3.5 Pro offre una forte accuratezza in 18 lingue, gestisce più parlanti e comprende termini medici e tecnici. Oltre alla semplice trascrizione, la piattaforma aggiunge funzionalità di comprensione come riassunti, sentiment, argomenti e traduzione.

Per i team che sviluppano agenti vocali, AssemblyAI raggruppa speech-to-text, un modello linguistico ottimizzato e text-to-speech in un'unica Voice Agent API, eliminando la necessità di combinare strumenti separati.

Il prezzo è basato sull'uso, addebitato per ora di audio elaborato, con piani personalizzati disponibili per team più grandi che necessitano di volumi maggiori o supporto extra.

Caratteristiche di AssemblyAI

  • Speech-to-text pre-registrato e in tempo reale

  • Sync API a chiamata singola per clip brevi

  • Diarizzazione e etichettatura dei parlanti

  • Supporto per fino a 99 lingue

  • Rilevamento di riassunti, sentiment e argomenti

  • Traduzione e rilevamento di entità

  • Redazione di PII e moderazione dei contenuti

  • Voice Agent API end-to-end

  • Medical Mode per audio sanitario

  • SDK per Python e JavaScript

Prezzi di AssemblyAI

Pre-recorded Speech-to-Text
$0.15
  • Modello Universal-2 da $0.15/ora
  • Modello Universal-3.5 Pro da $0.21/ora
  • Componente aggiuntivo diarizzazione dei parlanti
  • Keyterms prompting e medical mode disponibili
Realtime Speech-to-Text
$0.15
  • Universal-Streaming da $0.15/ora
  • Universal-3.5 Pro Realtime da $0.45/ora
  • Supporto streaming multilingue
  • Trascrizioni live a bassa latenza
Sync API
$0.45
  • Trascrizioni a chiamata singola per audio breve
  • Keyterms prompting incluso
  • Contesto della conversazione incluso
  • Tempi di risposta rapidi
Più Popolare
Voice Agent API
$4.5
  • Speech-to-text, LLM e TTS inclusi
  • Rilevamento avanzato di turni e interruzioni
  • Registrazioni e trascrizioni incluse
  • Supporto per telefonia e trunking SIP
Enterprise
Custom
  • Limiti di velocità e concorrenza personalizzati
  • Sconti basati sul volume
  • Supporto dedicato per clienti Voice Agent
  • Voci personalizzate per Voice Agent

Domande frequenti su AssemblyAI

AssemblyAI è una piattaforma Voice AI che converte audio e video in testo accurato tramite API per sviluppatori e aggiunge funzionalità di comprensione come riassunti, sentiment e traduzione.
AssemblyAI addebita per ora di audio elaborato. La trascrizione pre-registrata e in tempo reale parte da circa $0.15/ora, mentre la Voice Agent API costa $4.50/ora e include speech-to-text, un modello linguistico e text-to-speech.
Sì. Il modello Universal-3.5 Pro supporta 18 lingue con forte accuratezza e code-switching, mentre Universal-2 copre fino a 99 lingue per una copertura più ampia.
Sì. La Voice Agent API combina speech-to-text, un modello linguistico ottimizzato per conversazioni e text-to-speech in un'unica connessione, gestendo rilevamento dei turni e interruzioni per agenti vocali in produzione.
Sì. AssemblyAI offre una Medical Mode per terminologia clinica, insieme a Guardrails per la redazione di PII e moderazione dei contenuti, oltre a funzionalità aziendali come idoneità SOC 2 e HIPAA.
Migliori Alternative a AssemblyAI

Vedi cosa dicono gli utenti su AssemblyAI

0.0

0 Recensioni

5
0
4
0
3
0
2
0
1
0

Nessuna recensione ancora

Sii il primo a recensire AssemblyAI