> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelli Speech-to-Text

> Modelli speech-to-text Venice come Whisper Large V3 ed ElevenLabs Scribe con supporto multilingue, timestamp e prezzi fatturati al secondo.

<div id="model-search-placeholder" data-filter="asr">
  Usa il valore `id` come parametro `model` nelle richieste API. 5 modelli attualmente disponibili.

  | Modello               | ID                            | Per secondo audio | Privacy    |
  | --------------------- | ----------------------------- | ----------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002          | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001          | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001          | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001          | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000          | Anonymized |
</div>

***

## Utilizzo

I modelli speech-to-text trascrivono l'audio parlato in testo scritto. Si accede tramite l'[API Audio Transcriptions](/it/api-reference/endpoint/audio/transcriptions).

### Formati audio supportati

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

Un file è accettato quando il suo MIME type o la sua estensione è in questa lista, e deve anche superare un controllo dei magic byte sui byte caricati. Rinominare un file con un'estensione supportata non è sufficiente.

### Formati di risposta

| Formato | Descrizione                                                                                     |
| ------- | ----------------------------------------------------------------------------------------------- |
| `json`  | Predefinito. Restituisce `{ "text": "..." }`, più `duration` e `timestamps` quando disponibili. |
| `text`  | Testo trascritto in chiaro.                                                                     |

### Timestamps

Imposta `timestamps: true` per ricevere i dati di timing insieme alla trascrizione. La risposta aggiunge un oggetto `timestamps` la cui granularità dipende dal modello:

| Modello                       | Granularità |
| ----------------------------- | ----------- |
| `elevenlabs/scribe-v2`        | `word`      |
| `stt-xai-v1`                  | `word`      |
| `openai/whisper-large-v3`     | `segment`   |
| `fal-ai/wizper`               | `segment`   |
| `nvidia/parakeet-tdt-0.6b-v3` | Nessuna     |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` è il modello predefinito e accetta `timestamps: true` senza restituire i timing. Non c'è alcun errore né avviso — la risposta contiene semplicemente `text` e nient'altro. Se hai bisogno dei timing, scegli un modello dalla tabella qui sopra e verifica che la chiave `timestamps` sia presente prima di leggerla.
</Warning>

Le voci word sono `{ "word": "...", "start": 0.0, "end": 0.5 }` e le voci segment sono `{ "text": "...", "start": 0.0, "end": 3.2 }`, con tutti i tempi in secondi.

<Note>
  I prezzi sono fatturati per secondo di audio in input. Consulta l'[API Audio Transcriptions](/it/api-reference/endpoint/audio/transcriptions) per esempi di richiesta e dettagli sui parametri.
</Note>
