> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Modelos de voz a texto

> Modelos de voz a texto de Venice como Whisper Large V3 y ElevenLabs Scribe con soporte multilingüe, marcas de tiempo y precios por segundo.

<div id="model-search-placeholder" data-filter="asr">
  Usa el valor `id` como parámetro `model` en las solicitudes a la API. Actualmente hay 5 modelos disponibles.

  | Modelo                | ID                            | Por segundo de audio | Privacidad |
  | --------------------- | ----------------------------- | -------------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002             | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001             | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001             | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001             | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000             | Anonymized |
</div>

***

## Uso

Los modelos de voz a texto transcriben audio hablado en texto escrito. Se acceden mediante la [API de transcripciones de audio](/es/api-reference/endpoint/audio/transcriptions).

### Formatos de audio admitidos

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

Un archivo se acepta cuando su tipo MIME o su extensión están en esta lista, y además debe superar una comprobación de magic bytes sobre los bytes subidos. Renombrar un archivo con una extensión admitida no es suficiente.

### Formatos de respuesta

| Formato | Descripción                                                                                           |
| ------- | ----------------------------------------------------------------------------------------------------- |
| `json`  | Predeterminado. Devuelve `{ "text": "..." }`, más `duration` y `timestamps` cuando estén disponibles. |
| `text`  | Texto transcrito plano.                                                                               |

### Marcas de tiempo

Establece `timestamps: true` para recibir datos de tiempo junto con la transcripción. La respuesta añade un objeto `timestamps` cuya granularidad depende del modelo:

| Modelo                        | Granularidad |
| ----------------------------- | ------------ |
| `elevenlabs/scribe-v2`        | `word`       |
| `stt-xai-v1`                  | `word`       |
| `openai/whisper-large-v3`     | `segment`    |
| `fal-ai/wizper`               | `segment`    |
| `nvidia/parakeet-tdt-0.6b-v3` | Ninguna      |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` es el modelo predeterminado, y acepta `timestamps: true` sin devolver datos de tiempo. No hay error ni advertencia: la respuesta simplemente contiene `text` y nada más. Si necesitas datos de tiempo, elige un modelo de la tabla anterior y comprueba que la clave `timestamps` está presente antes de leerla.
</Warning>

Las entradas de palabra son `{ "word": "...", "start": 0.0, "end": 0.5 }` y las entradas de segmento son `{ "text": "...", "start": 0.0, "end": 3.2 }`, con todos los tiempos en segundos.

<Note>
  La facturación es por segundo de audio de entrada. Consulta la [API de transcripciones de audio](/es/api-reference/endpoint/audio/transcriptions) para ejemplos de solicitud y detalles de parámetros.
</Note>
