> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Modèles de transcription (Speech-to-Text)

> Modèles speech-to-text Venice comme Whisper Large V3 et ElevenLabs Scribe : support multilingue, horodatages et tarification à la seconde.

<div id="model-search-placeholder" data-filter="asr">
  Utilisez la valeur `id` comme paramètre `model` dans les requêtes API. 5 modèles actuellement disponibles.

  | Modèle                | ID                            | Par seconde audio | Confidentialité |
  | --------------------- | ----------------------------- | ----------------- | --------------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002          | Anonymized      |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001          | Private         |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001          | Private         |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001          | Private         |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000          | Anonymized      |
</div>

***

## Utilisation

Les modèles de transcription convertissent l'audio parlé en texte écrit. Ils sont accessibles via l'[API Audio Transcriptions](/fr/api-reference/endpoint/audio/transcriptions).

### Formats audio pris en charge

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

Un fichier est accepté lorsque son type MIME ou son extension figure dans cette liste, et il doit également passer une vérification des octets magiques sur les octets téléversés. Renommer un fichier avec une extension prise en charge ne suffit pas.

### Formats de réponse

| Format | Description                                                                                           |
| ------ | ----------------------------------------------------------------------------------------------------- |
| `json` | Par défaut. Renvoie `{ "text": "..." }`, plus `duration` et `timestamps` lorsqu'ils sont disponibles. |
| `text` | Texte transcrit brut.                                                                                 |

### Timestamps

Définissez `timestamps: true` pour recevoir des données temporelles avec la transcription. La réponse ajoute un objet `timestamps` dont la granularité dépend du modèle :

| Modèle                        | Granularité |
| ----------------------------- | ----------- |
| `elevenlabs/scribe-v2`        | `word`      |
| `stt-xai-v1`                  | `word`      |
| `openai/whisper-large-v3`     | `segment`   |
| `fal-ai/wizper`               | `segment`   |
| `nvidia/parakeet-tdt-0.6b-v3` | Aucune      |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` est le modèle par défaut, et il accepte `timestamps: true` sans renvoyer de données temporelles. Il n'y a ni erreur ni avertissement — la réponse contient simplement `text` et rien d'autre. Si vous avez besoin de données temporelles, choisissez un modèle du tableau ci-dessus et vérifiez que la clé `timestamps` est présente avant de la lire.
</Warning>

Les entrées au niveau du mot sont `{ "word": "...", "start": 0.0, "end": 0.5 }` et les entrées au niveau du segment sont `{ "text": "...", "start": 0.0, "end": 3.2 }`, tous les temps étant en secondes.

<Note>
  La tarification est facturée par seconde d'audio en entrée. Voir l'[API Audio Transcriptions](/fr/api-reference/endpoint/audio/transcriptions) pour des exemples de requête et des détails sur les paramètres.
</Note>
