> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Speech-to-Text 모델

> Whisper Large V3, ElevenLabs Scribe 등 다국어 지원, 타임스탬프, 초당 과금을 갖춘 Venice 음성-텍스트 모델.

<div id="model-search-placeholder" data-filter="asr">
  API 요청에서 `id` 값을 `model` 매개변수로 사용하세요. 현재 5개의 모델을 사용할 수 있습니다.

  | Model                 | ID                            | Per audio second | Privacy    |
  | --------------------- | ----------------------------- | ---------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002         | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001         | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001         | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001         | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000         | Anonymized |
</div>

***

## 사용법

Speech-to-text 모델은 음성 오디오를 텍스트로 전사합니다. [Audio Transcriptions API](/ko/api-reference/endpoint/audio/transcriptions)를 통해 액세스할 수 있습니다.

### 지원되는 오디오 형식

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

파일의 MIME 유형 또는 확장자 중 하나가 이 목록에 있으면 허용되며, 업로드된 바이트에 대한 매직 바이트 검사도 통과해야 합니다. 파일 이름을 지원되는 확장자로 바꾸는 것만으로는 충분하지 않습니다.

### 응답 형식

| 형식     | 설명                                                                      |
| ------ | ----------------------------------------------------------------------- |
| `json` | 기본값. `{ "text": "..." }`를 반환하며, 가능한 경우 `duration`과 `timestamps`도 포함합니다. |
| `text` | 일반 전사 텍스트.                                                              |

### 타임스탬프

전사 결과와 함께 타이밍 데이터를 받으려면 `timestamps: true`를 설정하세요. 응답에 `timestamps` 객체가 추가되며, 세분성은 모델에 따라 다릅니다:

| 모델                            | 세분성       |
| ----------------------------- | --------- |
| `elevenlabs/scribe-v2`        | `word`    |
| `stt-xai-v1`                  | `word`    |
| `openai/whisper-large-v3`     | `segment` |
| `fal-ai/wizper`               | `segment` |
| `nvidia/parakeet-tdt-0.6b-v3` | 없음        |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3`은 기본 모델이며, `timestamps: true`를 받아들이지만 타이밍을 반환하지 않습니다. 오류도 경고도 없이 — 응답에는 `text`만 포함됩니다. 타이밍이 필요하면 위 표에서 모델을 선택하고, 읽기 전에 `timestamps` 키가 존재하는지 확인하세요.
</Warning>

단어 항목은 `{ "word": "...", "start": 0.0, "end": 0.5 }`, 세그먼트 항목은 `{ "text": "...", "start": 0.0, "end": 3.2 }` 형태이며, 모든 시간은 초 단위입니다.

<Note>
  가격은 입력 오디오의 초당 청구됩니다. 요청 예제와 매개변수 세부 정보는 [Audio Transcriptions API](/ko/api-reference/endpoint/audio/transcriptions)를 참조하세요.
</Note>
