> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# نماذج تحويل الكلام إلى نص

> نماذج تحويل الكلام إلى نص في Venice مثل Whisper Large V3 وElevenLabs Scribe مع دعم متعدد اللغات وطوابع زمنية وتسعير محسوب لكل ثانية.

<div id="model-search-placeholder" data-filter="asr">
  استخدم قيمة `id` كمعامل `model` في طلبات API. عدد النماذج المتوفرة حاليًا: 5.

  | النموذج               | المعرّف                       | لكل ثانية صوت | الخصوصية   |
  | --------------------- | ----------------------------- | ------------- | ---------- |
  | ElevenLabs Scribe V2  | `elevenlabs/scribe-v2`        | \$0.0002      | Anonymized |
  | Parakeet ASR          | `nvidia/parakeet-tdt-0.6b-v3` | \$0.0001      | Private    |
  | Whisper Large V3      | `openai/whisper-large-v3`     | \$0.0001      | Private    |
  | Wizper (Whisper v3)   | `fal-ai/wizper`               | \$0.0001      | Private    |
  | xAI Speech to Text v1 | `stt-xai-v1`                  | \$0.0000      | Anonymized |
</div>

***

## الاستخدام

تقوم نماذج تحويل الكلام إلى نص بنسخ الصوت المنطوق إلى نص مكتوب. يتم الوصول إليها عبر [واجهة Audio Transcriptions API](/ar/api-reference/endpoint/audio/transcriptions).

### صيغ الصوت المدعومة

`wav`, `wave`, `flac`, `m4a`, `aac`, `mp4`, `mp3`, `ogg`, `oga`, `webm`

يُقبل الملف عندما يكون نوع MIME الخاص به أو امتداده ضمن هذه القائمة، ويجب أيضًا أن يجتاز فحص البايتات السحرية (magic-byte) على البايتات المرفوعة. إعادة تسمية ملف بامتداد مدعوم لا تكفي.

### صيغ الاستجابة

| الصيغة | الوصف                                                                                    |
| ------ | ---------------------------------------------------------------------------------------- |
| `json` | الافتراضي. يُرجع `{ "text": "..." }`، بالإضافة إلى `duration` و`timestamps` عند توفرهما. |
| `text` | نص منسوخ عادي.                                                                           |

### الطوابع الزمنية

عيّن `timestamps: true` لتلقي بيانات التوقيت مع التفريغ. تضيف الاستجابة كائن `timestamps` تعتمد درجة تفصيله على النموذج:

| النموذج                       | درجة التفصيل |
| ----------------------------- | ------------ |
| `elevenlabs/scribe-v2`        | `word`       |
| `stt-xai-v1`                  | `word`       |
| `openai/whisper-large-v3`     | `segment`    |
| `fal-ai/wizper`               | `segment`    |
| `nvidia/parakeet-tdt-0.6b-v3` | لا شيء       |

<Warning>
  `nvidia/parakeet-tdt-0.6b-v3` هو النموذج الافتراضي، وهو يقبل `timestamps: true` دون إرجاع توقيتات. لا يوجد خطأ ولا تحذير — تحتوي الاستجابة ببساطة على `text` ولا شيء آخر. إذا كنت بحاجة إلى التوقيتات، اختر نموذجًا من الجدول أعلاه وتحقق من وجود المفتاح `timestamps` قبل قراءته.
</Warning>

إدخالات الكلمات على شكل `{ "word": "...", "start": 0.0, "end": 0.5 }` وإدخالات المقاطع على شكل `{ "text": "...", "start": 0.0, "end": 3.2 }`، وجميع الأزمنة بالثواني.

<Note>
  يتم احتساب التسعير لكل ثانية من الصوت المُدخَل. راجع [واجهة Audio Transcriptions API](/ar/api-reference/endpoint/audio/transcriptions) للحصول على أمثلة الطلبات وتفاصيل المعاملات.
</Note>
