Skip to main content
Les limites de débit varient selon le modèle et le niveau. Les limites par défaut ci-dessous constituent une référence utile, mais l’endpoint API /api_keys/rate_limits est la manière canonique de récupérer vos limites actuelles. Vous pouvez vérifier vos limites exactes à tout moment :

Voir vos limites

Playground interactif

Journaux de limite de débit

Voir quelles requêtes ont atteint les limites

Limites par défaut

Modèles de texte et d’embedding

Les modèles de texte et d’embedding sont regroupés en quatre tailles. Chaque carte de modèle sur la page Modèles affiche son badge de taille. Tous les modèles d’embedding sont de taille XS.
Certains modèles fonctionnent sur une infrastructure dédiée ou tierce et sont soumis à des limites qui ne correspondent pas à ces quatre tailles. Appelez GET /api_keys/rate_limits pour obtenir les limites par modèle faisant autorité pour votre clé.

Modèles d’image et d’audio

Modèles de vidéo et de musique

La génération de vidéo et de musique n’est pas soumise à une limite de débit. Toutes deux sont facturées par génération sur votre solde de crédits, si bien que la contrainte pratique est le coût plutôt qu’un plafond de requêtes. Estimez d’abord le prix d’une tâche avec POST /video/quote ou POST /audio/quote.

Gestion des erreurs

Les requêtes échouées (500, 503, 429) doivent être relancées avec un backoff exponentiel. Pour les erreurs 429 spécifiquement, consultez l’en-tête x-ratelimit-reset-requests pour l’horodatage Unix exact auquel vous pouvez réessayer. La plupart des bibliothèques HTTP disposent de mécanismes de relance intégrés qui gèrent cela automatiquement.

Budgets d’erreurs

Deux limites supplémentaires protègent l’API contre les clients qui relancent leurs requêtes en boucle contre un mur. Toutes deux sont comptées par modèle et par clé API sur une fenêtre glissante de 30 secondes, et toutes deux renvoient 429 : Le second budget compte les requêtes qui demandent à un modèle une fonctionnalité qu’il ne prend pas en charge, par exemple demander la vision ou l’appel d’outils à un modèle dépourvu de cette capacité. Le dépassement de l’un ou l’autre budget apparaît dans les journaux de limite de débit sous la forme FAILED_REQUESTS ou UNSUPPORTED_FEATURE_REQUESTS. Les deux renvoient un customMessage indiquant le seuil qui a été déclenché :
Ces réponses définissent x-ratelimit-remaining et x-ratelimit-resets au lieu des en-têtes par fenêtre ci-dessous.

En-têtes de réponse

Chaque réponse inclut ces en-têtes : L’endpoint /crypto/rpc/{network} utilise ses propres limites et ses propres en-têtes X-RateLimit-Limit, X-RateLimit-Remaining et X-RateLimit-Reset, qui ne sont définis que sur les réponses 429. Consultez Crypto RPC pour plus de détails.

Niveau Partenaire

Les limites partenaire sont indiquées à côté des limites par défaut dans les tableaux ci-dessus. Si vous atteignez constamment vos limites de débit et que vos modèles d’utilisation montrent une demande soutenue dans le temps, contactez-nous pour discuter de l’accès partenaire : api@venice.ai. Les limites du niveau partenaire peuvent être ajustées en fonction de vos besoins spécifiques.