/api_keys/rate_limits ist die maßgebliche Quelle, um Ihre aktuellen Limits abzurufen. Sie können Ihre genauen Limits jederzeit prüfen:
Ihre Limits ansehen
Interaktiver Playground
Rate-Limit-Logs
Sehen Sie, welche Anfragen Limits erreicht haben
Standardlimits
Text- und Embedding-Modelle
Text- und Embedding-Modelle sind in vier Größen gruppiert. Jede Modellkarte auf der Models-Seite zeigt ihr Größen-Badge an. Alle Embedding-Modelle sind XS.Einige Modelle laufen auf dedizierter oder Drittanbieter-Infrastruktur und haben Limits, die sich nicht auf diese vier Größen abbilden lassen. Rufen Sie
GET /api_keys/rate_limits auf, um die verbindlichen Limits pro Modell für Ihren Key zu erhalten.Bild- und Audio-Modelle
Video- und Musik-Modelle
Video- und Musikgenerierung unterliegen keinen Rate-Limits. Beide werden pro Generierung über Ihr Guthaben abgerechnet, sodass in der Praxis die Kosten und nicht eine Anfrageobergrenze die Beschränkung darstellen. Kalkulieren Sie einen Auftrag zuerst mitPOST /video/quote oder POST /audio/quote.
Fehlerbehandlung
Fehlgeschlagene Anfragen (500, 503, 429) sollten mit exponentiellem Backoff wiederholt werden. Speziell bei 429-Fehlern prüfen Sie den Headerx-ratelimit-reset-requests für den genauen Unix-Zeitstempel, ab dem Sie es erneut versuchen können. Die meisten HTTP-Bibliotheken verfügen über integrierte Retry-Mechanismen, die dies automatisch übernehmen.
Fehlerbudgets
Zwei weitere Limits schützen die API vor Clients, die wiederholt gegen eine Wand laufen. Beide werden pro Modell und API-Key über ein rollierendes Fenster von 30 Sekunden gezählt, und beide geben429 zurück:
Das zweite Budget zählt Anfragen, die von einem Modell ein Feature verlangen, das es nicht unterstützt. Ein Beispiel ist die Anforderung von Vision oder Tool Calling bei einem Modell ohne diese Fähigkeit. Die Überschreitung eines der beiden Budgets erscheint in den Rate-Limit-Logs als
FAILED_REQUESTS oder UNSUPPORTED_FEATURE_REQUESTS.
Beide geben eine customMessage zurück, die den ausgelösten Schwellenwert benennt:
x-ratelimit-remaining und x-ratelimit-resets anstelle der unten aufgeführten fensterbezogenen Header.
Response-Header
Jede Antwort enthält diese Header:
Der Endpoint
/crypto/rpc/{network} verwendet eigene Limits und eigene Header (X-RateLimit-Limit, X-RateLimit-Remaining und X-RateLimit-Reset), die nur bei 429-Antworten gesetzt werden. Details finden Sie unter Crypto RPC.