> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-de47a659.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Limites de taxa

> Limites de taxa da Venice API por tier, os cabeçalhos que expõem a capacidade e o tratamento de erros 429.

Os limites de taxa variam por modelo e tier. Os limites padrão abaixo são uma referência útil, mas o endpoint `/api_keys/rate_limits` da API é a forma canônica de buscar seus limites atuais. Você pode verificar seus limites exatos a qualquer momento:

<CardGroup cols={2}>
  <Card title="Veja seus limites" icon="gauge-high" href="/pt-BR/api-reference/endpoint/api_keys/rate_limits?playground=open">
    Playground interativo
  </Card>

  <Card title="Logs de limite de taxa" icon="clock-rotate-left" href="/pt-BR/api-reference/endpoint/api_keys/rate_limit_logs?playground=open">
    Veja quais requisições atingiram limites
  </Card>
</CardGroup>

```bash theme={null}
curl https://api.venice.ai/api/v1/api_keys/rate_limits \
  -H "Authorization: Bearer $VENICE_API_KEY"
```

## Limites padrão

### Modelos de texto e embedding

Os modelos de texto e embedding são agrupados em quatro tamanhos. Cada cartão de modelo na [página de modelos](/pt-BR/models/text) exibe seu badge de tamanho. Todo modelo de embedding é XS.

| Tamanho | Requisições/min | Tokens/min | Requisições/min (Partner) | Tokens/min (Partner) |
| :------ | --------------: | ---------: | ------------------------: | -------------------: |
| XS      |             500 |  5.000.000 |                       500 |           10.000.000 |
| S       |             150 |  3.000.000 |                       300 |            6.000.000 |
| M       |             100 |  2.000.000 |                       200 |            4.000.000 |
| L       |             100 |  2.000.000 |                       150 |            3.000.000 |

<Note>
  Alguns modelos rodam em infraestrutura dedicada ou de terceiros e têm limites que não correspondem a esses quatro tamanhos. Chame [`GET /api_keys/rate_limits`](/pt-BR/api-reference/endpoint/api_keys/rate_limits) para obter os limites autoritativos por modelo da sua chave.
</Note>

### Modelos de imagem e áudio

| Tipo                     | Requisições/min | Requisições/min (Partner) |
| :----------------------- | --------------: | ------------------------: |
| Imagem, upscale, inpaint |              20 |                        60 |
| Fala e transcrição       |              60 |                       120 |

### Modelos de vídeo e música

A geração de vídeo e música não tem limite de taxa. Ambas são cobradas por geração contra seu saldo de créditos, então a restrição prática é o custo, e não um teto de requisições. Calcule o preço de um job primeiro com [`POST /video/quote`](/pt-BR/api-reference/endpoint/video/quote) ou [`POST /audio/quote`](/pt-BR/api-reference/endpoint/audio/quote).

## Tratamento de erros

Requisições com falha (500, 503, 429) devem ser repetidas com backoff exponencial.

Para erros 429 especificamente, verifique o cabeçalho `x-ratelimit-reset-requests` para o timestamp Unix exato em que você pode tentar novamente. A maioria das bibliotecas HTTP tem mecanismos de retry integrados que tratam isso automaticamente.

### Orçamentos de erro

Dois limites adicionais protegem a API contra clientes que fazem retry contra uma parede. Ambos são contados por modelo e por chave de API em uma janela deslizante de 30 segundos, e ambos retornam `429`:

| Orçamento                              |      Limite | Aplica-se a                       |
| :------------------------------------- | ----------: | :-------------------------------- |
| Requisições com falha                  |  50 por 30s | Todos os endpoints                |
| Requisições de recursos não suportados | 200 por 30s | `/chat/completions`, `/responses` |

O segundo orçamento conta requisições que pedem a um modelo um recurso que ele não suporta. Por exemplo, solicitar visão ou chamada de ferramentas de um modelo sem essa capacidade. Exceder qualquer um dos orçamentos aparece nos [logs de limite de taxa](/pt-BR/api-reference/endpoint/api_keys/rate_limit_logs) como `FAILED_REQUESTS` ou `UNSUPPORTED_FEATURE_REQUESTS`.

Ambos retornam uma `customMessage` indicando o limite que foi acionado:

```
Too many failed attempts (> 50) resulting in a non-success status code. Please wait 30 seconds and try again. See https://docs.venice.ai/api-reference/rate-limiting for more information.
```

Essas respostas definem `x-ratelimit-remaining` e `x-ratelimit-resets` em vez dos cabeçalhos por janela abaixo.

## Cabeçalhos de resposta

Toda resposta inclui estes cabeçalhos:

| Cabeçalho                        | Descrição                                        |
| :------------------------------- | :----------------------------------------------- |
| `x-ratelimit-limit-requests`     | Máximo de requisições permitidas na janela atual |
| `x-ratelimit-remaining-requests` | Requisições restantes na janela atual            |
| `x-ratelimit-reset-requests`     | Timestamp Unix de quando a janela é redefinida   |
| `x-ratelimit-limit-tokens`       | Máximo de tokens permitidos por minuto           |
| `x-ratelimit-remaining-tokens`   | Tokens restantes no minuto atual                 |
| `x-ratelimit-reset-tokens`       | Segundos até o limite de tokens ser redefinido   |

O endpoint `/crypto/rpc/{network}` usa seus próprios limites e seus próprios cabeçalhos `X-RateLimit-Limit`, `X-RateLimit-Remaining` e `X-RateLimit-Reset`, que são definidos apenas em respostas 429. Consulte [Crypto RPC](/pt-BR/api-reference/endpoint/crypto/rpc) para detalhes.

## Tier Partner

Os limites Partner estão listados junto aos limites padrão nas tabelas acima.

Se você está atingindo seus limites de taxa consistentemente e seus padrões de uso mostram **demanda sustentada ao longo do tempo**, entre em contato para discutir acesso de parceiro: [api@venice.ai](mailto:api@venice.ai).

Os limites do tier Partner podem ser ajustados com base em suas necessidades específicas.
