Rate limiting OpenAI: tier, quote e come gestirli
L'API OpenAI applica rate limit su richieste al minuto (RPM), token al minuto (TPM) e in alcuni casi al giorno (RPD/TPD). Conoscere il sistema dei tier e' essenziale per scalare in produzione.
Il sistema dei tier
OpenAI assegna tier automaticamente in base alla spesa cumulativa e all'eta dell'account:
- Free: trial limitato, pochi RPM
- Tier 1: dopo primo pagamento (5$), accesso a tutti i modelli base
- Tier 2: 50$ spesi + 7 giorni dal primo pagamento
- Tier 3: 100$ spesi + 7 giorni
- Tier 4: 250$ spesi + 14 giorni
- Tier 5: 1000$ spesi + 30 giorni
Ogni salto di tier raddoppia (o più) i limiti RPM/TPM.
Esempio limiti GPT-5 (orientativi)
- Tier 1: 500 RPM / 30.000 TPM
- Tier 3: 5.000 RPM / 800.000 TPM
- Tier 5: 10.000 RPM / 10M TPM
Cosa succede al superamento
L'API risponde con HTTP 429 Too Many Requests. Nel body trovi headers utili:
- x-ratelimit-remaining-requests
- x-ratelimit-remaining-tokens
- x-ratelimit-reset-requests
- retry-after: secondi da attendere
Strategie di gestione
- Exponential backoff: retry con attesa 1s, 2s, 4s, 8s, max 5 tentativi
- Token bucket locale: traccia chiamate e auto-throttla prima di sbattere su 429
- Coda asincrona: usa Redis/RabbitMQ + worker per smorzare picchi
- Fallback su modelli minori: se gpt-5 e' saturo, ripiega su gpt-5-mini
- Batch API: per workload non real-time, l'endpoint Batch ha quote separate e prezzi -50%
Monitoraggio
In platform.openai.com -> Usage vedi consumo per modello, ora, progetto. Imposta:
- Hard limit mensile (blocca chiamate al superamento)
- Soft limit con email alert
- Notifiche Slack via webhook custom
Quote vs Rate limit
Da non confondere:
- Rate limit: richieste al minuto (granulare)
- Quota: budget mensile in dollari
- Esauriti i dollari, le chiamate ricevono 429 anche se sotto rate limit
Richiesta upgrade tier manuale
Per progetti enterprise che hanno bisogno di scalare velocemente, OpenAI consente di richiedere upgrade tier dal supporto, allegando volume previsto e use case.
Hai bisogno di scalare un'integrazione AI in produzione? G Tech Group progetta architetture robuste con caching, code e fallback. Parliamone.