El rate limiting con Ollama en local lo resuelvo con un wrapper que implementa token bucket: import time; from threading import Lock; class RateLimiter: def __init__(self, rate): self.rate = rate; self.tokens = rate; self.lock = Lock(); self.last = time.monotonic(). Antes de cada request, llamo a acquire(). Además, limito el contexto a 2048 tokens y uso num_predict=256 para respuestas cortas. Si te cuelga, prueba a reducir num_ctx en el modelo o usar OLLAMA_NUM_PARALLEL=1 en el entorno. ¿Alguien ha probado a cachear respuestas para queries repetitivas? Para tareas diarias como 'priorizar', el prompt es siempre el mismo, así que un LRU cache con TTL de 5 minutos me ahorra llamadas.