Últimamente estoy dudando entre alquilar GPUs en la nube (RunPod, Vast.ai, Lambda) o montar mi propio servidor con varias RTX 4090 para inferencia y fine-tuning de LLMs locales (Mistral, Llama, etc.). Por un lado, la nube es flexible y no requiere inversión inicial, pero los costes recurrentes se acumulan. Por otro, el on-premise tiene un alto coste inicial, pero a largo plazo podría ser más barato. ¿Alguien ha hecho números reales? ¿Qué experiencia tenéis con el rendimiento y los cuellos de botella (PCIe, memoria, etc.) en setups locales?