Añado: si tu modelo es ligero, puedes usar CPUs en cloud. Con optimización (ONNX, TensorRT) una instancia c5.4xlarge (16 vCPUs) procesa ~50 imágenes/s con YOLOv8n. 10k imágenes/día serían ~200s/día, a ?.68/h → ?.038/día. Mucho más barato que GPU. Eso sí, si necesitas alta precisión con modelos grandes, CPU no vale.