Estamos teniendo un problema de latencia intermitente en un clúster Kubernetes (v1.28) con 10 nodos worker. Usamos almacenamiento persistente con NVMe sobre TCP (NVMe-oF) para las bases de datos (PostgreSQL, MySQL). El rendimiento normal es < 100μs, pero cada 15-20 minutos vemos picos de latencia de 500ms a 2 segundos que duran unos segundos. Esto degrada las consultas y causa timeouts.
Ya revisamos:
- CPU, memoria, I/O de disco en los nodos: sin picos.
- Red física: sin pérdida de paquetes ni errores.
- Logs de kubelet y kernel: nada relevante.
- Ajustamos parámetros del kernel (net.core.rmem_max, etc.) sin mejora.
El tráfico de NVMe-oF usa una VLAN dedicada. ¿Alguien ha visto algo similar? ¿Podría ser el scheduler de Kubernetes o un tema de QoS en la red?