Llevo dos semanas debugando un agente PPO para navegación 3D. El training converge a una política subóptima que ignora la recompensa escasa. He probado con GAE, clipping, y normalización de ventajas. El reward promedio se estanca en 15.3 ± 0.2. Al revisar los gradientes, noto que la entropía cae a 0.01 en 20k steps. ¿Alguna idea de por qué la exploración muere tan rápido? Sospecho que es un problema de reward shaping mal calibrado, pero no logro aislarlo.