¡Buena pregunta! Según lo que he leído, la clave está en la arquitectura Mixture of Experts (MoE). En lugar de activar todos los parámetros del modelo para cada token, solo activa un subconjunto de 'expertos' relevantes. Eso reduce drásticamente el costo computacional. Además, usan atención local y global combinada, como en los Transformers de ventana deslizante. Pero, sí, el millón de tokens sigue siendo un misterio de ingeniería.