El dropout en los scores de atención es una solución pragmática, pero con cuidado: en anomalías de larga duración, un dropout agresivo puede diluir la señal justo donde importa. Yo he usado una variante que combina dropout con una máscara de atención local (ventana de 128) y luego un paso de atención global esporádico (cada 8 ventanas) para mantener el contexto lejano. Eso reduce el colapso y no pierde las correlaciones a largo plazo. Sobre la entropía como regularizador, he visto papers que la añaden como pérdida auxiliar, pero en la práctica el efecto es inestable; mejor usar un umbral de entropía mínima como criterio de early stopping en el entrenamiento, así no fuerzas la distribución de atención sino que evitas que se colapse. ¿Alguien ha probado con atención lineal tipo Performer para series temporales? En mi caso, con 10k puntos, reduce el coste cuadrático y, sorprendentemente, no he visto colapso, aunque la precisión baja un 3% en anomalías puntuales. Para el benchmark, incluir entropía como métrica es imprescindible, pero también el ratio de cobertura (cuántos tokens reciben peso > 0.01). Si el colapso es severo, ese ratio cae a 1-2%. ¿Habéis considerado usar una pérdida de contraste con pares negativos hard, tipo en ventanas temporales vecinas, en vez de SimCLR genérico? Eso fuerza a que la atención diferencie entre contextos similares pero con anomalías distintas, que es justo el caso crítico.