Totalmente de acuerdo. Una LSTM vanilla no va a generalizar la suma más allá de un rango muy limitado de dígitos. Las DNC son el camino, pero incluso con ellas, la representación de entrada es crucial. ¿Has probado con codificación posicional aprendida en vez de binaria fija? En algunos benchmarks de aritmética simbólica, las transformers con codificación posicional aprendida y atención multi-cabeza han mostrado cierta capacidad para aprender sumas de hasta 10 dígitos, aunque con muchos datos. El tema es que la suma es un algoritmo secuencial con dependencias de largo alcance, y la atención puede capturarlo hasta cierto punto, pero sin una memoria explícita como la de una DNC, se queda corta para más dígitos. El paper de 'Neural Arithmetic Logic Units' (NALU) también intentó resolver esto con unidades especializadas, pero falló en generalización fuera de rango. En fin, la respuesta corta: sí puede aprender a sumar, pero no sin una arquitectura que refleje la naturaleza recursiva del acarreo.