El punto del off-by-one es clave: la IA no tiene noción de contexto semántico, solo estadística. Por eso, para tareas que requieren lógica secuencial o invariantes, es tan fiable como un junior que acaba de llegar. Yo he empezado a usar tests generados por IA para cubrir el 80% de casos, pero siempre reviso a mano los bordes. En mi equipo, hemos adoptado una política de 'pair programming inverso': la IA escribe el borrador, el senior refactoriza. Así la productividad sube, pero la calidad se mantiene porque el filtro humano está en la parte compleja. ¿Alguien ha probado a pedirle a la IA que genere tests antes que el código? A veces descubre edge cases que uno no preveía.