Hace un par de días salió un paper (y un repo en GitHub) que demuestra cómo, con acceso limitado al dataset de entrenamiento, se puede inyectar un backdoor en modelos de visión por computadora. El ataque es sutil: modifica solo el 0.1% de las imágenes, pero el modelo clasifica mal ejemplos específicos cuando se activa un patrón (un pequeño parche en la esquina).
Lo preocupante es que muchos proyectos usan datasets públicos (ImageNet subsets, etc.) y confían en su integridad. Si esto escala a modelos de lenguaje o agentes, el riesgo es enorme.
¿Han revisado sus pipelines de data curation? ¿Algún equipo está implementando detección de outliers o firmas de datos? Comparto un snippet rápido que usé para verificar checksums de imágenes, aunque es solo una capa básica:
import hashlib
def verify_dataset_integrity(file_paths, expected_hashes):
for fpath, expected in zip(file_paths, expected_hashes):
with open(fpath, 'rb') as f:
file_hash = hashlib.sha256(f.read()).hexdigest()
if file_hash != expected:
return False, fpath
return True, None