Supply chain security para modelos de IA: cómo un modelo descargado se convierte en malware

By Carlos Montiel | Especialista en IA Empresarial
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~4 minutos

Descargar un modelo de Hugging Face se siente como descargar un archivo de datos. Técnicamente, muchas veces es más parecido a ejecutar un programa que nunca revisaste.

El problema de raíz: pickle ejecuta código, no solo carga datos

El formato de serialización pickle de Python, el mecanismo de almacenamiento dominante para pesos de modelos de ML, permite ejecución de código arbitrario en el momento de la carga — una clase de vulnerabilidad que se ha explotado repetidamente en la práctica en Hugging Face desde al menos marzo de 2024. Los modelos de PyTorch y TensorFlow en la comunidad de Hugging Face sufren el riesgo más alto de ejecución de código malicioso, con cerca del 95% de los modelos maliciosos identificados construidos sobre PyTorch.

Un incidente real de 2026: de cero a 244,000 descargas en 18 horas

El 7 de mayo de 2026, apareció en Hugging Face un repositorio llamado "Open-OSS/privacy-filter" que en apenas 18 horas escaló hasta la posición #1 de tendencias, con más de 244,000 descargas y 667 likes — una ilustración de la velocidad con la que un modelo malicioso puede viralizarse antes de que alguien lo audite.

Cuando el propio framework de entrenamiento confía demasiado

InstructLab, un framework open source de entrenamiento de ML ampliamente usado, tenía hardcodeado `trust_remote_code=True` en su script de entrenamiento — lo que significa que un modelo malicioso especialmente diseñado y subido a Hugging Face podía lograr ejecución remota de código en cualquier usuario de InstructLab que lo cargara. No hacía falta ningún error del usuario final: el riesgo estaba en la configuración por defecto de la herramienta misma.

La escala del problema, en números

Según el Reporte de Seguridad de Cadena de Suministro de Software 2026 de JFrog, los paquetes maliciosos crecieron 451% año a año, con investigadores identificando más de 495 modelos de IA maliciosos en registros públicos. No es un puñado de casos aislados — es una categoría de ataque en crecimiento acelerado.

Cómo protegerse en la práctica

La mitigación más directa es preferir el formato safetensors sobre pickle cuando esté disponible — safetensors no permite ejecución de código arbitrario por diseño. Cuando pickle es inevitable, escanear los archivos con herramientas como picklescan, que detecta la mayoría de los backdoors comunes en archivos serializados. Y a nivel organizacional: tratar cada modelo descargado de un registro público, sin importar su popularidad o número de descargas, como código de terceros sin auditar hasta confirmar lo contrario — la popularidad de un repositorio no es una señal de seguridad, como demostró el caso de privacy-filter.

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com