No hace falta entrar a tu infraestructura para robarte el modelo — alcanza con hacerle suficientes preguntas a tu API y anotar las respuestas. Ese es, en esencia, un ataque de extracción de modelo.
En un ataque de extracción de modelo, un adversario con acceso de consulta a un modelo de ML le roba su funcionalidad subyacente consultándolo sistemáticamente y usando esas respuestas para construir un modelo réplica que imita el comportamiento del original. Los atacantes pueden replicar el comportamiento del modelo mediante consultas sistemáticas, robar lógica especializada vía destilación, o reconstruir información sensible mediante inversión o abuso del sistema de RAG.
El scraping — el vector primario para extracción de modelos — alcanzó una tasa mediana cercana al 20% del tráfico global en 2025-2026, prácticamente duplicándose desde 2022, con volúmenes creciendo 47% año a año y 138% desde 2022. No es un riesgo marginal — es una fracción significativa y creciente de todo el tráfico que llega a una API de IA expuesta.
Los adversarios modernos distribuyen sus consultas entre IPs distribuidas, cuentas comprometidas, y ventanas de uso que parecen normales, en vez de disparar límites de rate obvios de un solo origen — la defensa clásica de "bloquear IPs con demasiadas consultas por minuto" es cada vez menos efectiva contra un atacante que se toma su tiempo y distribuye la carga.
En mayo de 2026 se divulgaron vulnerabilidades relacionadas con la posibilidad de intercambiar trazas de razonamiento entre modelos — con proveedores confirmando recepción de los reportes pero sin reconocer todavía las implicaciones de seguridad completas. Es un vector relativamente nuevo: no solo se puede robar el output final de un modelo, sino potencialmente el "cómo llegó ahí" en modelos que exponen su cadena de razonamiento.
Las mitigaciones prácticas incluyen limitar la granularidad de la información que devuelve cada respuesta (evitar exponer probabilidades o logits completos si no es necesario), monitorear patrones de consulta anómalos a nivel de cuenta más que de IP individual, y para modelos verdaderamente propietarios de alto valor, considerar honeypots de conocimiento — respuestas trampa diseñadas para detectar y identificar a quien está intentando extraer el modelo de forma sistemática.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel