No toda empresa necesita un equipo de data science para tener modelos predictivos en producción. AutoML automatiza la búsqueda de arquitectura y ajuste de hiperparámetros detrás de una interfaz declarativa.
AutoML en Vertex AI automatiza dos pasos que consumen la mayoría del tiempo de un data scientist: la búsqueda de arquitectura de modelo (neural architecture search) y el ajuste de hiperparámetros. El usuario aporta datos etiquetados y define el objetivo (clasificación, regresión, forecasting, detección de objetos); Vertex AI entrena, evalúa y selecciona automáticamente la mejor combinación dentro de un presupuesto de cómputo (node-hours) que tú defines.
Esto no elimina la necesidad de criterio: seguir necesitando decidir qué columnas son relevantes, cómo dividir train/test, y sobre todo, si el problema de negocio está bien planteado como problema de ML.
Vertex AI cubre cuatro dominios de datos con AutoML:
- **Tabular**: clasificación, regresión y forecasting sobre datos estructurados (CSV o tablas de BigQuery), incluyendo forecasting probabilístico con series de tiempo jerárquicas. - **Imagen**: clasificación de una o varias etiquetas, y detección de objetos con bounding boxes. - **Texto**: clasificación, extracción de entidades y análisis de sentimiento sobre corpus propios. - **Video**: clasificación de acción, detección de objetos por frame y reconocimiento de eventos temporales.
Cada dominio expone métricas de evaluación específicas (AUC-ROC, log loss, MAPE para forecasting) directamente en la consola, sin que el usuario tenga que calcularlas manualmente.
El `budget_milli_node_hours` es el parámetro que más impacta el costo final: más presupuesto significa más arquitecturas exploradas, con retornos decrecientes pasado cierto punto.
La pregunta no es "¿cuál es mejor?" sino "¿dónde está el techo de valor marginal?". AutoML gana cuando el dataset es de tamaño moderado (miles a cientos de miles de filas), el problema es estándar (churn, detección de fraude, forecasting de demanda) y no hay un equipo dedicado a iterar arquitecturas. Custom Training gana cuando el problema tiene restricciones de arquitectura específicas (un modelo de series de tiempo con componentes de dominio conocidos), cuando se necesita explicabilidad más profunda que la que ofrece Vertex Explainable AI, o cuando el volumen de datos justifica arquitecturas custom que superan a lo que AutoML explora.
En la práctica, muchos equipos usan AutoML como baseline rápido: si un modelo custom no supera significativamente al AutoML entrenado en un día, no vale la pena la inversión de ingeniería adicional.
Los modelos tabulares de AutoML incluyen atribución de features basada en Shapley values sin configuración adicional, mostrando qué variables influyeron más en cada predicción individual. Esto es relevante en sectores regulados (crédito, seguros) donde una decisión automatizada debe ser explicable ante un auditor o el cliente afectado.
Un modelo AutoML se despliega igual que cualquier otro modelo de Vertex AI: a un endpoint con autoescalado, o vía batch prediction para scoring masivo periódico. El costo tiene dos componentes separados: el entrenamiento (cobrado por node-hour una sola vez, o cada vez que reentrenas) y el serving (cobrado por hora de nodo activo en el endpoint, independientemente del volumen de tráfico). Para modelos con tráfico esporádico, batch prediction evita pagar por un endpoint activo 24/7.
AutoML elimina la necesidad de escribir arquitecturas de red neuronal, pero no elimina la necesidad de buena ingeniería de datos. Un dataset con fuga de información (data leakage), clases desbalanceadas sin tratar, o features mal definidas producirá un modelo con métricas excelentes en validación y comportamiento pobre en producción, independientemente de cuánto presupuesto de cómputo le asignes.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel