Cuando RAG necesita escalar a cientos de millones de vectores con latencia de milisegundos, la base vectorial deja de ser un detalle de implementación y se vuelve la pieza crítica de la arquitectura.
Vertex AI Vector Search (el sucesor directo de lo que Google llamaba Matching Engine) es el servicio administrado de búsqueda por similitud de vectores de Google Cloud. Está construido sobre ScaNN (Scalable Nearest Neighbors), el algoritmo de búsqueda aproximada de vecinos más cercanos desarrollado internamente por Google Research, el mismo linaje algorítmico que sostiene búsqueda a escala en productos como Google Search y YouTube.
La propuesta central es servir consultas de similitud sobre índices de cientos de millones o miles de millones de vectores con latencia de un dígito de milisegundos, algo que bases vectoriales de propósito general empiezan a tener dificultad para sostener sin tuning considerable a ese volumen.
El flujo típico empieza generando embeddings con el modelo `text-embedding-005` o `multimodalembedding` (para contenido mixto texto-imagen) de Vertex AI, y luego creando un índice sobre esos vectores.
Vertex AI Vector Search ofrece dos estrategias de índice. El índice Tree-AH (basado en ScaNN) usa cuantización y estructuras de árbol para aproximar la búsqueda de vecinos más cercanos con un trade-off configurable entre precisión y velocidad, adecuado para producción a gran escala. El índice brute-force calcula la distancia exacta contra todos los vectores, útil como baseline para medir el recall real que se está sacrificando con la aproximación de Tree-AH, o para catálogos pequeños donde la exactitud pesa más que la latencia.
A diferencia de un índice que solo se reconstruye por lotes, Vertex AI Vector Search soporta actualizaciones en streaming: insertar, actualizar o eliminar vectores individuales sin reconstruir el índice completo, con los cambios reflejándose en las consultas en cuestión de segundos. Esto es crítico para catálogos de e-commerce con inventario cambiante o sistemas de recomendación con contenido nuevo publicado continuamente, donde reconstruir el índice completo cada vez sería inviable operativamente.
Además de la similitud vectorial pura, Vector Search soporta filtrado por metadatos numéricos y categóricos en la misma consulta —por ejemplo, "los 10 productos más similares dentro de la categoría X y con precio menor a Y"— sin necesidad de post-procesar los resultados fuera del índice, y namespaces con restricciones de tipo "allow/deny" para implementar control de acceso a nivel de documento dentro del mismo índice compartido.
La pregunta frecuente es cuándo construir RAG directamente sobre Vector Search en lugar de usar Vertex AI Search. Vector Search da control total: eliges tu estrategia de chunking, tu modelo de embeddings, tu lógica de re-ranking y tu esquema de metadatos de filtrado. Esa flexibilidad tiene costo de implementación y mantenimiento. Vertex AI Search abstrae todo eso a cambio de menos control. La regla práctica: si el equipo ya tiene experiencia operando infraestructura de búsqueda y el caso de uso tiene requisitos particulares de chunking o filtrado, Vector Search directo. Si la prioridad es time-to-market, Vertex AI Search.
Vertex AI Vector Search cobra por los nodos de cómputo que sirven el índice desplegado (por hora, según tipo de máquina) más un costo asociado al almacenamiento del índice, independiente del volumen de consultas. Esto significa que, a diferencia de un modelo pay-per-query, el costo es predecible pero fijo: dimensionar correctamente el tipo de máquina y el número de réplicas del índice según el volumen real de consultas esperado evita tanto sobre-aprovisionamiento como cuellos de botella de latencia en picos de tráfico.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel