Construir un pipeline de RAG desde cero implica resolver chunking, embeddings, ranking híbrido y grounding por separado. Vertex AI Search empaqueta esa complejidad como un servicio administrado.
Vertex AI Search (heredero de lo que Google llamó Enterprise Search y Gen App Builder) es un servicio administrado de retrieval-augmented generation: indexa documentos propios de la empresa —PDFs, HTML, datos estructurados en BigQuery, registros FHIR de salud— y expone tanto una API de búsqueda semántica como una API de respuesta generada con citas, sin que el equipo tenga que operar una base vectorial, un pipeline de chunking o un re-ranker por separado.
La diferencia frente a construir RAG manualmente con Vertex AI Vector Search más Gemini es el nivel de abstracción: Vertex AI Search decide el chunking, el embedding, el índice y el ranking híbrido (semántico + léxico) internamente. Se sacrifica algo de control fino a cambio de tiempo de implementación medido en días, no meses.
Todo en Vertex AI Search gira en torno al concepto de data store: una colección de documentos con un tipo definido (no estructurado, estructurado, sitio web, o salud/FHIR). Un data store se puede alimentar desde Cloud Storage, BigQuery, o mediante conectores preconstruidos a Jira, Confluence, SharePoint y Salesforce, entre otros.
Vertex AI Search combina búsqueda semántica (por embeddings) con búsqueda léxica tradicional (BM25-like) en un solo ranking, lo que mejora resultados en dominios con jerga técnica o códigos de producto exactos que el embedding puro tiende a diluir. La API de "answer" genera una respuesta en lenguaje natural sobre los documentos recuperados, incluyendo referencias explícitas a los fragmentos fuente, lo que permite a un usuario verificar la respuesta contra el documento original con un clic.
Un patrón muy común es usar un data store de Vertex AI Search como fuente de grounding para un agente construido en Agent Builder o una llamada directa a Gemini: en lugar de que el modelo responda de memoria, la consulta primero recupera los pasajes relevantes del data store y los inyecta como contexto verificado antes de generar la respuesta final. Esto reduce alucinaciones de forma medible en preguntas sobre políticas internas, catálogos de producto o documentación técnica propia.
Cuando la organización tiene múltiples data stores (uno de documentación de producto, otro de tickets de soporte resueltos, otro de contratos), Vertex AI Search permite configurar una app de búsqueda que consulta varios data stores simultáneamente y combina (blend) los resultados en un solo ranking, útil para asistentes internos que necesitan responder preguntas que cruzan dominios.
Si el caso de uso requiere control total sobre la estrategia de chunking (por ejemplo, chunks que respetan estructura de tablas financieras complejas), un algoritmo de re-ranking propio, o un índice vectorial compartido entre múltiples productos con requisitos de latencia sub-10ms, construir sobre Vertex AI Vector Search directamente da más margen de ajuste. Vertex AI Search rinde mejor cuando la prioridad es velocidad de implementación y mantenimiento mínimo sobre control granular del pipeline.
Vertex AI Search cobra por volumen de documentos indexados y por número de consultas (queries), con un componente adicional si se usa la generación de respuestas con Gemini incluida. Para catálogos grandes (cientos de miles de documentos) con tráfico de consulta bajo, vale la pena modelar el costo de indexación por separado del costo de consulta antes de comprometerse, ya que ambos escalan de forma independiente.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel