Azure AI Search: RAG empresarial con la infraestructura de Microsoft

By Carlos Montiel | Especialista en IA Empresarial
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~4 minutos

El componente que más determina si un sistema RAG funciona bien no es el modelo de lenguaje, es el motor de recuperación. Azure AI Search es la pieza que Microsoft diseñó específicamente para ese trabajo.

Búsqueda híbrida: BM25, vectores y fusión RRF

Azure AI Search ejecuta simultáneamente una búsqueda léxica tradicional (BM25, buena para coincidencias exactas de términos, códigos o nombres propios) y una búsqueda vectorial sobre embeddings (buena para similitud semántica), y fusiona ambos rankings con Reciprocal Rank Fusion. En la práctica, la búsqueda puramente vectorial falla en consultas con términos exactos como números de póliza o códigos de producto; la búsqueda híbrida es la configuración recomendada por defecto para RAG empresarial, no una opción avanzada.

Semantic ranker: reordenamiento con modelos de lenguaje

Sobre los primeros resultados de la búsqueda híbrida, el semantic ranker aplica un modelo de re-ranking entrenado por Microsoft que reordena por relevancia semántica real a la consulta, y puede generar captions y respuestas extractivas directamente. Esto mejora notablemente la precisión en los primeros 3-5 resultados, que son los que típicamente se inyectan como contexto al LLM, y reduce el riesgo de que un documento poco relevante pero con buen score léxico contamine el prompt.

Integrated vectorization: pipelines de embeddings sin código externo

Integrated vectorization permite que el propio indexer llame a un modelo de embeddings (de Azure OpenAI o de otro proveedor conectado) durante la ingesta y en tiempo de consulta, sin que el equipo tenga que mantener un servicio externo para generar vectores. Esto simplifica notablemente la arquitectura: antes era necesario un pipeline separado (Azure Function o similar) solo para vectorizar contenido nuevo antes de indexarlo.

Indexers y skillsets: de blob storage a un índice consultable

Un indexer conecta una fuente de datos (Blob Storage, Azure SQL, Cosmos DB) al índice, y un skillset aplica una cadena de habilidades cognitivas sobre cada documento durante la ingesta: OCR para PDFs escaneados, extracción de entidades, detección de idioma, y skills personalizados vía Azure Functions para lógica propia de negocio. Todo esto corre automáticamente en cada ejecución programada del indexer, sin intervención manual.

Seguridad a nivel de documento: filtros de seguridad y ACLs

Un problema crítico en RAG empresarial es evitar que un usuario reciba, vía el LLM, información de un documento al que no tendría acceso directo. Azure AI Search resuelve esto con filtros de seguridad a nivel de documento (usando claims de grupo de Microsoft Entra ID como metadata filtrable) o integrando permisos nativos de la fuente de datos, de forma que el filtro se aplica en la consulta misma, antes de que el documento llegue al contexto del modelo.

{ "search": "cláusula de terminación anticipada", "vectorQueries": [{ "kind": "text", "text": "cláusula de terminación anticipada", "fields": "contentVector" }], "filter": "groupIds/any(g: search.in(g, 'grupo-legal, grupo-finanzas'))", "queryType": "semantic", "semanticConfiguration": "config-contratos" }

Chunking y estrategias de fragmentación para mejores respuestas

La calidad de un RAG depende directamente de cómo se fragmenta el documento antes de vectorizar. Azure AI Search soporta chunking por tamaño fijo con overlap, y chunking basado en la estructura del documento (por sección, por página) a través de las skills de layout. Documentos legales y contratos, por ejemplo, responden mejor a chunking por cláusula o sección que a cortes de tamaño fijo, porque preserva el contexto semántico completo de cada fragmento.

Arquitectura RAG de referencia con Azure OpenAI

El patrón de referencia de Microsoft combina Azure AI Search para recuperación, Azure OpenAI para generación, y opcionalmente AI Foundry Agent Service o Semantic Kernel como capa de orquestación cuando la respuesta requiere múltiples pasos de búsqueda o combinar resultados de más de un índice. Este patrón está disponible como acelerador de referencia (RAG accelerator) en el repositorio oficial de Microsoft, lo cual reduce semanas de trabajo de arquitectura inicial.

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com