AI Foundry Agent Service: orquestación de agentes en Azure

By Carlos Montiel | Especialista en IA Empresarial
Publicado: 2026-07-28 | Por: Carlos Montiel | Lectura: ~4 minutos

Construir un agente no es solo llamar a un LLM en bucle: es gestionar estado conversacional, herramientas, memoria y, cada vez más, otros agentes. AI Foundry Agent Service administra esa complejidad para que el equipo se enfoque en la lógica de negocio.

Del patrón Assistants API al Agent Service administrado

AI Foundry Agent Service (antes Azure AI Agent Service) toma el modelo conceptual de la Assistants API de OpenAI —threads persistentes, ejecuciones asíncronas, herramientas invocables por el modelo— y lo convierte en un servicio administrado dentro de Azure, con la diferencia clave de que el estado, los archivos y las conexiones a datos viven dentro del perímetro de seguridad del cliente, no en un almacenamiento genérico de terceros.

Threads, runs y mensajes: el modelo de ejecución

Un agente se define una vez (modelo, instrucciones, herramientas) y luego se reutiliza a través de threads, cada uno representando una conversación independiente con su propio historial. Al enviar un mensaje se dispara un run: el servicio decide si el modelo responde directamente o invoca una o más herramientas, ejecuta esas llamadas, y continúa el ciclo hasta producir una respuesta final. Este modelo separa limpiamente la definición del agente de sus instancias de conversación, lo que simplifica escalar el mismo agente a miles de usuarios concurrentes.

from azure.ai.projects import AIProjectClient from azure.identity import DefaultAzureCredential client = AIProjectClient(endpoint=ENDPOINT, credential=DefaultAzureCredential()) agent = client.agents.create_agent( model="gpt-4o", name="agente-facturacion", instructions="Responde preguntas sobre facturas usando el índice de búsqueda.", tools=[{"type": "azure_ai_search"}], ) thread = client.agents.create_thread() client.agents.create_message(thread.id, role="user", content="¿Cuál es el estado de la factura 4521?") run = client.agents.create_and_process_run(thread_id=thread.id, agent_id=agent.id)

Herramientas nativas: code interpreter, file search, Bing grounding, OpenAPI

El servicio incluye herramientas listas para usar: code interpreter (ejecuta Python en un sandbox aislado para cálculos o análisis de datos), file search (indexación y recuperación automática sobre archivos subidos), Bing grounding (respuestas fundamentadas en resultados de búsqueda web actuales), la herramienta de Azure AI Search para RAG sobre índices propios, y soporte para herramientas OpenAPI y Azure Functions que permiten invocar cualquier API interna documentada con una especificación estándar, sin escribir código de integración a mano.

Connected Agents: orquestación multiagente sin escribir un orquestador

Connected Agents permite que un agente principal delegue subtareas a agentes especializados —uno para búsqueda documental, otro para cálculos financieros, otro para redacción— registrándolos como herramientas del agente orquestador. El servicio administra el enrutamiento de la conversación entre agentes, evitando que el equipo tenga que implementar a mano una máquina de estados de orquestación multiagente.

Setup básico vs estándar: BYO VNet, Storage, Search y Cosmos DB

Existen dos modos de aprovisionamiento. El setup básico usa recursos administrados por Microsoft para almacenamiento de threads y archivos, ideal para prototipado rápido. El setup estándar (bring-your-own) conecta el agente a una cuenta de Storage, un servicio de Azure AI Search y una cuenta de Cosmos DB propios del cliente, dentro de su VNet, lo cual es obligatorio en cargas de trabajo reguladas donde los datos de conversación no pueden residir en infraestructura compartida gestionada solo por Microsoft.

Integración con Semantic Kernel y AutoGen

Para escenarios que exceden lo que Connected Agents resuelve nativamente —flujos de aprobación complejos, agentes que corren en runtimes distintos, lógica de negocio pesada en el orquestador— Semantic Kernel Agent Framework y AutoGen se integran directamente con agentes creados en AI Foundry, permitiendo tratar a un agente del servicio como un participante más dentro de una orquestación multiagente construida en código.

Observabilidad y control de costos en producción

Cada run queda trazado con OpenTelemetry, visible en Application Insights: tokens consumidos, herramientas invocadas, latencia por paso. Esto es indispensable para detectar agentes que entran en bucles de llamadas a herramientas (un problema común y costoso en producción) y para atribuir costo de tokens por agente y por cliente cuando el mismo servicio atiende a múltiples líneas de negocio.

Carlos Montiel
Arquitecto de Soluciones IA Empresarial
Especialista en LLMs, Agentes y Orquestación
guatemalia.com/#contacto · info@guatemalia.com

¿Necesitas implementar IA en tu empresa?

Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.

Contactar a Carlos Montiel

info@guatemalia.com