Hasta hace poco, dar a un agente la capacidad de operar una interfaz gráfica significaba construir tu propia integración de captura de pantalla y control de mouse. Google acaba de convertir eso en una función que ya viene incluida en el modelo.
Google lanzó Gemini 3.6 Flash el 21 de julio de 2026 como sucesor de Gemini 3.5 Flash y nuevo modelo "workhorse" por defecto de la familia Gemini, junto con Gemini 3.5 Flash-Lite y una variante especializada, Gemini 3.5 Flash Cyber, orientada específicamente a tareas de ciberseguridad — confirmado por la cobertura de 9to5Google y GCN del lanzamiento.
La novedad técnica más relevante es que Computer Use pasa de ser una herramienta experimental separada a una capacidad nativa disponible tanto en 3.6 Flash como en 3.5 Flash-Lite, expuesta como herramienta del lado del cliente vía la API de Gemini y Gemini Enterprise. Esto significa que un agente puede interactuar con interfaces de software —hacer clic, escribir, navegar— sin que el equipo de desarrollo tenga que construir la integración de captura de pantalla y control de acciones desde cero, el mismo tipo de trabajo de infraestructura que cubrimos al explicar Computer Use de Anthropic como herramienta separada.
Según cifras de Google confirmadas por AImadetools, las capacidades de uso de computadora suben de 78.4% a 83.0% en OSWorld-Verified, el benchmark estándar de la industria para evaluar qué tan bien un modelo controla software real. Es una mejora sustancial en un benchmark diseñado específicamente para ser difícil — no una cifra inflada por una métrica fácil.
Adicionalmente, 3.6 Flash reduce el consumo de tokens de salida en 17% frente a 3.5 Flash, lo cual, combinado con el precio ya competitivo de la línea Flash, hace que el costo efectivo por tarea de automatización baje de forma directa, no solo por precio de lista sino por eficiencia real de tokens consumidos.
Gemini 3.6 Flash acepta texto, imagen, video, audio y PDF como entrada, mantiene la ventana de contexto de 1 millón de tokens de la familia Gemini, y sube el límite de salida a 64,000 tokens. Su fecha de corte de conocimiento avanza a marzo de 2026, frente a enero de 2025 en la versión anterior — una actualización de casi catorce meses de conocimiento reciente, relevante para cualquier tarea donde el modelo necesite estar al tanto de frameworks, APIs o eventos posteriores a su entrenamiento sin depender por completo de RAG.
Para equipos que ya construyeron pipelines de automatización de escritorio con Computer Use de Anthropic o soluciones propias de captura de pantalla, la integración nativa de Google reduce directamente la superficie de código propio que hay que mantener — el modelo asume parte de la responsabilidad de orquestar la captura y la acción, no solo de interpretarlas. La recomendación práctica sigue siendo la misma que aplicamos a cualquier capacidad de Computer Use: aislar el entorno de ejecución (contenedor o VM dedicada), nunca cargar credenciales de producción de forma persistente, y evaluar primero si existe una API o un servidor MCP para el sistema objetivo antes de recurrir a control de interfaz gráfica como solución permanente.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel