AMD anunció el 6 de agosto la adquisición de Taalas, una startup de Toronto que hace algo poco convencional: en lugar de correr un modelo sobre un chip de propósito general, graba los pesos de ese modelo directamente en el silicio. El resultado, según la compañía, es inferencia radicalmente más rápida y barata en energía — a costa de perder la flexibilidad de un chip genérico.
Taalas fue fundada en 2023 por exarquitectos de Tenstorrent y AMD, y hasta ahora había levantado 219 millones de dólares. Su enfoque es "hardwiring": en vez de cargar los pesos de un modelo en memoria y ejecutarlos sobre un procesador flexible como una GPU, los codifican directamente en el diseño del chip. Eso elimina buena parte del movimiento de datos entre memoria y cómputo que hoy es el cuello de botella dominante en inferencia a gran escala.
El chip actual de la compañía está diseñado específicamente para Llama 3.1 8B de Meta. Según reportes de la adquisición, alcanza cerca de 17,000 tokens por segundo por usuario, con un rack completo consumiendo entre 12 y 15 kW — frente a los 120-600 kW que requiere un rack de GPUs comparable para una carga similar. Es una diferencia de un orden de magnitud en consumo energético.
El acuerdo, con términos no revelados, se espera que cierre en el cuarto trimestre de 2026 sujeto a aprobación regulatoria. AMD planea integrar la tecnología de Taalas junto a sus GPUs Instinct, procesadores EPYC, la plataforma de rack Helios y el software ROCm, apuntando a productos a nivel de sistema en lugar de un chip aislado.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel