Cuando alguien piensa en "correr IA en nuestra infraestructura", el reflejo casi automático es calcular cuánta RAM y GPU hay que comprar. Nosotros llegamos a una conclusión distinta trabajando en la infraestructura de guatemalia.com — y vale la pena compartirla.
Corremos Claude Code directo en nuestro VPS, dentro de una sesión persistente. Nos conectamos por SSH, trabajamos, cerramos la conexión, y al volver a entrar desde otro dispositivo la conversación sigue exactamente donde la dejamos — todo el contexto intacto, sin tener que reconstruirlo desde cero. Eso ya es valioso por sí solo. Pero lo que realmente cambió cómo pensamos la infraestructura fue notar **dónde** ocurre el trabajo pesado.
Nuestro servidor solo necesita mantener el contexto de la conversación: texto, referencias a archivos, resultados de comandos. Es información compacta — no requiere GPU ni grandes cantidades de RAM. El procesamiento real del modelo, la parte que consume cómputo serio, corre en la infraestructura de Anthropic, cubierta por la suscripción que ya pagamos ($20/mes, el plan Pro). En la práctica: usamos la nube de Claude como si fuera nuestro propio clúster de inferencia, sin tener que aprovisionarlo, escalarlo, ni mantenerlo nosotros.
El beneficio es doble. Primero, no hay que sobredimensionar el servidor pensando "por si usamos IA más intensivamente" — esa parte del trabajo nunca vive en nuestro hardware. Segundo, desaparece la fricción operativa clásica del ciclo de desarrollo asistido por IA: entrar a la terminal, pegar código, ejecutar, revisar, repetir. Con la sesión persistente accesible desde cualquier cliente, ese ciclo se acorta — no hay que "reabrir contexto" cada vez que cambiamos de dispositivo o de lugar de trabajo.
La pregunta correcta deja de ser "¿cuánto hardware necesitamos para hacer IA en nuestra infraestructura?" y pasa a ser "¿qué parte del trabajo realmente necesita vivir en nuestro servidor, y qué parte ya está resuelta por una nube que ya pagamos?". En nuestro caso, la respuesta fue clara: casi todo el peso se puede delegar. Eso deja más recursos locales disponibles para lo que sí importa — servir a nuestros usuarios y clientes.
Carlos Montiel es arquitecto de soluciones IA empresarial. Implementa LLMs, Agentes, RAG y orquestadores en empresas de Guatemala y Latinoamérica. Contáctalo para una consultoría.
Contactar a Carlos Montiel