Ejecuto modelos de IA en hardware propio y publico los números.
Seis máquinas, de 12 a 96 GB: cuatro GPUs NVIDIA, Apple Silicon y memoria unificada. Lab
Publicaciones
-
Dibujos para colorear con IA local: desde el prompt hasta el archivo que imprime bien
Generar la imagen es la parte fácil, y es donde todos los tutoriales terminan. Lo que decide si el niño puede pintar es lo que sigue: binarizar, vectorizar e imprimir sin serrado.
-
Qwen3.6 27B: cuánta VRAM necesita realmente
Un modelo de 27B que gasta la mitad del KV cache de un Llama 3 8B. La arquitectura híbrida rompe el cálculo habitual — y decide, por menos de 1 GB, qué placas quedan fuera.
-
Cuánta VRAM ocupa realmente un LLM
La cuenta rápida — parámetros por bits — se equivoca por varios gigabytes, porque ignora la caché KV. Aquí está el cálculo completo, con la fórmula, los números y cómo verificarlo en tu propia GPU.
-
El PRD viene antes: la especificación que impide que el agente escriba código incorrecto
El modelo no comete errores por ignorancia: comete errores porque cerró solo la brecha que dejó el prompt, y la cerró de una manera plausible. ¿Qué cambia en el código cuando el contrato viene antes de la solicitud?