Ejecuto modelos de IA en hardware propio y publico los números.
Seis máquinas, de 12 a 96 GB: cuatro GPUs NVIDIA, Apple Silicon y memoria unificada. Lab
Publicaciones
-
El MacBook Pro M4 tiene más RAM que la 5090 y sigo con CUDA
48 GB unificados en el M4 caben más que los 32 GB de la 5090. Aun así, vLLM, llama.cpp y diffusion siguen en NVIDIA, porque decode es banda y la stack que ya opero es CUDA.
-
Cambié el modelo local de OpenCode: lo que aceleró y lo que solo parecía un error
Ya programaba con OpenCode y un Qwen en esta placa. Cambié el 3.6 por el 3.8. Te muestro qué quedó más rápido, qué acertó más, y el día que pensé que el modelo había empeorado — era configuración.
-
Ejecuté el BitNet de Microsoft en dos CPUs: el 6x se encoge contra el Q4 que ya usas
Cloné el bitnet.cpp de Microsoft. El README promete 6,17x en CPU. En las dos máquinas de casa el 4,2x frente a f16 apareció; frente al Q4 que Ollama ya entrega, cae a 1,3x. Y el modelo viene con la activación equivocada.
-
Cuando el modelo no cabe: el coste real del offload a la CPU
En la publicación anterior estimé que mover capas a la CPU cuesta diez veces el rendimiento. Medí en las dos tarjetas y me equivoqué: el mismo modelo cae de 66 a 3,1 tokens por segundo. Y nada en el runtime avisa cuando esto sucede.
-
Cambiar la 5060 Ti por la 5070 Ti duplica el ancho de banda sin alterar la capacidad
Ambas tienen 16 GB. El mismo modelo, la misma cuantización y el mismo contexto caben en ambas. Lo que se duplica es el ancho de banda de memoria, de 448 a 896 GB/s, y es este el que determina los tokens por segundo.
-
Dibujos para colorear con IA local: desde el prompt hasta el archivo que imprime bien
Generar la imagen es la parte fácil, y es donde todos los tutoriales terminan. Lo que decide si el niño puede pintar es lo que sigue: binarizar, vectorizar e imprimir sin serrado.
-
Qwen3.6 27B: cuánta VRAM necesita realmente
Un modelo de 27B que consume la mitad del KV cache de un Llama 3 8B. La arquitectura híbrida rompe el cálculo habitual — y decide, por menos de 1 GB, qué tarjetas quedan fuera.
-
Cuánta VRAM ocupa realmente un LLM
La cuenta rápida — parámetros por bits — se equivoca por varios gigabytes, porque ignora la caché KV. Aquí está el cálculo completo, con la fórmula, los números y cómo verificarlo en tu propia GPU.