Saltar al contenido
Fantástico Mundo de Jon
RSS

Ejecuto modelos de IA en hardware propio y publico los números.

Seis máquinas, de 12 a 96 GB: cuatro GPUs NVIDIA, Apple Silicon y memoria unificada. Lab

Publicaciones

  1. El MacBook Pro M4 tiene más RAM que la 5090 y sigo con CUDA

    48 GB unificados en el M4 caben más que los 32 GB de la 5090. Aun así, vLLM, llama.cpp y diffusion siguen en NVIDIA, porque decode es banda y la stack que ya opero es CUDA.

  2. Cambié el modelo local de OpenCode: lo que aceleró y lo que solo parecía un error

    Ya programaba con OpenCode y un Qwen en esta placa. Cambié el 3.6 por el 3.8. Te muestro qué quedó más rápido, qué acertó más, y el día que pensé que el modelo había empeorado — era configuración.

  3. Ejecuté el BitNet de Microsoft en dos CPUs: el 6x se encoge contra el Q4 que ya usas

    Cloné el bitnet.cpp de Microsoft. El README promete 6,17x en CPU. En las dos máquinas de casa el 4,2x frente a f16 apareció; frente al Q4 que Ollama ya entrega, cae a 1,3x. Y el modelo viene con la activación equivocada.

  4. Cuando el modelo no cabe: el coste real del offload a la CPU

    En la publicación anterior estimé que mover capas a la CPU cuesta diez veces el rendimiento. Medí en las dos tarjetas y me equivoqué: el mismo modelo cae de 66 a 3,1 tokens por segundo. Y nada en el runtime avisa cuando esto sucede.

  5. Cambiar la 5060 Ti por la 5070 Ti duplica el ancho de banda sin alterar la capacidad

    Ambas tienen 16 GB. El mismo modelo, la misma cuantización y el mismo contexto caben en ambas. Lo que se duplica es el ancho de banda de memoria, de 448 a 896 GB/s, y es este el que determina los tokens por segundo.

  6. Dibujos para colorear con IA local: desde el prompt hasta el archivo que imprime bien

    Generar la imagen es la parte fácil, y es donde todos los tutoriales terminan. Lo que decide si el niño puede pintar es lo que sigue: binarizar, vectorizar e imprimir sin serrado.

  7. Qwen3.6 27B: cuánta VRAM necesita realmente

    Un modelo de 27B que consume la mitad del KV cache de un Llama 3 8B. La arquitectura híbrida rompe el cálculo habitual — y decide, por menos de 1 GB, qué tarjetas quedan fuera.

  8. Cuánta VRAM ocupa realmente un LLM

    La cuenta rápida — parámetros por bits — se equivoca por varios gigabytes, porque ignora la caché KV. Aquí está el cálculo completo, con la fórmula, los números y cómo verificarlo en tu propia GPU.

Ver todos los posts