2 posts
Posts etiquetados con llama.cpp
-
El MacBook Pro M4 tiene más RAM que la 5090 y sigo con CUDA
48 GB unificados en el M4 caben más que los 32 GB de la 5090. Aun así, vLLM, llama.cpp y diffusion siguen en NVIDIA, porque decode es banda y la stack que ya opero es CUDA.
-
Ejecuté el BitNet de Microsoft en dos CPUs: el 6x se encoge contra el Q4 que ya usas
Cloné el bitnet.cpp de Microsoft. El README promete 6,17x en CPU. En las dos máquinas de casa el 4,2x frente a f16 apareció; frente al Q4 que Ollama ya entrega, cae a 1,3x. Y el modelo viene con la activación equivocada.