2 posts
Posts marcados com llama.cpp
-
O MacBook Pro M4 tem mais RAM que a 5090 e eu continuo no CUDA
48 GB unificados no M4 cabem mais que 32 GB da 5090. Mesmo assim vLLM, llama.cpp e geração de imagem ficam na NVIDIA, porque decode é banda e a stack que eu já opero é CUDA.
-
Rodei o BitNet da Microsoft em duas CPUs: o 6x some contra o que já está no disco
Eu clonei o bitnet.cpp da Microsoft. O README promete 6,17x em CPU. Nas duas máquinas da casa o 4,2x contra f16 apareceu; contra o Q4 que o Ollama já entrega, cai para 1,3x. E o modelo vem com a ativação errada.