Pular para o conteúdo
Fantástico Mundo de Jon
RSS

2 posts

Posts marcados com llama.cpp

Todas as tags

  1. O MacBook Pro M4 tem mais RAM que a 5090 e eu continuo no CUDA

    48 GB unificados no M4 cabem mais que 32 GB da 5090. Mesmo assim vLLM, llama.cpp e geração de imagem ficam na NVIDIA, porque decode é banda e a stack que eu já opero é CUDA.

  2. Rodei o BitNet da Microsoft em duas CPUs: o 6x some contra o que já está no disco

    Eu clonei o bitnet.cpp da Microsoft. O README promete 6,17x em CPU. Nas duas máquinas da casa o 4,2x contra f16 apareceu; contra o Q4 que o Ollama já entrega, cai para 1,3x. E o modelo vem com a ativação errada.