8 posts
Posts marcados com LLM local
-
O MacBook Pro M4 tem mais RAM que a 5090 e eu continuo no CUDA
48 GB unificados no M4 cabem mais que 32 GB da 5090. Mesmo assim vLLM, llama.cpp e geração de imagem ficam na NVIDIA, porque decode é banda e a stack que eu já opero é CUDA.
-
Troquei o modelo local do OpenCode: o que acelerou e o que só parecia erro do modelo
Eu já programava com OpenCode e um Qwen rodando nesta placa. Troquei o 3.6 pelo 3.8. Vou te mostrar o que ficou mais rápido, o que acertou mais, e o dia em que eu achei que o modelo tinha piorado — e era configuração.
-
Rodei o BitNet da Microsoft em duas CPUs: o 6x some contra o que já está no disco
Eu clonei o bitnet.cpp da Microsoft. O README promete 6,17x em CPU. Nas duas máquinas da casa o 4,2x contra f16 apareceu; contra o Q4 que o Ollama já entrega, cai para 1,3x. E o modelo vem com a ativação errada.
-
Quando o modelo não cabe: o custo real do offload para CPU
No post anterior estimei que jogar camadas para a CPU custa dez vezes o desempenho. Medi nas duas placas e errei: o mesmo modelo cai de 66 para 3,1 tokens por segundo. E nada no runtime avisa quando isso acontece.
-
Trocar a 5060 Ti pela 5070 Ti dobra a banda e não muda o que cabe
As duas têm 16 GB. O mesmo modelo, a mesma quantização e o mesmo contexto cabem nas duas. O que dobra é a banda de memória, de 448 para 896 GB/s, e é ela que manda nos tokens por segundo.
-
Qwen3.6 27B: quanta VRAM ele precisa de verdade
Um modelo de 27B que gasta metade do KV cache de um Llama 3 8B. A arquitetura híbrida quebra a conta usual — e decide, por menos de 1 GB, quais placas ficam de fora.
-
Quanta VRAM um LLM realmente ocupa
A conta de cabeça — parâmetros vezes bits — erra por vários gigabytes, porque ignora o KV cache. Aqui está a conta completa, com a fórmula, os números e como conferir na sua GPU.
-
Escrever o caso de borda sobe o acerto de 46% para 90%
360 gerações, três modelos locais, três formas do mesmo pedido. O salto grande está entre não escrever o caso de borda e escrever: 46% para 90%. A tabela em markdown, contra o mesmo texto corrido, não pagou o que eu esperava.