Pular para o conteúdo
Fantástico Mundo de Jon
RSS

8 posts

Posts marcados com LLM local

Todas as tags

  1. O MacBook Pro M4 tem mais RAM que a 5090 e eu continuo no CUDA

    48 GB unificados no M4 cabem mais que 32 GB da 5090. Mesmo assim vLLM, llama.cpp e geração de imagem ficam na NVIDIA, porque decode é banda e a stack que eu já opero é CUDA.

  2. Troquei o modelo local do OpenCode: o que acelerou e o que só parecia erro do modelo

    Eu já programava com OpenCode e um Qwen rodando nesta placa. Troquei o 3.6 pelo 3.8. Vou te mostrar o que ficou mais rápido, o que acertou mais, e o dia em que eu achei que o modelo tinha piorado — e era configuração.

  3. Rodei o BitNet da Microsoft em duas CPUs: o 6x some contra o que já está no disco

    Eu clonei o bitnet.cpp da Microsoft. O README promete 6,17x em CPU. Nas duas máquinas da casa o 4,2x contra f16 apareceu; contra o Q4 que o Ollama já entrega, cai para 1,3x. E o modelo vem com a ativação errada.

  4. Quando o modelo não cabe: o custo real do offload para CPU

    No post anterior estimei que jogar camadas para a CPU custa dez vezes o desempenho. Medi nas duas placas e errei: o mesmo modelo cai de 66 para 3,1 tokens por segundo. E nada no runtime avisa quando isso acontece.

  5. Trocar a 5060 Ti pela 5070 Ti dobra a banda e não muda o que cabe

    As duas têm 16 GB. O mesmo modelo, a mesma quantização e o mesmo contexto cabem nas duas. O que dobra é a banda de memória, de 448 para 896 GB/s, e é ela que manda nos tokens por segundo.

  6. Qwen3.6 27B: quanta VRAM ele precisa de verdade

    Um modelo de 27B que gasta metade do KV cache de um Llama 3 8B. A arquitetura híbrida quebra a conta usual — e decide, por menos de 1 GB, quais placas ficam de fora.

  7. Quanta VRAM um LLM realmente ocupa

    A conta de cabeça — parâmetros vezes bits — erra por vários gigabytes, porque ignora o KV cache. Aqui está a conta completa, com a fórmula, os números e como conferir na sua GPU.

  8. Escrever o caso de borda sobe o acerto de 46% para 90%

    360 gerações, três modelos locais, três formas do mesmo pedido. O salto grande está entre não escrever o caso de borda e escrever: 46% para 90%. A tabela em markdown, contra o mesmo texto corrido, não pagou o que eu esperava.