4 posts
Posts marcados com LLM local
-
Quando o modelo não cabe: o custo real do offload para CPU
No post anterior estimei que jogar camadas para a CPU custa dez vezes o desempenho. Medi nas duas placas e errei: o mesmo modelo cai de 66 para 3,1 tokens por segundo. E nada no runtime avisa quando isso acontece.
-
Qwen3.6 27B: quanta VRAM ele precisa de verdade
Um modelo de 27B que gasta metade do KV cache de um Llama 3 8B. A arquitetura híbrida quebra a conta usual — e decide, por menos de 1 GB, quais placas ficam de fora.
-
Quanta VRAM um LLM realmente ocupa
A conta de cabeça — parâmetros vezes bits — erra por vários gigabytes, porque ignora o KV cache. Aqui está a conta completa, com a fórmula, os números e como conferir na sua GPU.
-
Medi se arquivo de spec faz o modelo acertar mais. Não faz.
Em julho defendi que a spec estruturada muda o resultado. Medi em outubro: 360 gerações, 3 modelos locais, 3 formas do mesmo pedido. O que paga é a informação escrita, não o formato do arquivo.