2 posts
Posts marcados com benchmark
-
Quando o modelo não cabe: o custo real do offload para CPU
No post anterior estimei que jogar camadas para a CPU custa dez vezes o desempenho. Medi nas duas placas e errei: o mesmo modelo cai de 66 para 3,1 tokens por segundo. E nada no runtime avisa quando isso acontece.
-
Escrever o caso de borda sobe o acerto de 46% para 90%
360 gerações, três modelos locais, três formas do mesmo pedido. O salto grande está entre não escrever o caso de borda e escrever: 46% para 90%. A tabela em markdown, contra o mesmo texto corrido, não pagou o que eu esperava.