Pular para o conteúdo
Fantástico Mundo de Jon
RSS

2 posts

Posts marcados com benchmark

Todas as tags

  1. Quando o modelo não cabe: o custo real do offload para CPU

    No post anterior estimei que jogar camadas para a CPU custa dez vezes o desempenho. Medi nas duas placas e errei: o mesmo modelo cai de 66 para 3,1 tokens por segundo. E nada no runtime avisa quando isso acontece.

  2. Medi se arquivo de spec faz o modelo acertar mais. Não faz.

    Em julho defendi que a spec estruturada muda o resultado. Medi em outubro: 360 gerações, 3 modelos locais, 3 formas do mesmo pedido. O que paga é a informação escrita, não o formato do arquivo.