Pular para o conteúdo
Fantástico Mundo de Jon
RSS

Todos os posts

  1. O MacBook Pro M4 tem mais RAM que a 5090 e eu continuo no CUDA

    48 GB unificados no M4 cabem mais que 32 GB da 5090. Mesmo assim vLLM, llama.cpp e geração de imagem ficam na NVIDIA, porque decode é banda e a stack que eu já opero é CUDA.

  2. Troquei o modelo local do OpenCode: o que acelerou e o que só parecia erro do modelo

    Eu já programava com OpenCode e um Qwen rodando nesta placa. Troquei o 3.6 pelo 3.8. Vou te mostrar o que ficou mais rápido, o que acertou mais, e o dia em que eu achei que o modelo tinha piorado — e era configuração.

  3. Rodei o BitNet da Microsoft em duas CPUs: o 6x some contra o que já está no disco

    Eu clonei o bitnet.cpp da Microsoft. O README promete 6,17x em CPU. Nas duas máquinas da casa o 4,2x contra f16 apareceu; contra o Q4 que o Ollama já entrega, cai para 1,3x. E o modelo vem com a ativação errada.

  4. Quando o modelo não cabe: o custo real do offload para CPU

    No post anterior estimei que jogar camadas para a CPU custa dez vezes o desempenho. Medi nas duas placas e errei: o mesmo modelo cai de 66 para 3,1 tokens por segundo. E nada no runtime avisa quando isso acontece.

  5. Trocar a 5060 Ti pela 5070 Ti dobra a banda e não muda o que cabe

    As duas têm 16 GB. O mesmo modelo, a mesma quantização e o mesmo contexto cabem nas duas. O que dobra é a banda de memória, de 448 para 896 GB/s, e é ela que manda nos tokens por segundo.

  6. Desenhos para colorir com IA local: do prompt ao arquivo que imprime bem

    Gerar a imagem é a parte fácil, e é onde todo tutorial para. O que decide se a criança consegue pintar é o que vem depois: binarizar, vetorizar e imprimir sem serrilhado.

  7. Qwen3.6 27B: quanta VRAM ele precisa de verdade

    Um modelo de 27B que gasta metade do KV cache de um Llama 3 8B. A arquitetura híbrida quebra a conta usual — e decide, por menos de 1 GB, quais placas ficam de fora.

  8. Quanta VRAM um LLM realmente ocupa

    A conta de cabeça — parâmetros vezes bits — erra por vários gigabytes, porque ignora o KV cache. Aqui está a conta completa, com a fórmula, os números e como conferir na sua GPU.

  9. Escrever o caso de borda sobe o acerto de 46% para 90%

    360 gerações, três modelos locais, três formas do mesmo pedido. O salto grande está entre não escrever o caso de borda e escrever: 46% para 90%. A tabela em markdown, contra o mesmo texto corrido, não pagou o que eu esperava.

  10. O PRD vem antes: a spec que impede o agente de escrever o código errado

    O modelo não erra por burrice: erra porque fechou sozinho a lacuna que o prompt deixou, e fechou de um jeito plausível. O que muda no código quando o contrato vem antes do pedido.

  11. Dissecando o Modelfile do Qwen3 para ele parar de pensar em voz alta no OpenCode

    O Qwen3 alterna entre pensar e responder direto, e um agente esperando um diff não quer o raciocínio. Disseco o Modelfile parâmetro por parâmetro, gravo um derivado sem pensamento e ligo no OpenCode pelo provedor local novo.

  12. Quanto custa programar com ChatGPT: os $20 do Plus contra a API

    A escolha entre assinatura e API erra nas duas direções, e pelo mesmo motivo: no chat cada mensagem reenvia a conversa inteira. O gasto não cresce com o número de perguntas, cresce com o quadrado dele.

  13. O Tailwind 4 saiu hoje com menos framework entre mim e o CSS

    O motor foi reescrito, a configuração saiu do JavaScript e entrou no CSS, e cascade layers, container queries e OKLCH viraram parte da caixa. Os números de build são do anúncio oficial; o ganho que interessa é outro.

  14. Um site do zero pelo chat: o HTML sai pronto, o CSS não

    Montei um site inteiro copiando e colando do chat. A estrutura saiu quase pronta e a apresentação não — porque HTML tem resposta certa e layout só tem resposta certa para um contexto que o modelo não conhece.

  15. O que sobra de um PRD quando ele precisa caber numa mensagem de chat

    Em novembro de 2024 nada abre o meu repositório, então o PRD tem que caber numa mensagem e voltar inteiro a cada turno. É isso que força a decisão que ninguém tomava: o que ali vira código e o que é só alinhamento entre pessoas.

  16. Uma API inteira pelo chat: o que o GPT-4o acerta e onde ele te enrola

    Em novembro de 2024 nenhum agente edita meus arquivos: a API sai do chat em blocos que eu colo à mão. O GPT-4o acerta a estrutura e me enrola em quatro lugares — o pior é o teste que passa sem testar nada.