Todos os posts
-
O MacBook Pro M4 tem mais RAM que a 5090 e eu continuo no CUDA
48 GB unificados no M4 cabem mais que 32 GB da 5090. Mesmo assim vLLM, llama.cpp e geração de imagem ficam na NVIDIA, porque decode é banda e a stack que eu já opero é CUDA.
-
Troquei o modelo local do OpenCode: o que acelerou e o que só parecia erro do modelo
Eu já programava com OpenCode e um Qwen rodando nesta placa. Troquei o 3.6 pelo 3.8. Vou te mostrar o que ficou mais rápido, o que acertou mais, e o dia em que eu achei que o modelo tinha piorado — e era configuração.
-
Rodei o BitNet da Microsoft em duas CPUs: o 6x some contra o que já está no disco
Eu clonei o bitnet.cpp da Microsoft. O README promete 6,17x em CPU. Nas duas máquinas da casa o 4,2x contra f16 apareceu; contra o Q4 que o Ollama já entrega, cai para 1,3x. E o modelo vem com a ativação errada.
-
Quando o modelo não cabe: o custo real do offload para CPU
No post anterior estimei que jogar camadas para a CPU custa dez vezes o desempenho. Medi nas duas placas e errei: o mesmo modelo cai de 66 para 3,1 tokens por segundo. E nada no runtime avisa quando isso acontece.
-
Trocar a 5060 Ti pela 5070 Ti dobra a banda e não muda o que cabe
As duas têm 16 GB. O mesmo modelo, a mesma quantização e o mesmo contexto cabem nas duas. O que dobra é a banda de memória, de 448 para 896 GB/s, e é ela que manda nos tokens por segundo.
-
Desenhos para colorir com IA local: do prompt ao arquivo que imprime bem
Gerar a imagem é a parte fácil, e é onde todo tutorial para. O que decide se a criança consegue pintar é o que vem depois: binarizar, vetorizar e imprimir sem serrilhado.
-
Qwen3.6 27B: quanta VRAM ele precisa de verdade
Um modelo de 27B que gasta metade do KV cache de um Llama 3 8B. A arquitetura híbrida quebra a conta usual — e decide, por menos de 1 GB, quais placas ficam de fora.
-
Quanta VRAM um LLM realmente ocupa
A conta de cabeça — parâmetros vezes bits — erra por vários gigabytes, porque ignora o KV cache. Aqui está a conta completa, com a fórmula, os números e como conferir na sua GPU.
-
Escrever o caso de borda sobe o acerto de 46% para 90%
360 gerações, três modelos locais, três formas do mesmo pedido. O salto grande está entre não escrever o caso de borda e escrever: 46% para 90%. A tabela em markdown, contra o mesmo texto corrido, não pagou o que eu esperava.
-
O PRD vem antes: a spec que impede o agente de escrever o código errado
O modelo não erra por burrice: erra porque fechou sozinho a lacuna que o prompt deixou, e fechou de um jeito plausível. O que muda no código quando o contrato vem antes do pedido.
-
Dissecando o Modelfile do Qwen3 para ele parar de pensar em voz alta no OpenCode
O Qwen3 alterna entre pensar e responder direto, e um agente esperando um diff não quer o raciocínio. Disseco o Modelfile parâmetro por parâmetro, gravo um derivado sem pensamento e ligo no OpenCode pelo provedor local novo.
-
Quanto custa programar com ChatGPT: os $20 do Plus contra a API
A escolha entre assinatura e API erra nas duas direções, e pelo mesmo motivo: no chat cada mensagem reenvia a conversa inteira. O gasto não cresce com o número de perguntas, cresce com o quadrado dele.
-
O Tailwind 4 saiu hoje com menos framework entre mim e o CSS
O motor foi reescrito, a configuração saiu do JavaScript e entrou no CSS, e cascade layers, container queries e OKLCH viraram parte da caixa. Os números de build são do anúncio oficial; o ganho que interessa é outro.
-
Um site do zero pelo chat: o HTML sai pronto, o CSS não
Montei um site inteiro copiando e colando do chat. A estrutura saiu quase pronta e a apresentação não — porque HTML tem resposta certa e layout só tem resposta certa para um contexto que o modelo não conhece.
-
O que sobra de um PRD quando ele precisa caber numa mensagem de chat
Em novembro de 2024 nada abre o meu repositório, então o PRD tem que caber numa mensagem e voltar inteiro a cada turno. É isso que força a decisão que ninguém tomava: o que ali vira código e o que é só alinhamento entre pessoas.
-
Uma API inteira pelo chat: o que o GPT-4o acerta e onde ele te enrola
Em novembro de 2024 nenhum agente edita meus arquivos: a API sai do chat em blocos que eu colo à mão. O GPT-4o acerta a estrutura e me enrola em quatro lugares — o pior é o teste que passa sem testar nada.