<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>Fantástico Mundo de Jon</title><description>Caderno de bancada sobre IA rodando em hardware próprio: quantização, throughput, VRAM e o custo real de rodar LLM local.</description><link>https://blog.jonathanschenker.com.br</link><language>pt-BR</language><item><title>Quando o modelo não cabe: o custo real do offload para CPU</title><link>https://blog.jonathanschenker.com.br/posts/custo-real-do-offload-para-cpu</link><guid isPermaLink="true">https://blog.jonathanschenker.com.br/posts/custo-real-do-offload-para-cpu</guid><description>No post anterior estimei que jogar camadas para a CPU custa dez vezes o desempenho. Medi nas duas placas e errei: o mesmo modelo cai de 66 para 3,1 tokens por segundo. E nada no runtime avisa quando isso acontece.</description><pubDate>Fri, 07 Aug 2026 00:00:00 GMT</pubDate><category>LLM local</category><category>VRAM</category><category>GPU</category><category>benchmark</category><category>offload</category></item><item><title>Desenhos para colorir com IA local: do prompt ao arquivo que imprime bem</title><link>https://blog.jonathanschenker.com.br/posts/desenhos-para-colorir-com-ia-local</link><guid isPermaLink="true">https://blog.jonathanschenker.com.br/posts/desenhos-para-colorir-com-ia-local</guid><description>Gerar a imagem é a parte fácil, e é onde todo tutorial para. O que decide se a criança consegue pintar é o que vem depois: binarizar, vetorizar e imprimir sem serrilhado.</description><pubDate>Tue, 30 Jun 2026 00:00:00 GMT</pubDate><category>imagem</category><category>Flux</category><category>IA local</category><category>impressão</category><category>MLX</category></item><item><title>Qwen3.6 27B: quanta VRAM ele precisa de verdade</title><link>https://blog.jonathanschenker.com.br/posts/qwen3-6-27b-quanta-vram-precisa</link><guid isPermaLink="true">https://blog.jonathanschenker.com.br/posts/qwen3-6-27b-quanta-vram-precisa</guid><description>Um modelo de 27B que gasta metade do KV cache de um Llama 3 8B. A arquitetura híbrida quebra a conta usual — e decide, por menos de 1 GB, quais placas ficam de fora.</description><pubDate>Thu, 25 Jun 2026 00:00:00 GMT</pubDate><category>LLM local</category><category>VRAM</category><category>Qwen</category><category>atenção híbrida</category><category>GPU</category></item><item><title>Quanta VRAM um LLM realmente ocupa</title><link>https://blog.jonathanschenker.com.br/posts/quanta-vram-um-llm-ocupa</link><guid isPermaLink="true">https://blog.jonathanschenker.com.br/posts/quanta-vram-um-llm-ocupa</guid><description>A conta de cabeça — parâmetros vezes bits — erra por vários gigabytes, porque ignora o KV cache. Aqui está a conta completa, com a fórmula, os números e como conferir na sua GPU.</description><pubDate>Wed, 10 Jun 2026 00:00:00 GMT</pubDate><category>LLM local</category><category>VRAM</category><category>quantização</category><category>GPU</category></item><item><title>Medi se arquivo de spec faz o modelo acertar mais. Não faz.</title><link>https://blog.jonathanschenker.com.br/posts/spec-estruturada-nao-faz-acertar-mais</link><guid isPermaLink="true">https://blog.jonathanschenker.com.br/posts/spec-estruturada-nao-faz-acertar-mais</guid><description>Em julho defendi que a spec estruturada muda o resultado. Medi em outubro: 360 gerações, 3 modelos locais, 3 formas do mesmo pedido. O que paga é a informação escrita, não o formato do arquivo.</description><pubDate>Tue, 14 Oct 2025 00:00:00 GMT</pubDate><category>spec-driven</category><category>agentes de código</category><category>Aider</category><category>LLM local</category><category>benchmark</category></item><item><title>O PRD vem antes: a spec que impede o agente de escrever o código errado</title><link>https://blog.jonathanschenker.com.br/posts/prd-antes-do-prompt-spec-driven</link><guid isPermaLink="true">https://blog.jonathanschenker.com.br/posts/prd-antes-do-prompt-spec-driven</guid><description>O modelo não erra por burrice: erra porque fechou sozinho a lacuna que o prompt deixou, e fechou de um jeito plausível. O que muda no código quando o contrato vem antes do pedido.</description><pubDate>Tue, 15 Jul 2025 00:00:00 GMT</pubDate><category>agentes de código</category><category>spec-driven</category><category>Claude Code</category><category>PRD</category></item></channel></rss>