Rodo modelos de IA em hardware próprio e publico os números.
Seis máquinas, de 12 a 96 GB: quatro GPUs NVIDIA, Apple Silicon e memória unificada. Lab
Publicações
-
Desenhos para colorir com IA local: do prompt ao arquivo que imprime bem
Gerar a imagem é a parte fácil, e é onde todo tutorial para. O que decide se a criança consegue pintar é o que vem depois: binarizar, vetorizar e imprimir sem serrilhado.
-
Qwen3.6 27B: quanta VRAM ele precisa de verdade
Um modelo de 27B que gasta metade do KV cache de um Llama 3 8B. A arquitetura híbrida quebra a conta usual — e decide, por menos de 1 GB, quais placas ficam de fora.
-
Quanta VRAM um LLM realmente ocupa
A conta de cabeça — parâmetros vezes bits — erra por vários gigabytes, porque ignora o KV cache. Aqui está a conta completa, com a fórmula, os números e como conferir na sua GPU.