2 posts
Posts etiquetados con LLM local
-
Qwen3.6 27B: cuánta VRAM necesita realmente
Un modelo de 27B que gasta la mitad del KV cache de un Llama 3 8B. La arquitectura híbrida rompe el cálculo habitual — y decide, por menos de 1 GB, qué placas quedan fuera.
-
Cuánta VRAM ocupa realmente un LLM
La cuenta rápida — parámetros por bits — se equivoca por varios gigabytes, porque ignora la caché KV. Aquí está el cálculo completo, con la fórmula, los números y cómo verificarlo en tu propia GPU.