3 posts
Posts etiquetados con GPU
-
Cuando el modelo no cabe: el coste real del offload a la CPU
En la publicación anterior estimé que mover capas a la CPU cuesta diez veces el rendimiento. Medí en las dos tarjetas y me equivoqué: el mismo modelo cae de 66 a 3,1 tokens por segundo. Y nada en el runtime avisa cuando esto sucede.
-
Qwen3.6 27B: cuánta VRAM necesita realmente
Un modelo de 27B que consume la mitad del KV cache de un Llama 3 8B. La arquitectura híbrida rompe el cálculo habitual — y decide, por menos de 1 GB, qué tarjetas quedan fuera.
-
Cuánta VRAM ocupa realmente un LLM
La cuenta rápida — parámetros por bits — se equivoca por varios gigabytes, porque ignora la caché KV. Aquí está el cálculo completo, con la fórmula, los números y cómo verificarlo en tu propia GPU.