Saltar al contenido
Fantástico Mundo de Jon
RSS

3 posts

Posts etiquetados con GPU

Todas las etiquetas

  1. Cuando el modelo no cabe: el coste real del offload a la CPU

    En la publicación anterior estimé que mover capas a la CPU cuesta diez veces el rendimiento. Medí en las dos tarjetas y me equivoqué: el mismo modelo cae de 66 a 3,1 tokens por segundo. Y nada en el runtime avisa cuando esto sucede.

  2. Qwen3.6 27B: cuánta VRAM necesita realmente

    Un modelo de 27B que consume la mitad del KV cache de un Llama 3 8B. La arquitectura híbrida rompe el cálculo habitual — y decide, por menos de 1 GB, qué tarjetas quedan fuera.

  3. Cuánta VRAM ocupa realmente un LLM

    La cuenta rápida — parámetros por bits — se equivoca por varios gigabytes, porque ignora la caché KV. Aquí está el cálculo completo, con la fórmula, los números y cómo verificarlo en tu propia GPU.