Saltar al contenido
Fantástico Mundo de Jon
RSS

4 posts

Posts etiquetados con VRAM

Todas las etiquetas

  1. Cuando el modelo no cabe: el coste real del offload a la CPU

    En la publicación anterior estimé que mover capas a la CPU cuesta diez veces el rendimiento. Medí en las dos tarjetas y me equivoqué: el mismo modelo cae de 66 a 3,1 tokens por segundo. Y nada en el runtime avisa cuando esto sucede.

  2. Cambiar la 5060 Ti por la 5070 Ti duplica el ancho de banda sin alterar la capacidad

    Ambas tienen 16 GB. El mismo modelo, la misma cuantización y el mismo contexto caben en ambas. Lo que se duplica es el ancho de banda de memoria, de 448 a 896 GB/s, y es este el que determina los tokens por segundo.

  3. Qwen3.6 27B: cuánta VRAM necesita realmente

    Un modelo de 27B que consume la mitad del KV cache de un Llama 3 8B. La arquitectura híbrida rompe el cálculo habitual — y decide, por menos de 1 GB, qué tarjetas quedan fuera.

  4. Cuánta VRAM ocupa realmente un LLM

    La cuenta rápida — parámetros por bits — se equivoca por varios gigabytes, porque ignora la caché KV. Aquí está el cálculo completo, con la fórmula, los números y cómo verificarlo en tu propia GPU.