1 post
Posts etiquetados con offload
-
Cuando el modelo no cabe: el coste real del offload a la CPU
En la publicación anterior estimé que mover capas a la CPU cuesta diez veces el rendimiento. Medí en las dos tarjetas y me equivoqué: el mismo modelo cae de 66 a 3,1 tokens por segundo. Y nada en el runtime avisa cuando esto sucede.