2 posts
Posts etiquetados con benchmark
-
Cuando el modelo no cabe: el coste real del offload a la CPU
En la publicación anterior estimé que mover capas a la CPU cuesta diez veces el rendimiento. Medí en las dos tarjetas y me equivoqué: el mismo modelo cae de 66 a 3,1 tokens por segundo. Y nada en el runtime avisa cuando esto sucede.
-
Escribir el caso de borde aumenta la precisión del 46% al 90%
360 generaciones, tres modelos locales, tres formas de la misma solicitud. El gran salto está entre no escribir el caso de borde y escribirlo: del 46% al 90%. La tabla en markdown, frente al mismo texto corrido, no dio lo que esperaba.