Saltar al contenido
Fantástico Mundo de Jon
RSS

Todos los posts

  1. El MacBook Pro M4 tiene más RAM que la 5090 y sigo con CUDA

    48 GB unificados en el M4 caben más que los 32 GB de la 5090. Aun así, vLLM, llama.cpp y diffusion siguen en NVIDIA, porque decode es banda y la stack que ya opero es CUDA.

  2. Cambié el modelo local de OpenCode: lo que aceleró y lo que solo parecía un error

    Ya programaba con OpenCode y un Qwen en esta placa. Cambié el 3.6 por el 3.8. Te muestro qué quedó más rápido, qué acertó más, y el día que pensé que el modelo había empeorado — era configuración.

  3. Ejecuté el BitNet de Microsoft en dos CPUs: el 6x se encoge contra el Q4 que ya usas

    Cloné el bitnet.cpp de Microsoft. El README promete 6,17x en CPU. En las dos máquinas de casa el 4,2x frente a f16 apareció; frente al Q4 que Ollama ya entrega, cae a 1,3x. Y el modelo viene con la activación equivocada.

  4. Cuando el modelo no cabe: el coste real del offload a la CPU

    En la publicación anterior estimé que mover capas a la CPU cuesta diez veces el rendimiento. Medí en las dos tarjetas y me equivoqué: el mismo modelo cae de 66 a 3,1 tokens por segundo. Y nada en el runtime avisa cuando esto sucede.

  5. Cambiar la 5060 Ti por la 5070 Ti duplica el ancho de banda sin alterar la capacidad

    Ambas tienen 16 GB. El mismo modelo, la misma cuantización y el mismo contexto caben en ambas. Lo que se duplica es el ancho de banda de memoria, de 448 a 896 GB/s, y es este el que determina los tokens por segundo.

  6. Dibujos para colorear con IA local: desde el prompt hasta el archivo que imprime bien

    Generar la imagen es la parte fácil, y es donde todos los tutoriales terminan. Lo que decide si el niño puede pintar es lo que sigue: binarizar, vectorizar e imprimir sin serrado.

  7. Qwen3.6 27B: cuánta VRAM necesita realmente

    Un modelo de 27B que consume la mitad del KV cache de un Llama 3 8B. La arquitectura híbrida rompe el cálculo habitual — y decide, por menos de 1 GB, qué tarjetas quedan fuera.

  8. Cuánta VRAM ocupa realmente un LLM

    La cuenta rápida — parámetros por bits — se equivoca por varios gigabytes, porque ignora la caché KV. Aquí está el cálculo completo, con la fórmula, los números y cómo verificarlo en tu propia GPU.

  9. Escribir el caso de borde aumenta la precisión del 46% al 90%

    360 generaciones, tres modelos locales, tres formas de la misma solicitud. El gran salto está entre no escribir el caso de borde y escribirlo: del 46% al 90%. La tabla en markdown, frente al mismo texto corrido, no dio lo que esperaba.

  10. El PRD va primero: la especificación que impide al agente escribir el código equivocado

    El modelo no se equivoca por estupidez: se equivoca porque cerró solo la laguna que dejó el prompt, y lo hizo de una manera plausible. Lo que cambia en el código cuando el contrato va antes de la solicitud.

  11. Diseccionando un Modelfile de Ollama para que el modelo deje de improvisar en el código

    Los patrones de Ollama sirven para la conversación. Para el código, el trabajo es reducir la aleatoriedad en el muestreo, escribir un SYSTEM conciso y guardarlo en un modelo derivado. Paso a paso con Qwen2.5-Coder.

  12. Cuánto cuesta programar con ChatGPT: los $20 del Plus frente a la API

    La elección entre suscripción y API falla en ambas direcciones, y por el mismo motivo: en el chat cada mensaje reenvía toda la conversación. El gasto no crece con el número de preguntas, crece con su cuadrado.

  13. Un sitio web desde cero a través del chat: el HTML sale listo, el CSS no

    Monté un sitio web completo copiando y pegando del chat. La estructura salió casi lista y la presentación no — porque HTML tiene respuesta correcta y diseño solo tiene respuesta correcta para un contexto que el modelo no conoce.

  14. Una API entera por el chat: lo que acierta GPT-4o y dónde te engaña

    En noviembre de 2024 ningún agente edita mis archivos: la API sale del chat en bloques que pego a mano. El GPT-4o acierta la estructura y me engaña en cuatro lugares — el peor es la prueba que pasa sin probar nada.