Cambiar la 5060 Ti por la 5070 Ti duplica el ancho de banda sin alterar la capacidad
Ambas tienen 16 GB. El mismo modelo, la misma cuantización y el mismo contexto caben en ambas. Lo que se duplica es el ancho de banda de memoria, de 448 a 896 GB/s, y es este el que determina los tokens por segundo.
¿Con prisa? Pide el TL;DR a Claude — lee la página y la resume.
es Traducción automática por gemma3:12b, revisada por el autor. Leer el original en portugués
Estaba en la 5060 Ti 16 GB y la pregunta empezó a aparecer con frecuencia: ¿vale subir a la 5070 Ti? La tentación es obvia. El nombre es mayor, el precio de lanzamiento también, y la intuición de quien rueda modelo local es pensar que placa más cara libera modelo mayor. Resulta que, en este par específico, esta intuición apunta al lugar equivocado.
Las dos placas tienen 16 GB de GDDR7. Entonces cabe exactamente el mismo modelo, en la misma cuantización, con el mismo contexto. El cambio no modifica el techo de lo que entra en la VRAM. Lo que cambia es la banda de memoria, que dobla exactamente: de 448 GB/s a 896 GB/s. Y como la generación de token está limitada por banda (cada token generado necesita leer los pesos del modelo en la VRAM una vez), es la banda que decide tokens por segundo.
Quien cambia esperando rodar modelo mayor se decepciona. Quien cambia por velocidad, acierta.
Lo que la ficha técnica realmente dice
Antes de hablar de modelo y cuantización, vale mirar lo que NVIDIA publicó y lo que se deriva de ello sin salir de la calculadora. No hay bancada en este post. No hay nvidia-smi ni cronómetro. Lo que está debajo es spec oficial y aritmética encima de ella.
| RTX 5060 Ti 16GB | RTX 5070 Ti | |
|---|---|---|
| Memoria | 16 GB GDDR7 | 16 GB GDDR7 |
| Barramento | 128-bit | 256-bit |
| Banda de memoria | 448 GB/s | 896 GB/s |
| Velocidad de la memoria | 28 Gbps | 28 Gbps |
| CUDA cores | 4608 | 8960 |
| TGP | 180 W | 300 W |
| Precio de lanzamiento | US$ 429 | US$ 749 |
| Lanzamiento | 16/04/2025 | 20/02/2025 |
| Arquitectura | Blackwell | Blackwell |
Las razones exactas, solo dividiendo una columna por la otra: banda 2,00×, CUDA cores 1,94×, watts 1,67×, precio 1,75×. La banda es el único múltiplo redondo de la lista, y no es coincidencia.
Por qué la banda dobla y la VRAM no
Las dos usan memoria a la misma velocidad: 28 Gbps. La diferencia está en el barramento. La 5060 Ti 16 GB vino con 128-bit. La 5070 Ti vino con 256-bit. La cuenta de banda de memoria es:
banda = velocidade × largura do barramento / 8
El / 8 transforma gigabits en gigabytes. Sustituyendo:
5060 Ti: 28 Gbps × 128 bit / 8 = 448 GB/s
5070 Ti: 28 Gbps × 256 bit / 8 = 896 GB/s
Misma GDDR7, mismo clock efectivo de la memoria, el doble de la largura del barramento, el doble de la banda. La capacidad continúa 16 GB en los dos lados. No hay truco de marketing escondido aquí: la 5070 Ti no lleva modelo que la 5060 Ti 16 GB rechazó por falta de espacio. Solo alimenta la GPU con los pesos ya cargados dos veces más rápido.
Generación de token es lectura de peso
En la fase de prefill (cuando el prompt entero entra de una vez) sobra paralelismo y la cuenta depende más de compute. En la generación, el cuadro invierte. Para emitir un token nuevo, el modelo necesita recorrer los pesos relevantes prácticamente enteros, una vez por token. El lote es 1. No hay miles de tokens siendo procesados juntos para esconder latencia de memoria.
Si a cada token necesitas leer, digamos, 8,58 GB de pesos, la pregunta vira: ¿cuántas veces por segundo tu banda consigue entregar esos 8,58 GB? La respuesta es una división.
teto teórico de tok/s ≈ banda de memória / tamanho dos pesos
Esto es límite superior teórico. Supone aprovechamiento de 100% de la banda, sin overhead de kernel, sin fragmentación de acceso, sin costo de sampling, sin KV cache entrando en la fila. El número real es siempre menor. Yo no medí. Ningún número de desempeño real aparece en este post, porque aún no encendí las dos placas para comparar.
El techo teórico en los tamaños que importan
Estoy usando Q4_K_M a 4,9 bits por peso, que es la cuantización que de hecho aparece en el día a día en llama.cpp y derivados. Los pesos debajo están en GB decimales. La placa de 16 GiB tiene 17,18 GB decimales. Descontando cerca de 1 GB de overhead de runtime, el presupuesto útil para pesos queda en la casa de los 16 GB decimales. Por eso 27,8B y 32B en Q4_K_M quedan fuera en las dos.
| Modelo | Pesos Q4_K_M | Cabe en 16 GiB? | Techo 5060 Ti | Techo 5070 Ti |
|---|---|---|---|---|
| 8B | 4,90 GB | sim | 91 tok/s | 183 tok/s |
| 14B | 8,58 GB | sim | 52 tok/s | 104 tok/s |
| 20B | 12,25 GB | sim | 37 tok/s | 73 tok/s |
| 27,8B | 17,03 GB | no | — | — |
| 32B | 19,60 GB | no | — | — |
Conferindo las cuentas del medio de la tabla, para no quedar suelto:
14B em Q4_K_M: 8,58 GB
5060 Ti: 448 / 8,58 ≈ 52,2 tok/s
5070 Ti: 896 / 8,58 ≈ 104,4 tok/s
20B em Q4_K_M: 12,25 GB
5060 Ti: 448 / 12,25 ≈ 36,6 tok/s
5070 Ti: 896 / 12,25 ≈ 73,1 tok/s
En todo tamaño que cabe en los dos lados, el techo de la 5070 Ti es el doble. No 1,75× (precio), no 1,67× (watts), no 1,94× (CUDA cores). 2,00×, porque la razón que manda en la generación es la razón de la banda.
Lo que el cambio no resuelve
Vale repetir con otras palabras, porque es el tipo de conclusión que se escurre en la hora de la compra.
Si tu problema es cargar un 32B en Q4_K_M, la 5070 Ti no ayuda. Los pesos continúan con 19,60 GB y la VRAM continúa con 16 GiB. Si tu problema es contexto largo estallando KV cache encima de un modelo que ya está colado en el techo, la 5070 Ti tampoco ayuda: el cache mora en la misma pila de 16 GB. Si tu problema es offload para CPU por falta de espacio, el cambio mantiene el offload.
La lista de lo que no cambia:
- El mayor modelo que cabe entero en la VRAM, en cada cuantización.
- El contexto máximo antes del KV cache empuje capas fuera.
- La necesidad de cuantizar más agresivo cuando el modelo es grande demasiado.
- La decisión entre un 20B entero en la GPU y un 32B a medias en la CPU.
Nada de esto es función de banda. Es función de capacidad. Las dos placas empatan.
Lo que el cambio resuelve
Ahora el lado en que la 5070 Ti paga lo que cuesta, al menos en el papel.
En el mismo modelo, misma cuantización, mismo contexto, el techo teórico de generación dobla. 8B de ~91 para ~183 tok/s. 14B de ~52 para ~104. 20B de ~37 para ~73. En la práctica los dos números quedan debajo de esto, y la razón medida no necesita salir exactamente 2,00×. Pero la dirección es clara: si tú ya estás satisfecho con el modelo que rueda y solo te quejas de la velocidad de salida, banda es la palanca correcta, y aquí ella dobla.
Tiene también el factor CUDA cores, 4608 contra 8960 (1,94×). Esto pesa más en el prefill, en batch mayor y en cualquier carga que no sea estrictamente generación token a token. Para el uso interactivo típico de un modelo local (chat, agente, completion con batch 1), yo continuo tratando banda como el primer término de la cuenta. Compute sobra más de memoria en este régimen. Aún así, no voy a fingir que 1,94× de cores es irrelevante: en prompt largo el prefill debe mostrar ganho visible, y separado del ganho de generación.
Lo que este post compara
- Placa A
- RTX 5060 Ti 16GB
- Placa B
- RTX 5070 Ti
- Memoria
- 16 GB GDDR7 en las dos
- Banda
- 448 vs 896 GB/s
- Método
- spec oficial NVIDIA + aritmética
- Medición en bancada
- ninguna — este post es solo la cuenta
Precio, watt y la cuenta fea del upgrade
La 5060 Ti 16 GB salió a US$ 429. La 5070 Ti salió a US$ 749. Razón de precio: 1,75×. La razón de banda es 2,00×. La de CUDA es 1,94×. La de TGP es 1,67× (180 W para 300 W). En términos estrictamente de especificación por dólar de lanzamiento, la banda adicional llega con precio un poco debajo de la proporción, y el watt adicional llega con precio un poco arriba. Esto no es veredicto de costo-beneficio real: precio de calle, disponibilidad y el valor de la placa en la revenda entran en la cuenta, y yo no acompañé ninguno de los tres aquí.
Lo que se puede decir sin salir de la ficha:
- Tú pagas 1,75× el precio de lanzamiento para llevar 2,00× la banda y 1,94× los CUDA cores, manteniendo los mismos 16 GB.
- Tú aceptas 1,67× la TGP. Fuente, cooler del gabinete y ruido pasan a importar más. Consumo en el enchufe y temperatura bajo carga de inferencia yo no medí.
- Si la 5060 Ti 16 GB aún está en tu mesa, el costo que importa no es 749: es 749 menos lo que tú recuperas vendiendo la 5060 Ti. Este residual depende del mercado de tu país y del día de la venta.
Donde el techo teórico engaña
Me gusta esta división banda/pesos porque es honesta sobre el mecanismo. Ella también es fácil de sobreinterpretar. Tres reservas.
Primero: aprovechamiento de banda nunca es 100%. Acceso a peso en inferencia con batch 1 es regular, lo que ayuda, pero aún existen kernels, layernorm, residual, sampling y el propio KV cache compitiendo por ciclo de memoria. El tok/s real queda claramente debajo del techo en los dos lados, y no preserva la razón 2,00× con dos casas decimales.
Segundo: el tamaño de los pesos no es el único tráfico. A cada token también se lee y se escribe KV cache. En contexto corto, el término es pequeño cerca de un modelo de 12 GB. En contexto largo, deja de ser. El techo que yo puse en la tabla ignora esto a propósito, para aislar el efecto de la banda sobre los pesos. Con ventana grande, el ganho real de generación puede quedar debajo de la razón de las bandas.
Tercero: cuantización más baja reduce pesos y sube el techo teórico, pero no cambia el hecho de que las dos placas tienen la misma capacidad. Un 32B en Q3 puede eventualmente entrar donde Q4_K_M no entra. Si entra, entra en las dos. La 5070 Ti no es requisito para esta gambiarra; solo entrega el token más rápido después de que la gambiarra ya coube.
El error que más veo en discusión de upgrade
Si hoy tú ruedas 14B y quieres 14B más rápido, la tesis del cambio se sostiene en el papel. Si hoy tú ruedas 20B y quieres 32B, la tesis cae.
Parece obvio escrito así, y aún así es el error más común: mezclar el hambre de modelo mayor con el hambre de token más rápido, y pensar que una placa solo resuelve las dos. Son ejes diferentes, y este par de placas separa los dos con una claridad inusual, porque empatan en uno y dobla en el otro.
Cómo yo decidiría en la práctica
En mi caso, la decisión empieza por una frase solo: yo estoy preso en capacidad o en velocidad?
Preso en capacidad significa que el modelo que yo quiero no carga, o carga con offload, o solo sobrevive con contexto corto demasiado para el uso. Ahí la 5070 Ti no es respuesta: quedarse en la 5060 Ti o subir para ella da en la misma, porque la línea de corte es la capacidad y las dos tienen la misma. El camino es otra placa con más GB, o otro modelo, o otra cuantización, o aceptar contexto menor.
Preso en velocidad significa que el modelo correcto ya está entero en la VRAM y lo que incomoda es esperar el token. Ahí la razón 2,00× en la banda es exactamente el tipo de ganho que yo busco, y la 5070 Ti entra en la conversación. Antes de comprar yo aún haría tres mediciones en la placa actual, para no cambiar con base en techo teórico:
- Tokens por segundo de generación, en el modelo y en el contexto que yo realmente uso.
- Tokens por segundo de prefill, en el mismo setup.
- VRAM ocupada con la ventana llena, no vacía.
Si la generación medida ya está cerca del techo teórico de la 5060 Ti, el techo teórico de la 5070 Ti vira pronóstico razonable de ganho. Si la generación medida está mucho debajo del techo, el cuello de botella puede ser otro (backend, sampling, CPU en orquestación, PCIe en setup con offload parcial), y doblar banda ninguna resuelve mientras este otro cuello de botella quede de pie.
Las dos son Blackwell, y esto simplifica la comparación
Misma generación, mismo fabricante, misma familia de memoria. Esto elimina una clase entera de duda: no estoy comparando arquitectura vieja con nueva, ni GDDR6 con GDDR7, ni stacks de software en estados diferentes de madurez. Driver, CUDA y soporte en llama.cpp parten del mismo lugar en las dos.
Lo que sobra de diferencia para inferencia local está casi todo en tres ejes: banda 2,00×, cores 1,94×, TGP 1,67×. Capacidad empatada. Es raro una comparación de placa quedar tan limpia así.
Lo que yo hago con esto
Yo no cambio 5060 Ti 16 GB por 5070 Ti para “pasar a rodar modelo mayor”. Esta frase no sobrevive a la tabla de pesos. Cambio si el modelo actual ya cabe, si la generación medida en la 5060 Ti es lo que me está atrasando, y si el precio de calle en el momento de la compra aún hace que la razón de banda parezca sensata frente a lo que yo recupero por la placa antigua.
Al final la regla cabe en dos frases. Capacidad decide lo que tú ruedas. Banda decide a qué velocidad. Este upgrade mueve en la segunda y deja la primera quieta, y es solo con esta distinción en la cabeza que la 5070 Ti deja de ser amuleto y vira herramienta.