Trocar a 5060 Ti pela 5070 Ti dobra a banda e não muda o que cabe
As duas têm 16 GB. O mesmo modelo, a mesma quantização e o mesmo contexto cabem nas duas. O que dobra é a banda de memória, de 448 para 896 GB/s, e é ela que manda nos tokens por segundo.
Com pressa? Peça o TL;DR ao Claude — ele lê a página e resume.
Eu estava na 5060 Ti 16 GB e a pergunta começou a aparecer com frequência: vale subir para a 5070 Ti? A tentação é óbvia. O nome é maior, o preço de lançamento também, e a intuição de quem roda modelo local é achar que placa mais cara libera modelo maior. Acontece que, neste par específico, essa intuição aponta para o lugar errado.
As duas placas têm 16 GB de GDDR7. Então cabe exatamente o mesmo modelo, na mesma quantização, com o mesmo contexto. A troca não muda o teto do que entra na VRAM. O que muda é a banda de memória, que dobra exatamente: de 448 GB/s para 896 GB/s. E como a geração de token é limitada por banda (cada token gerado precisa ler os pesos do modelo na VRAM uma vez), é a banda que decide tokens por segundo.
Quem troca esperando rodar modelo maior se decepciona. Quem troca por velocidade, acerta.
O que a ficha técnica realmente diz
Antes de falar de modelo e quantização, vale olhar o que a NVIDIA publicou e o que se deriva disso sem sair da calculadora. Não tem bancada neste post. Não tem nvidia-smi nem cronômetro. O que está abaixo é spec oficial e aritmética em cima dela.
| RTX 5060 Ti 16GB | RTX 5070 Ti | |
|---|---|---|
| Memória | 16 GB GDDR7 | 16 GB GDDR7 |
| Barramento | 128-bit | 256-bit |
| Banda de memória | 448 GB/s | 896 GB/s |
| Velocidade da memória | 28 Gbps | 28 Gbps |
| CUDA cores | 4608 | 8960 |
| TGP | 180 W | 300 W |
| Preço de lançamento | US$ 429 | US$ 749 |
| Lançamento | 16/04/2025 | 20/02/2025 |
| Arquitetura | Blackwell | Blackwell |
As razões exatas, só dividindo uma coluna pela outra: banda 2,00×, CUDA cores 1,94×, watts 1,67×, preço 1,75×. A banda é o único múltiplo redondo da lista, e não é coincidência.
Por que a banda dobra e a VRAM não
As duas usam memória na mesma velocidade: 28 Gbps. A diferença está no barramento. A 5060 Ti 16 GB veio com 128-bit. A 5070 Ti veio com 256-bit. A conta de banda de memória é:
banda = velocidade × largura do barramento / 8
O / 8 transforma gigabits em gigabytes. Substituindo:
5060 Ti: 28 Gbps × 128 bit / 8 = 448 GB/s
5070 Ti: 28 Gbps × 256 bit / 8 = 896 GB/s
Mesma GDDR7, mesmo clock efetivo da memória, o dobro da largura do barramento, o dobro da banda. A capacidade continua 16 GB nos dois lados. Não tem truque de marketing escondido aqui: a 5070 Ti não carrega modelo que a 5060 Ti 16 GB recusou por falta de espaço. Ela só alimenta a GPU com os pesos já carregados duas vezes mais rápido.
Geração de token é leitura de peso
Na fase de prefill (quando o prompt inteiro entra de uma vez) sobra paralelismo e a conta depende mais de compute. Na geração, o quadro inverte. Para emitir um token novo, o modelo precisa percorrer os pesos relevantes praticamente inteiros, uma vez por token. O lote é 1. Não tem milhares de tokens sendo processados juntos para esconder latência de memória.
Se a cada token você precisa ler, digamos, 8,58 GB de pesos, a pergunta vira: quantas vezes por segundo a sua banda consegue entregar esses 8,58 GB? A resposta é uma divisão.
teto teórico de tok/s ≈ banda de memória / tamanho dos pesos
Isso é limite superior teórico. Supõe aproveitamento de 100% da banda, sem overhead de kernel, sem fragmentação de acesso, sem custo de sampling, sem KV cache entrando na fila. O número real é sempre menor. Eu não medi. Nenhum número de desempenho real aparece neste post, porque eu ainda não liguei as duas placas para comparar.
O teto teórico nos tamanhos que importam
Estou usando Q4_K_M a 4,9 bits por peso, que é a quantização que de fato aparece no dia a dia em llama.cpp e derivados. Os pesos abaixo estão em GB decimais. A placa de 16 GiB tem 17,18 GB decimais. Descontando cerca de 1 GB de overhead de runtime, o orçamento útil para pesos fica na casa dos 16 GB decimais. Por isso 27,8B e 32B em Q4_K_M ficam de fora nas duas.
| Modelo | Pesos Q4_K_M | Cabe em 16 GiB? | Teto 5060 Ti | Teto 5070 Ti |
|---|---|---|---|---|
| 8B | 4,90 GB | sim | 91 tok/s | 183 tok/s |
| 14B | 8,58 GB | sim | 52 tok/s | 104 tok/s |
| 20B | 12,25 GB | sim | 37 tok/s | 73 tok/s |
| 27,8B | 17,03 GB | não | — | — |
| 32B | 19,60 GB | não | — | — |
Conferindo as contas do meio da tabela, para não ficar solto:
14B em Q4_K_M: 8,58 GB
5060 Ti: 448 / 8,58 ≈ 52,2 tok/s
5070 Ti: 896 / 8,58 ≈ 104,4 tok/s
20B em Q4_K_M: 12,25 GB
5060 Ti: 448 / 12,25 ≈ 36,6 tok/s
5070 Ti: 896 / 12,25 ≈ 73,1 tok/s
Em todo tamanho que cabe nos dois lados, o teto da 5070 Ti é o dobro. Não 1,75× (preço), não 1,67× (watts), não 1,94× (CUDA cores). 2,00×, porque a razão que manda na geração é a razão da banda.
O que a troca não resolve
Vale repetir com outras palavras, porque é o tipo de conclusão que escorrega na hora da compra.
Se o seu problema é carregar um 32B em Q4_K_M, a 5070 Ti não ajuda. Os pesos continuam com 19,60 GB e a VRAM continua com 16 GiB. Se o seu problema é contexto longo estourando KV cache em cima de um modelo que já está colado no teto, a 5070 Ti também não ajuda: o cache mora na mesma pilha de 16 GB. Se o seu problema é offload para CPU por falta de espaço, a troca mantém o offload.
A lista do que não muda:
- O maior modelo que cabe inteiro na VRAM, em cada quantização.
- O contexto máximo antes do KV cache empurrar camadas para fora.
- A necessidade de quantizar mais agressivo quando o modelo é grande demais.
- A decisão entre um 20B inteiro na GPU e um 32B pela metade na CPU.
Nada disso é função de banda. É função de capacidade. As duas placas empatam.
O que a troca resolve
Agora o lado em que a 5070 Ti paga o que custa, ao menos no papel.
No mesmo modelo, mesma quantização, mesmo contexto, o teto teórico de geração dobra. 8B de ~91 para ~183 tok/s. 14B de ~52 para ~104. 20B de ~37 para ~73. Na prática os dois números ficam abaixo disso, e a razão medida não precisa sair exatamente 2,00×. Mas a direção é clara: se você já está satisfeito com o modelo que roda e só reclama da velocidade de saída, banda é a alavanca certa, e aqui ela dobra.
Tem ainda o fator CUDA cores, 4608 contra 8960 (1,94×). Isso pesa mais no prefill, em batch maior e em qualquer carga que não seja estritamente geração token a token. Para o uso interativo típico de um modelo local (chat, agente, completion com batch 1), eu continuo tratando banda como o primeiro termo da conta. Compute sobra mais do que memória nesse regime. Mesmo assim, não vou fingir que 1,94× de cores é irrelevante: em prompt longo o prefill deve mostrar ganho visível, e separado do ganho de geração.
O que este post compara
- Placa A
- RTX 5060 Ti 16GB
- Placa B
- RTX 5070 Ti
- Memória
- 16 GB GDDR7 nas duas
- Banda
- 448 vs 896 GB/s
- Método
- spec oficial NVIDIA + aritmética
- Medição em bancada
- nenhuma — este post é só a conta
Preço, watt e a conta feia do upgrade
A 5060 Ti 16 GB saiu a US$ 429. A 5070 Ti saiu a US$ 749. Razão de preço: 1,75×. A razão de banda é 2,00×. A de CUDA é 1,94×. A de TGP é 1,67× (180 W para 300 W). Em termos estritamente de especificação por dólar de lançamento, a banda adicional chega com preço um pouco abaixo da proporção, e o watt adicional chega com preço um pouco acima. Isso não é veredito de custo-benefício real: preço de rua, disponibilidade e o valor da placa usada na revenda entram na conta, e eu não acompanhei nenhum dos três aqui.
O que dá para dizer sem sair da ficha:
- Você paga 1,75× o preço de lançamento para levar 2,00× a banda e 1,94× os CUDA cores, mantendo os mesmos 16 GB.
- Você aceita 1,67× a TGP. Fonte, cooler do gabinete e barulho passam a importar mais. Consumo na tomada e temperatura sob carga de inferência eu não medi.
- Se a 5060 Ti 16 GB ainda está na sua mesa, o custo que importa não é 749: é 749 menos o que você recupera vendendo a 5060 Ti. Esse residual depende do mercado do seu país e do dia da venda.
Onde o teto teórico engana
Eu gosto dessa divisão banda/pesos porque ela é honesta sobre o mecanismo. Ela também é fácil de superinterpretar. Três ressalvas.
Primeiro: aproveitamento de banda nunca é 100%. Acesso a peso em inferência com batch 1 é regular, o que ajuda, mas ainda existem kernels, layernorm, residual, sampling e o próprio KV cache competindo por ciclo de memória. O tok/s real fica claramente abaixo do teto nos dois lados, e não preserva a razão 2,00× com duas casas decimais.
Segundo: o tamanho dos pesos não é o único tráfego. A cada token também se lê e se escreve KV cache. Em contexto curto, o termo é pequeno perto de um modelo de 12 GB. Em contexto longo, deixa de ser. O teto que eu coloquei na tabela ignora isso de propósito, para isolar o efeito da banda sobre os pesos. Com janela grande, o ganho real de geração pode ficar abaixo da razão das bandas.
Terceiro: quantização mais baixa reduz pesos e sobe o teto teórico, mas não muda o fato de as duas placas terem a mesma capacidade. Um 32B em Q3 pode eventualmente entrar onde Q4_K_M não entra. Se entrar, entra nas duas. A 5070 Ti não é requisito para essa gambiarra; só entrega o token mais rápido depois que a gambiarra já coube.
O erro que eu mais vejo em discussão de upgrade
Se hoje você roda 14B e quer 14B mais rápido, a tese da troca se sustenta no papel. Se hoje você roda 20B e quer 32B, a tese cai.
Parece óbvio escrito assim, e ainda assim é o erro mais comum: misturar a fome de modelo maior com a fome de token mais rápido, e achar que uma placa só resolve as duas. São eixos diferentes, e este par de placas separa os dois com uma clareza incomum, porque empata num e dobra no outro.
Como eu decidiria na prática
No meu caso, a decisão começa por uma frase só: eu estou preso em capacidade ou em velocidade?
Preso em capacidade significa que o modelo que eu quero não carrega, ou carrega com offload, ou só sobrevive com contexto curto demais para o uso. Aí a 5070 Ti não é resposta: ficar na 5060 Ti ou subir para ela dá na mesma, porque a linha de corte é a capacidade e as duas têm a mesma. O caminho é outra placa com mais GB, ou outro modelo, ou outra quantização, ou aceitar contexto menor.
Preso em velocidade significa que o modelo certo já está inteiro na VRAM e o que incomoda é esperar o token. Aí a razão 2,00× na banda é exatamente o tipo de ganho que eu procuro, e a 5070 Ti entra na conversa. Antes de comprar eu ainda faria três medições na placa atual, para não trocar com base em teto teórico:
- Tokens por segundo de geração, no modelo e no contexto que eu realmente uso.
- Tokens por segundo de prefill, no mesmo setup.
- VRAM ocupada com a janela cheia, não vazia.
Se a geração medida já está perto o bastante do teto teórico da 5060 Ti, o teto teórico da 5070 Ti vira prognóstico razoável de ganho. Se a geração medida está muito abaixo do teto, o gargalo pode ser outro (backend, sampling, CPU na orquestração, PCIe em setup com offload parcial), e dobrar banda nenhuma resolve enquanto esse outro gargalo ficar de pé.
As duas são Blackwell, e isso simplifica a comparação
Mesma geração, mesmo fabricante, mesma família de memória. Isso elimina uma classe inteira de dúvida: não estou comparando arquitetura velha com nova, nem GDDR6 com GDDR7, nem stacks de software em estágios diferentes de maturidade. Driver, CUDA e suporte no llama.cpp partem do mesmo lugar nas duas.
O que sobra de diferença para inferência local está quase todo em três eixos: banda 2,00×, cores 1,94×, TGP 1,67×. Capacidade empatada. É raro uma comparação de placa ficar tão limpa assim.
O que eu faço com isso
Eu não troco 5060 Ti 16 GB por 5070 Ti para “passar a rodar modelo maior”. Essa frase não sobrevive à tabela de pesos. Troco se o modelo atual já cabe, se a geração medida na 5060 Ti for o que está me atrasando, e se o preço de rua na hora da compra ainda fizer a razão de banda parecer sensata diante do que eu recupero pela placa antiga.
No fim das contas a regra cabe em duas frases. Capacidade decide o que você roda. Banda decide a que velocidade. Este upgrade mexe na segunda e deixa a primeira quieta, e é só com essa distinção na cabeça que a 5070 Ti deixa de ser amuleto e vira ferramenta.