Qual GPU escolher para LLM de 7B, 14B, 32B e 70B parâmetros?
Saiba qual GPU escolher para rodar LLMs de 7B, 14B, 32B e 70B parâmetros. Veja VRAM, quantização e custo com servidores da EVEO.
Tempo de leitura: 09 min
EM RESUMO
A escolha da GPU para rodar um LLM depende diretamente da quantidade de VRAM disponível. Modelos de 7B parâmetros rodam em uma GPU de 24 GB, enquanto modelos de 70B exigem 80 GB em FP16 ou múltiplas GPUs. A EVEO oferece servidores com NVIDIA A10, L40S, A100 e H100 para cada faixa de modelo.
- Um LLM consome aproximadamente 2 GB de VRAM por bilhão de parâmetros em precisão FP16, mais overhead de contexto.
- GPUs como NVIDIA A10 (24 GB) e L40S (48 GB) atendem modelos pequenos e médios; A100 e H100 (80 GB) são necessárias para modelos grandes.
- Quantização reduz o consumo de VRAM em até 75%, permitindo rodar modelos maiores em hardware menor, com perda mínima de qualidade.
Este artigo é para você se:
- Você lidera um time de engenharia ou infraestrutura e precisa dimensionar o hardware correto para rodar modelos de linguagem em produção.
- Você está avaliando se a GPU que possui hoje suporta um modelo maior ou se precisa fazer upgrade para atender demanda crescente.
- Você precisa de uma tabela comparativa clara que relacione tamanho de LLM, VRAM necessária e modelo de GPU recomendado para orçamento interno.
Neste artigo:
- O que é VRAM e por que ela decide qual GPU serve para seu LLM
- Quanta VRAM um LLM consome por tamanho de modelo
- Qual GPU escolher para LLM de 7B parâmetros
- Qual GPU escolher para LLM de 14B parâmetros
- Qual GPU escolher para LLM de 32B parâmetros
- Qual GPU escolher para LLM de 70B parâmetros
- Quantização: como reduzir a VRAM sem perder qualidade
- Comparativo: qual GPU escolher para cada tamanho de LLM
- A abordagem da EVEO
- Perguntas frequentes
O que é VRAM e por que ela decide qual GPU serve para seu LLM
VRAM (Video Random Access Memory) é a memória dedicada da placa de vídeo, distinta da RAM do servidor, onde residem os pesos do modelo de IA, os estados de atenção e o cache de tokens durante a inferência. Em LLMs, a VRAM é o recurso mais escasso e determinante: se o modelo não cabe na memória da GPU, a inferência simplesmente não ocorre, independentemente da velocidade do processador ou da largura de banda.
Diferente de cargas tradicionais de computação, onde o gargalo costuma ser CPU ou disco, a inferência de LLM é intensiva em memória de vídeo. Cada parâmetro do modelo ocupa espaço na VRAM, e a quantidade necessária cresce linearmente com o tamanho do modelo. Além dos pesos, a VRAM também armazena o estado de atenção (KV cache), que cresce com o tamanho do contexto e com o batch de requisições. Por isso, escolher a GPU correta começa por entender quanta VRAM seu modelo exige, não apenas quantos teraflops a placa entrega.
Quanta VRAM um LLM consome por tamanho de modelo
Para estimar o consumo de VRAM de um LLM, a regra prática é multiplicar a quantidade de parâmetros pelo tamanho do tipo de dado usado. Em precisão FP16 (16 bits, padrão para inferência de qualidade), cada parâmetro ocupa 2 bytes. Um modelo de 7B parâmetros, portanto, consome aproximadamente 14 GB só para os pesos. Na prática, é preciso adicionar 10% a 20% de overhead para o KV cache, buffers de ativação e framework.
Veja a estimativa base para cada faixa de modelo em FP16:
- 7B parâmetros: ~14 GB de pesos + overhead = 16 a 18 GB de VRAM
- 14B parâmetros: ~28 GB de pesos + overhead = 32 a 36 GB de VRAM
- 32B parâmetros: ~64 GB de pesos + overhead = 72 a 80 GB de VRAM
- 70B parâmetros: ~140 GB de pesos + overhead = 150+ GB de VRAM (exige múltiplas GPUs ou quantização)
Esses números assumem inferência com batch size 1 e contexto moderado. Se você atende múltiplos usuários simultâneos ou usa contextos longos (32K tokens ou mais), o KV cache cresce e a VRAM necessária pode aumentar 20% a 40%.
Qual GPU escolher para LLM de 7B parâmetros
Modelos de 7 bilhões de parâmetros, como as versões menores de Llama, Mistral e Qwen, são a porta de entrada para IA generativa em produção. Eles oferecem bom desempenho em tarefas de texto, sumarização e atendimento automatizado, com consumo de VRAM relativamente modesto.
Para rodar um LLM de 7B em FP16 com margem de segurança, você precisa de pelo menos 20 GB de VRAM. A NVIDIA A10, com 24 GB de VRAM, é a escolha mínima recomendada. Ela carrega o modelo confortavelmente, deixa espaço para contextos longos e suporta batch sizes pequenos. É ideal para protótipos, chatbots internos e automação de documentos.
Se você precisa de mais throughput (múltiplas requisições simultâneas) ou pretende rodar modelos multimodais, a NVIDIA L40S (48 GB) oferece o dobro de VRAM e performance superior em inferência, com margem para crescer sem trocar de hardware.
Qual GPU escolher para LLM de 14B parâmetros
Modelos de 14 bilhões de parâmetros representam um salto de qualidade perceptível em raciocínio, codificação e análise de documentos complexos. No entanto, eles já ultrapassam o limite confortável de GPUs de entrada.
Em FP16, um LLM de 14B exige cerca de 32 a 36 GB de VRAM. A NVIDIA A10 (24 GB) não é recomendada aqui: o modelo caberia em quantização INT8, mas sem margem para KV cache ou batches. A escolha mínima segura é a NVIDIA A100 de 40 GB ou a L40S de 48 GB. Ambas permitem rodar o modelo em FP16 com folga para contexto e concorrência.
Se o uso for crítico e o tempo de resposta importar, a A100 80 GB ou H100 80 GB oferecem não apenas mais VRAM, mas também maior largura de banda de memória (HBM2e/HBM3), o que reduz a latência por token. Para empresas que já sabem que vão escalar, investir direto na A100 ou H100 evita troca de hardware em 12 meses.
Qual GPU escolher para LLM de 32B parâmetros
Modelos de 32 bilhões de parâmetros, como as versões maiores de Qwen, Yi e Llama, entregam capacidade de raciocínio próxima aos modelos de 70B quantizados. Eles são usados em análise jurídica, revisão de contratos, engenharia de prompts complexos e copilotos de código empresarial.
Em FP16, um LLM de 32B consome aproximadamente 72 a 80 GB de VRAM. Isso coloca a NVIDIA A100 80 GB e a H100 80 GB como as únicas GPUs single-chip viáveis para essa carga em precisão plena. A H100, com arquitetura Hopper e HBM3, entrega até 3,35 TB/s de largura de banda de memória, tornando a inferência significativamente mais rápida que na A100.
A alternativa é usar a L40S (48 GB) com quantização INT8 ou INT4, o que reduz o consumo para 36 a 48 GB. Essa abordagem funciona para provas de conceito, mas em produção com múltiplos usuários, a perda de precisão e a falta de margem de VRAM podem se tornar gargalos. Para operação estável, A100 80 GB ou H100 80 GB são o padrão.
Qual GPU escolher para LLM de 70B parâmetros
Modelos de 70 bilhões de parâmetros, como Llama 3, Qwen 2.5 e as versões maiores de modelos open source, competem em qualidade com APIs comerciais de primeira linha. Eles exigem infraestrutura robusta e são usados em cenários de alta criticidade: análise de risco financeiro, assistentes jurídicos especializados, diagnóstico médico auxiliar e engenharia avançada.
Em FP16, um LLM de 70B precisa de aproximadamente 150 GB de VRAM, o que inviabiliza qualquer GPU single-chip do mercado. A configuração mínima é duas NVIDIA A100 80 GB em paralelismo tensorial ou pipeline, ou duas H100 80 GB para máxima performance. A H100, nessa configuração, oferece latência por token consideravelmente menor graças ao NVLink de quarta geração e à largura de banda de memória superior.
Se o orçamento for limitado, é possível rodar um 70B em uma única A100 80 GB ou H100 80 GB usando quantização INT4, que reduz o consumo para cerca de 40 GB. No entanto, a qualidade de resposta cai perceptivelmente em tarefas que exigem raciocínio matemático ou compreensão de nuances linguísticas. Para produção corporativa, a configuração de duas GPUs em FP16 é o recomendado.
Quantização: como reduzir a VRAM sem perder qualidade
Quantização é a técnica de reduzir a precisão numérica dos pesos do modelo, convertendo de FP16 (16 bits) para INT8 (8 bits), INT4 (4 bits) ou formatos híbridos como GGUF e AWQ. Isso diminui o consumo de VRAM e aumenta o throughput, em troca de pequena perda de precisão.
Os ganhos são substanciais:
- FP16 para INT8: redução de 50% no consumo de VRAM, perda mínima de qualidade em modelos bem otimizados.
- FP16 para INT4: redução de 75% no consumo de VRAM, qualidade aceitável para tarefas de texto geral, mas perda perceptível em raciocínio lógico e matemático.
- Formatos híbridos (AWQ, GPTQ, GGUF Q4_K_M): mantêm camadas sensíveis em precisão maior e comprimem camadas menos críticas, equilibrando economia de VRAM e qualidade de resposta.
A quantização é especialmente útil quando você quer rodar um modelo maior do que a VRAM disponível permite. Um LLM de 70B, que exigiria 150 GB em FP16, pode rodar em uma única A100 80 GB com quantização INT4. No entanto, para tarefas que exigem precisão máxima, como revisão de contratos jurídicos ou análise de dados financeiros, FP16 continua sendo o padrão recomendado.
Comparativo: qual GPU escolher para cada tamanho de LLM
| Tamanho do LLM | VRAM FP16 (estimada) | GPU mínima recomendada | GPU ideal para produção | Observação |
|---|---|---|---|---|
| 7B | 16 a 18 GB | NVIDIA A10 (24 GB) | NVIDIA L40S (48 GB) | Ideal para chatbots e automação de documentos |
| 14B | 32 a 36 GB | NVIDIA A100 40 GB | NVIDIA A100 80 GB / H100 80 GB | A10 não recomendada mesmo em INT8 |
| 32B | 72 a 80 GB | NVIDIA A100 80 GB | NVIDIA H100 80 GB | L40S só com quantização INT4/INT8 |
| 70B | 150+ GB | 2x NVIDIA A100 80 GB | 2x NVIDIA H100 80 GB | Single-GPU só com INT4; qualidade reduzida |
A tabela acima serve como referência rápida para times de infraestrutura e engenharia de ML. Lembre-se de que a VRAM necessária pode variar conforme o framework de inferência, o tamanho do contexto e o batch de requisições. Sempre faça testes de carga antes de finalizar o dimensionamento.
A abordagem da EVEO
A EVEO oferece servidores GPU dedicados em data centers Tier III localizados em Cotia/SP, Osasco/SP, Curitiba/PR, Fortaleza/CE e Miami/FL, com atendimento exclusivo a empresas mediante CNPJ. As GPUs disponíveis incluem NVIDIA A10, L40S, A100 e H100, configuráveis conforme o tamanho do LLM que sua operação precisa rodar.
A EVEO não cobra egress fee, o que elimina surpresas de fatura para operações que exportam dados da inferência. O custo é fixo em reais, previsível e independente de cotação de dólar. Além disso, a soberania de dados é garantida: os dados permanecem em território nacional, sob controle exclusivo do cliente, com possibilidade de auditoria física e lógica.
Se você está dimensionando a infraestrutura para rodar LLMs de 7B a 70B parâmetros, a equipe de engenharia da EVEO auxilia na escolha da GPU correta, considerando não apenas o tamanho do modelo, mas também o throughput desejado, o tamanho do contexto e as restrições de compliance da sua empresa.
Perguntas frequentes
1. Qual GPU escolher para rodar um LLM de 7B parâmetros?
Para um LLM de 7B parâmetros em FP16, a GPU mínima recomendada é a NVIDIA A10 com 24 GB de VRAM. Ela carrega o modelo com folga para contexto e batches pequenos. Se você precisa de mais throughput ou pretende escalar para modelos maiores, a NVIDIA L40S com 48 GB é a escolha ideal.
2. É possível rodar um LLM de 70B parâmetros em uma única GPU?
Em precisão FP16, não: um LLM de 70B precisa de aproximadamente 150 GB de VRAM, o que excede qualquer GPU single-chip disponível. Com quantização INT4, é possível rodar em uma única A100 80 GB ou H100 80 GB, mas a qualidade de resposta cai perceptivelmente. Para produção corporativa, a configuração recomendada é duas GPUs A100 80 GB ou duas H100 80 GB em paralelismo tensorial.
3. O que é quantização e quando devo usá-la?
Quantização é a técnica de reduzir a precisão numérica dos pesos do modelo (de FP16 para INT8 ou INT4) para economizar VRAM. Use-a quando precisa rodar um modelo maior do que a GPU disponível permite, ou quando quer aumentar o throughput. Evite-a em tarefas que exigem alta precisão, como análise jurídica, revisão de contratos ou raciocínio matemático complexo.
4. Qual a diferença entre NVIDIA A100 e H100 para inferência de LLM?
Ambas têm 80 GB de VRAM, mas a H100 usa arquitetura Hopper e memória HBM3, oferecendo até 3,35 TB/s de largura de banda contra 2 TB/s da A100. Em inferência de LLM, isso se traduz em latência por token menor e capacidade de atender mais requisições simultâneas. Para modelos de 32B e 70B parâmetros, a H100 é a escolha de máxima performance.
5. A VRAM é o único fator importante na escolha da GPU?
Não, mas é o fator limitante. Se o modelo não cabe na VRAM, a inferência não ocorre. Além da VRAM, a largura de banda de memória (afeta a velocidade de leitura dos pesos), o número de núcleos CUDA (afeta o processamento paralelo) e o suporte a frameworks otimizados (vLLM, TensorRT-LLM) também importam. Na prática: primeiro garanta VRAM suficiente, depois otimize pela velocidade.
6. A EVEO oferece suporte para dimensionar a GPU correta?
Sim. A EVEO atende empresas mediante CNPJ e oferece consultoria de engenharia para dimensionamento de infraestrutura GPU. A equipe avalia o tamanho do modelo, o throughput desejado, o contexto médio e as restrições de compliance para recomendar a configuração ideal, seja bare metal ou nuvem privada.
A EVEO é a líder nacional em servidores dedicados, private cloud e GPU dedicada para inteligência artificial. Fundada em 2014, opera cinco data centers Tier III em Cotia e Osasco (SP), Curitiba (PR), Fortaleza (CE) e Miami (FL), e seu portfólio inclui ainda bare metal, Edge Private Cloud, storage, colocation gerenciado, backup e disaster recovery. Para mais informações, acesse: www.eveo.com.br.


Comentários