
Quando uma empresa considera executar modelos de inteligência artificial em infraestrutura própria, é comum imaginar servidores caros, várias placas de vídeo e uma sala especialmente preparada. Essa imagem faz sentido em alguns casos, mas não representa todas as possibilidades. Algumas aplicações podem funcionar em computadores pessoais ou sistemas compactos; outras exigem workstations mais robustas ou infraestrutura de datacenter.
Entre esses extremos há várias combinações possíveis. A empresa pode manter algumas aplicações em seus próprios equipamentos, contratar infraestrutura quando precisar de mais recursos e continuar usando serviços externos para outras necessidades.
Neste artigo exploraremos esse espaço entre o computador individual e o datacenter, passando por modelos de IA, memória, desempenho e opções de infraestrutura para executá-los, considerando a realidade de pequenas e médias empresas.
Privacidade importa, mas controle também
Preservar a privacidade de informações sensíveis é uma razão importante para executar modelos em infraestrutura própria. Documentos, dados de clientes ou informações internas podem tornar pouco atraente enviar tudo para uma API externa de IA, principalmente quando houver requisitos de segurança, governança ou regras sobre onde os dados podem ser armazenados e processados.
Um estudo do IBM Institute for Business Value com 1.000 executivos mostrou que 91% dos entrevistados não tinham uma visão completa de suas dependências entre fornecedores, modelos e infraestrutura de IA. No mesmo estudo, 71% disseram que seria difícil trocar seu principal fornecedor ou modelo. A IBM usa esses resultados para defender uma visão de soberania menos baseada em possuir toda a tecnologia e mais na capacidade de conhecer dependências, governá-las e mudar de direção.
A Deloitte, por sua vez, pesquisou 3.235 líderes de negócios e tecnologia de 24 países: 83% consideravam a IA soberana pelo menos moderadamente importante para o planejamento estratégico, enquanto 77% afirmaram levar em conta o país de origem da solução ao escolher fornecedores.
Capacidade de escolha, menor dependência de fornecedores e controle sobre modelos e infraestrutura também pesam nas decisões. Custo importa, mas não precisa ser a principal motivação. Privacidade, autonomia e controle podem justificar uma arquitetura que não seja a opção de menor custo.
Há mais de uma forma de começar
Um computador individual pode servir para experimentação, aprendizado ou tarefas bem simples com alguns modelos disponíveis para execução local. Quando o uso exigir modelos mais capazes, documentos e conversas mais longos ou vários usuários ao mesmo tempo, uma workstation compartilhada ou uma máquina contratada em um datacenter podem fazer mais sentido.
Ao contratar infraestrutura em um datacenter, é possível usar uma máquina virtual, um servidor dedicado ou outro tipo de ambiente, instalando ali os modelos e o software necessário para executá-los. Nesse caso, a organização escolhe o modelo e administra também seu ambiente de execução, em vez de consumir apenas uma API pronta. Uma aplicação pode começar nesse ambiente como piloto e depois ser movida para uma workstation, enquanto outras continuam usando serviços externos.
Entre os modelos disponíveis para execução em infraestrutura própria estão famílias como Gemma 4, Ministral 3 e gpt-oss, além de modelos como o Qwen3.8-27B. Eles cobrem desde configurações adequadas à experimentação em computadores pessoais até workstations mais robustas e servidores com aceleradores dedicados. A infraestrutura necessária varia conforme o tamanho, a arquitetura e a forma de execução de cada modelo.
Começar pelo menor modelo que resolve o problema
Com tantas opções de hardware e modelos, é natural perguntar qual é o maior modelo que determinada máquina consegue executar. Para uma empresa, costuma ser mais útil fazer a pergunta inversa: qual é o menor modelo capaz de resolver bem o problema?
Uma aplicação que classifica documentos, extrai informações, resume textos ou responde perguntas sobre uma base interna pode ser atendida por um modelo menor, desde que o resultado seja adequado ao uso real. Com RAG – técnica em que a aplicação busca informações relevantes antes de pedir a resposta ao modelo – o resultado também depende da qualidade dos dados, da busca e das instruções ao modelo.
O Gemma 4 12B, por exemplo, foi projetado pelo Google para execução local e pode funcionar em laptops com 16 GB de memória. A família Ministral 3 oferece versões de 3, 8 e 14 bilhões de parâmetros voltadas a aplicações locais e dispositivos de borda. Já o Qwen3.8-27B é um modelo de 27 bilhões de parâmetros, disponível para execução em infraestrutura própria, ampliando a faixa de tamanhos representada nesses exemplos.
O gpt-oss-20b mostra como a arquitetura também influencia essa relação. Ele usa uma arquitetura chamada Mixture of Experts (MoE), na qual apenas algumas partes do modelo são acionadas durante o processamento. Com cerca de 21 bilhões de parâmetros no total, aproximadamente 3,6 bilhões ficam ativos a cada token. Segundo a OpenAI, ele pode operar em sistemas com 16 GB de memória.
Esses exemplos mostram que dizer que um modelo pode ser executado localmente não determina, por si só, o tipo de máquina necessária. Modelos diferentes podem exigir quantidades muito diferentes de memória e processamento.
A memória costuma ser o primeiro limite
A primeira pergunta é simples: o modelo cabe na memória disponível? Para uma estimativa inicial, o número de parâmetros e a precisão usada para armazenar os pesos ajudam a entender a ordem de grandeza.
A quantização representa os pesos do modelo com menor precisão, reduzindo o espaço necessário para armazená-los, em troca de uma possível perda de qualidade. A tabela a seguir mostra como a quantidade de memória muda conforme a precisão dos pesos:
| Parâmetros do modelo | Precisão dos pesos | ||
| 16 bits | 8 bits | 4 bits | |
| 8 bilhões | 16 GB | 8 GB | 4 GB |
| 12 bilhões | 24 GB | 12 GB | 6 GB |
| 20 bilhões | 40 GB | 20 GB | 10 GB |
| 32 bilhões | 64 GB | 32 GB | 16 GB |
| 70 bilhões | 140 GB | 70 GB | 35 GB |
Valores aproximados apenas para os pesos do modelo.
Além da memória para os pesos, é preciso reservar espaço para o software e, em modelos de linguagem, para manter o contexto já processado. Documentos maiores e várias solicitações simultâneas aumentam essa necessidade.
O gpt-oss é um exemplo prático. Seus pesos são distribuídos já quantizados; segundo a OpenAI, a versão de 20 bilhões de parâmetros pode operar com 16 GB de memória e a de 120 bilhões com 80 GB.
A memória unificada muda parte dessa conta
Em um computador com placa de vídeo dedicada, a CPU utiliza a memória principal e a GPU possui sua própria memória. Quando o modelo não cabe completamente na memória da GPU, alguns programas conseguem usar também a memória principal, mas a movimentação entre esses dois espaços pode reduzir o desempenho.
Em arquiteturas com memória unificada, CPU e GPU trabalham sobre um conjunto comum de memória. Isso pode ampliar a quantidade de memória disponível para o modelo em uma única máquina.
Essa arquitetura aparece em equipamentos presentes nos portfólios brasileiros de diferentes fabricantes. O HP ZBook Ultra G1a chega a 128 GB de memória unificada; o Lenovo ThinkStation PGX, baseado no NVIDIA GB10 Grace Blackwell, usa 128 GB; e o NVIDIA DGX Spark oferece a mesma capacidade. Na extremidade superior das máquinas de mesa, o Mac Studio com M5 Ultra pode chegar a 512 GB de memória unificada e 1,2 TB/s de largura de banda.
A memória unificada amplia o que pode caber em uma única máquina, mas a quantidade de memória não determina sozinha o tempo necessário para produzir uma resposta.
Memória e tempo de resposta precisam ser avaliados separadamente
Ter memória suficiente diz se o modelo cabe na máquina, mas o tempo necessário para produzir a resposta depende também da velocidade com que os dados circulam. A largura de banda da memória indica, de forma simplificada, quanto dado pode ser movimentado em determinado período.
Em modelos grandes, essa movimentação pode limitar o desempenho. Por isso, duas máquinas com quantidades de memória parecidas podem produzir respostas em tempos bem diferentes, mesmo que ambas consigam carregar o mesmo modelo.
CPU, GPU, NPU e o restante da máquina
A GPU é importante para IA porque executa muitos cálculos em paralelo. A CPU é responsável pelas tarefas gerais da aplicação e do sistema operacional, enquanto alguns computadores incluem também uma NPU, unidade especializada em determinados cálculos de inteligência artificial.
A Microsoft, por exemplo, estabelece uma NPU de 40 TOPS (trilhões de operações por segundo) ou mais como um dos requisitos para os Copilot+ PCs. Como referência, os modelos superiores da linha Intel Core Ultra Série 3 chegam a 50 TOPS na NPU. Esses números ajudam a comparar a capacidade das NPUs, mas não bastam para determinar se um modelo pode ser executado com o desempenho necessário.
O conjunto precisa funcionar em harmonia
A execução de um modelo depende do equilíbrio entre memória, capacidade de processamento, armazenamento e software. A quantidade de memória precisa comportar o modelo e o contexto; a largura de banda precisa permitir que os dados sejam movimentados com velocidade suficiente; CPU e aceleradores precisam ter desempenho compatível com a demanda. Quando o processamento ocorrer em um datacenter remoto, a rede também fará parte desse conjunto.
Duas máquinas com especificações aparentemente semelhantes podem, por isso, apresentar resultados bastante diferentes. Mais memória não compensa necessariamente um processamento insuficiente, assim como um acelerador mais potente pode não trazer o ganho esperado se outro componente se tornar o limite. Por isso, a comparação deve considerar o equilíbrio entre o modelo, a aplicação e a infraestrutura – e a melhor forma de verificá-lo é testar a aplicação real.
Testar antes de investir
Ao avaliar a infraestrutura necessária para um projeto de IA, a empresa pode contratar recursos por um período em um datacenter para experimentar modelos e configurações antes de decidir pela compra. Essa oferta existe tanto em provedores de nuvem tradicionais quanto nos chamados neoclouds, especializados em infraestrutura para IA. O Gartner projeta que os neoclouds poderão responder por 20% de um mercado de nuvem para IA estimado em US$ 267 bilhões em 2030.
O objetivo do teste é reduzir incertezas: saber se o modelo resolve a tarefa, quanta memória exige, quanto demora para responder e como se comporta com documentos maiores ou solicitações simultâneas. Um servidor com acelerador dedicado pode se comportar de forma diferente de uma workstation com memória unificada, mas ainda permite avaliar boa parte dessas questões.
Se houver dados confidenciais, a avaliação do ambiente contratado precisa considerar onde os dados são armazenados e processados, os controles oferecidos pelo provedor, as condições contratuais e os requisitos internos de segurança. No estudo da IBM, 68% dos executivos disseram considerar difícil atender requisitos de residência e soberania de dados em diferentes geografias.
Comprar, contratar ou combinar?
A compra tende a fazer mais sentido quando a demanda for estável e previsível, houver uma vantagem concreta em manter o ambiente sob controle direto e a organização dispuser de capital para o investimento inicial. A contratação reduz o desembolso inicial e facilita aumentar ou diminuir os recursos conforme a necessidade. Uma arquitetura híbrida pode combinar as duas opções.
Para uma empresa brasileira, também importa que o equipamento esteja presente no mercado local e possa ser adquirido por um canal de compra que ofereça suporte, garantia e documentação fiscal. HP ZBook Ultra G1a, HP Z2 Mini G1a, Lenovo ThinkStation PGX, NVIDIA DGX Spark e Mac Studio aparecem em páginas brasileiras de seus fabricantes. A Apple, por exemplo, lista o Mac Studio a partir de R$ 30.999.
A contratação oferece outra forma de desembolso. Em fornecedores de cloud, uma RTX 4090 com 24 GB é oferecida a partir de R$ 2,14 por hora, uma L40S com 48 GB a partir de R$ 4,88 por hora e uma A100 PCIe com 80 GB a partir de R$ 7,88 por hora. Como referência, manter uma RTX 4090 nessa tarifa durante um ano inteiro, 24 horas por dia, resultaria em cerca de R$ 18,7 mil. Esse cálculo considera apenas a tarifa por hora.
A comparação depende da frequência e da intensidade de uso, além das diferenças de desempenho entre as opções. Na compra, entram também energia, manutenção, suporte e tempo da equipe. Na contratação, o valor final dependerá do tempo de uso e dos recursos consumidos. Por isso, o preço de aquisição e a tarifa por hora não devem ser comparados isoladamente.
O equipamento precisa durar mais que o modelo
Ao comprar uma workstation, a empresa escolhe um equipamento que provavelmente terá de acomodar várias gerações de modelos e software ao longo de sua vida útil. Compatibilidade e flexibilidade importam tanto quanto o desempenho no primeiro dia.
Em algumas máquinas com memória unificada, a memória não pode ser ampliada depois da compra. Por isso, vale verificar esse ponto e prever alguma margem, sem tentar comprar capacidade para todas as necessidades imagináveis do futuro.
O software também precisa permitir mudanças. Uma infraestrutura poderosa pode se tornar restritiva se toda a aplicação depender de um único modelo, formato ou ecossistema. A discussão da IBM sobre dependências entre fornecedores, modelos e infraestrutura mostra por que a flexibilidade também deve entrar na decisão.
Conclusão
Executar IA em infraestrutura própria não significa necessariamente começar pela montagem de um datacenter. Uma empresa pode experimentar modelos em um computador individual, executar aplicações em uma workstation, contratar infraestrutura em um datacenter ou combinar diferentes ambientes.
Memória unificada, quantização e arquiteturas mais eficientes ampliam o que pode ser feito em uma única máquina. A viabilidade prática depende também da qualidade das respostas, do tempo de resposta, do tamanho do contexto e do número de usuários.
É preciso descobrir se a aplicação gera valor, qual modelo consegue resolvê-la e que requisitos de privacidade e controle existem. Depois vêm o dimensionamento do hardware e a escolha entre comprar, contratar ou combinar recursos. O objetivo é manter o nível de controle que faça sentido para a organização sem construir uma infraestrutura maior, mais cara ou mais complexa do que a solução exige.
Glossário rápido
Ajuste (fine-tuning) – treinamento adicional de um modelo existente para adaptá-lo a uma tarefa, domínio ou comportamento específico.
Borda (edge) – infraestrutura de computação próxima de onde os dados são gerados ou utilizados, reduzindo a dependência de um datacenter ou serviço remoto.
Inferência – execução de um modelo já treinado para gerar respostas, classificar informações, resumir documentos ou realizar outras tarefas.
MoE (Mixture of Experts) – arquitetura em que diferentes partes do modelo funcionam como especialistas e apenas algumas são acionadas durante o processamento.
Quantização – representação dos pesos do modelo com menor precisão para reduzir o uso de memória.
RAG (Retrieval-Augmented Generation) – técnica em que a aplicação busca informações relevantes antes de solicitar a resposta ao modelo.
Treinamento – processo de aprendizagem em que os parâmetros de um modelo são determinados ou atualizados a partir de dados. Treinar um modelo do zero geralmente exige muito mais recursos computacionais do que executar inferência ou realizar um ajuste.
Workstation – computador de alto desempenho voltado a aplicações profissionais que exigem mais capacidade de processamento ou memória que um computador pessoal convencional.
Sobre o autor
Jorge Ramos
Engenheiro de Software | Prill Tecnologia
Alerta
Os produtos e serviços citados foram selecionados entre as opções pesquisadas no mercado em setembro de 2026 por sua relevância para os cenários discutidos e não constituem recomendação para compra ou contratação.
Referências
- AMD ROCm – AI Inference on AMD Ryzen AI Max Processor. Explicação da arquitetura de memória unificada e do compartilhamento de memória entre CPU e GPU. Fonte oficial
- Apple Brasil – Comprar Mac. Referência de preço do Mac Studio no Brasil. Fonte oficial
- Apple Brasil – Mac Studio. Especificações de memória unificada e largura de banda. Fonte oficial
- Deloitte – State of AI in the Enterprise 2026: The Untapped Edge. Pesquisa com 3.235 líderes de negócios e tecnologia de 24 países e dados sobre IA soberana. Relatório completo
- Gartner – Neocloud Providers Will Capture 20% of the $267 Billion AI Cloud Market by 2030. Projeção sobre provedores especializados em infraestrutura para IA. Fonte oficial
- Google – Introducing Gemma 4 12B. Informações sobre execução local e requisitos de memória. Fonte oficial
- HP Brasil – Workstations HP Z. Página brasileira que inclui a workstation HP Z2 Mini G1a. Fonte oficial
- HP Brasil – ZBook Ultra G1a. Especificações, incluindo memória unificada de até 128 GB. Fonte oficial
- Hugging Face – Big Model Inference. Uso de GPU, memória da CPU e armazenamento quando um modelo não cabe integralmente no acelerador. Documentação
- Hugging Face – Caching. Funcionamento do KV cache e crescimento do uso de memória conforme o contexto processado. Documentação
- Hugging Face – Quantization concepts. Conceitos de quantização e efeitos sobre memória, precisão e largura de banda. Documentação
- IBM – AI sovereignty isn’t owning the stack. It’s staying in control when conditions change. Discussão sobre soberania baseada em controle, dependências e capacidade de adaptação. Fonte oficial
- IBM – estudo sobre dependências, residência e soberania de dados. Pesquisa com 1.000 executivos e os indicadores citados no artigo. Fonte oficial
- IBM Institute for Business Value – The calculus of AI sovereignty. Estudo sobre soberania, controle e dependências na infraestrutura de IA. Estudo
- Intel – AI PCs. Explicação das funções de CPU, GPU e NPU em sistemas voltados à IA. Fonte oficial
- Intel – Core Ultra Série 3. Referência para NPUs de até 50 TOPS nos modelos superiores da linha. Fonte oficial
- Lenovo – ThinkStation PGX Product Specifications Reference. Especificações do NVIDIA GB10 Grace Blackwell e dos 128 GB de memória unificada. PSREF oficial
- Lenovo Brasil – ThinkStation PGX. Página brasileira da workstation. Fonte oficial
- Microsoft – documentação sobre NPU e Copilot+ PCs. Referência para NPUs e o requisito de 40 TOPS ou mais. Microsoft Learn
- Microsoft – Geração Aumentada por Recuperação (RAG) e índices. Conceitos de RAG, recuperação de informações e geração de respostas fundamentadas nos dados recuperados. Microsoft Learn
- Mistral AI – Introducing Mistral 3. Informações sobre os modelos Ministral 3 de 3B, 8B e 14B voltados a aplicações locais e à execução em dispositivos de borda. Fonte oficial
- NVIDIA Brasil – DGX Spark. Especificações do sistema, incluindo NVIDIA GB10 e 128 GB de memória unificada. Fonte oficial
- OpenAI – Apresentamos o gpt-oss. Arquitetura MoE, número de parâmetros ativos, quantização MXFP4 e requisitos de memória. Fonte oficial
- Qwen – Qwen3.8-27B. Modelo de 27 bilhões de parâmetros e instruções para execução com frameworks de inferência. Página oficial do modelo

