Pular para o conteúdo
Tecnologia

Menos bits, menos parâmetros ativos e menos cálculos: a batalha para reduzir o custo da inteligência artificial

A corrida pela inteligência artificial esbarra em eletricidade, hardware e custos crescentes. Pesquisadores estão atacando o problema por outro caminho: reduzir o trabalho necessário para cada resposta.
Por

Tempo de leitura: 3 minutos

Quando pensamos no enorme consumo de recursos da inteligência artificial, a imagem costuma ser a mesma: data centers gigantescos, milhares de GPUs e sistemas de refrigeração funcionando sem parar. Mas existe outra variável capaz de mudar significativamente essa conta. Se os algoritmos precisarem realizar menos operações para chegar ao mesmo resultado, cada tarefa poderá exigir menos hardware, energia e dinheiro — algo que está se tornando cada vez mais importante à medida que a IA se espalha pelas empresas.

O custo da IA começa a limitar até quem gostaria de utilizá-la mais

Um modelo de inteligência artificial não consome energia sozinho. São os chips que executam bilhões de operações matemáticas para fazê-lo funcionar.

Mas a quantidade dessas operações depende diretamente de como o software foi projetado.

Um algoritmo mais eficiente pode executar determinada tarefa com menos cálculos, movimentar menos dados pela memória e exigir menos capacidade computacional.

Para as empresas, isso significa uma coisa bastante concreta: dinheiro.

Segundo uma pesquisa global da McKinsey publicada em 2026, 89% das organizações consultadas afirmaram utilizar regularmente inteligência artificial em pelo menos uma função empresarial. Ao mesmo tempo, aproximadamente uma em cada cinco disse já ter limitado o uso por causa dos custos operacionais, incluindo aqueles associados ao processamento de tokens.

E essa pressão pode aumentar com a expansão dos agentes de IA.

Diferentemente de uma interação simples, na qual alguém faz uma pergunta e recebe uma resposta, agentes podem trabalhar durante períodos prolongados, consultar diversas fontes, repetir operações e executar várias etapas antes de concluir uma tarefa.

Cada uma dessas ações consome computação.

Por isso, pesquisadores estão tentando atacar o problema antes mesmo de a operação chegar aos chips.

Uma das estratégias é perguntar algo aparentemente simples: todos os cálculos realmente precisam ser feitos com a mesma precisão?

Fazer contas menos precisas pode tornar a IA muito mais eficiente

Computadores podem representar números utilizando diferentes quantidades de bits.

Em vez de executar todas as operações com representações de 32 ou 64 bits, alguns sistemas de IA conseguem trabalhar com 16 bits, 8 bits ou até menos em determinadas etapas.

Reduzir a precisão significa utilizar menos memória, transferir menos dados e exigir menos operações do hardware.

O desafio está em descobrir até onde isso pode ser feito sem comprometer significativamente a qualidade.

A tolerância também depende da aplicação. Uma pequena diferença pode ser irrelevante em um sistema de recomendação de filmes, mas inaceitável em determinadas aplicações médicas.

Há outras estratégias.

Desenvolvedores podem reaproveitar partes de modelos previamente treinados, atualizar apenas uma fração dos parâmetros durante novos treinamentos ou construir arquiteturas capazes de ativar somente os componentes necessários para cada tarefa.

Um exemplo conhecido dessa última abordagem apareceu com o DeepSeek-V3.

O modelo utiliza uma arquitetura chamada Mixture-of-Experts. Embora possua 671 bilhões de parâmetros, aproximadamente 37 bilhões são ativados para processar cada token.

Em vez de mobilizar toda a rede para qualquer operação, o sistema direciona cada entrada aos componentes especializados considerados relevantes.

A DeepSeek informou que o treinamento final do V3 exigiu cerca de 2,788 milhões de horas de GPU Nvidia H800. O número, porém, não inclui todo o trabalho anterior de pesquisa, testes e infraestrutura.

Economizar cálculos pode importar tanto quanto construir GPUs melhores

A busca por eficiência acontece enquanto o consumo energético dos data centers cresce rapidamente.

Segundo a Agência Internacional de Energia (IEA), essas instalações consumiram aproximadamente 415 TWh de eletricidade em 2024, cerca de 1,5% da demanda mundial.

No cenário central da agência, esse número pode chegar a aproximadamente 945 TWh em 2030, pouco menos de 3% do consumo global projetado.

Nem toda essa eletricidade será destinada à inteligência artificial, mas a expansão da IA é um dos fatores que pressionam a demanda dos centros de dados.

Isso explica por que a corrida tecnológica não acontece apenas entre fabricantes tentando produzir GPUs mais rápidas e eficientes.

Existe outra competição acontecendo dentro do próprio código.

Cada parâmetro que não precisa ser ativado, cada transferência de memória evitada e cada operação que pode ser executada com menor precisão representa trabalho que o hardware deixa de realizar.

A resposta ao problema do custo da IA, portanto, provavelmente não virá de uma única tecnologia.

Novos chips continuarão sendo fundamentais. Data centers também precisarão melhorar refrigeração, infraestrutura e fornecimento energético.

Mas existe uma conclusão cada vez mais relevante: a maneira mais barata de executar um cálculo pode ser descobrir que ele nem precisava ser feito.

Partilhe este artigo

Artigos relacionados