Quanta energia consome a IA? Um simples pedido de texto usa cerca de 0,24 watt-hora, o valor oficial da Google para um pedido mediano ao Gemini, até cerca de 0,34 watt-hora para uma consulta média ao ChatGPT. É aproximadamente o que um forno usa num segundo. O modelo escolhido muda tudo. Para um chatbot construído especificamente em torno de modelos mais leves e de baixo consumo, consulte a nossa análise do GreenPT. Um benchmark independente de 2025 colocou o Claude Sonnet em cerca de 2,8 Wh para um pedido médio, o DeepSeek-V3 perto de 2 Wh para um pedido médio, e o raciocínio do DeepSeek-R1 em cerca de 29 Wh, o mesmo nível pesado que os modelos da classe GPT-5. As estimativas credíveis por pedido abrangem mais de 65x. À escala global, os centros de dados consumiram cerca de 415 terawatt-hora de eletricidade em 2024 e prevê-se que esse valor duplique até 2030.
Este guia fornece números verificados para cada versão da pergunta: por pedido, por modelo, por ano e por centro de dados, com Gemini, ChatGPT, Claude, DeepSeek, Grok e modelos open source todos medidos lado a lado. Cada valor tem data e é atribuído à sua fonte. Verá por que razão o modelo mais barato de comprar não é o mais barato de executar, por que os valores diferem tão amplamente, e que afirmações virais foram exageradas. Também verá como o consumo de IA se compara a uma pesquisa no Google ou a uma hora de streaming, e a única mudança que realmente reduz a sua pegada. Apresentamos dados, não alarme, e dizemos o que os dados ainda não revelam. Para a conclusão final, veja se a IA é prejudicial para o ambiente.
As Conclusões Principais
- Um pedido normal é pequeno: ~0,24 a 0,34 Wh. O valor oficial da Google de 2025 para um pedido de texto mediano ao Gemini é 0,24 Wh; Sam Altman da OpenAI indica 0,34 Wh para uma consulta média ao ChatGPT, cerca do que um forno usa num segundo.
- Barato de comprar não significa barato de executar. Num benchmark consistente de 2025, o DeepSeek-R1 usou cerca de 29 Wh por pedido enquanto o DeepSeek-V3 ficou perto de 2 Wh, em comparação com cerca de 2,8 Wh para o Claude Sonnet e 1,2 Wh para o GPT-4o. O preço baixo de API do DeepSeek esconde um elevado consumo de energia de inferência.
- Os modelos de raciocínio custam 10 a 65x mais. Uma resposta média da classe GPT-5 está estimada em ~18 Wh e até 40 Wh, o mesmo nível do DeepSeek-R1 e do o3, razão pela qual as estimativas credíveis abrangem mais de 65x entre modelos.
- O Grok e o GPT-5.5 não têm valores oficiais. Nem a xAI nem a OpenAI publicam uma figura de energia por consulta para os seus modelos de topo atuais, pelo que qualquer afirmação específica de watt-hora para o Grok ou o GPT-5.5 é uma estimativa, não uma divulgação.
- Os centros de dados globais usaram cerca de 415 TWh em 2024, aproximadamente 1,5% da eletricidade mundial; a AIE projeta que esse valor duplique para ~945 TWh até 2030, perto do consumo elétrico anual total do Japão.
- A escolha do modelo é a maior alavanca sob o seu controlo. Enviar uma pergunta simples a um modelo de raciocínio de fronteira pode usar cerca de 10x a 65x mais energia do que um modelo eficiente que dê uma resposta igualmente boa.
Quanta energia consome a IA por pedido?
Para uma pergunta de texto normal num modelo eficiente, a resposta honesta é cerca de 0,24 a 0,34 watt-hora. O limite inferior é o valor oficial da Google de 2025 para um pedido mediano ao Gemini; o limite superior é o número que o CEO da OpenAI, Sam Altman, publicou para uma consulta média ao ChatGPT. Ambos são pequenos, cerca do que um micro-ondas usa num segundo. Os valores mais assustadores provêm de uma realidade diferente. O modelo e o comprimento do pedido alteram a resposta por ordens de magnitude, pelo que um único valor «por pedido» esconde uma amplitude de mais de 65x quando o Claude, o DeepSeek e os modelos de raciocínio entram na tabela.
Tabela Comparativa
| Modelo / estimativa | Energia por pedido | Equivale aproximadamente a | O que é contabilizado | Fonte e ano |
|---|---|---|---|---|
| Google Gemini (pedido de texto mediano) | ~0,24 Wh | um portátil durante ~17 segundos | Arrefecimento + sobrecarga total do centro de dados | Google, ago. 2025 |
| ChatGPT (consulta média) | ~0,34 Wh | um forno durante ~1 segundo | Valor indicado pela OpenAI | Sam Altman, jun. 2025 |
| GPT-4o (consulta típica) | ~0,3 Wh | uma pesquisa no Google | Estimativa de computação GPU | Epoch AI, fev. 2025 |
| Claude Sonnet (pedido médio) | ~2,8 Wh (0,8 a 5,5) | uma lâmpada de 60W durante ~3 minutos | Benchmark de inferência independente | Jegham et al., mai. 2025 |
| DeepSeek-V3 (pedido médio) | ~2 Wh | uma lâmpada de 60W durante ~2 minutos | Benchmark de inferência independente | Jegham et al., mai. 2025 |
| DeepSeek-R1 (raciocínio) | ~29 Wh | ~120 pedidos eficientes ao Gemini | Benchmark de inferência independente | Jegham et al., mai. 2025 |
| GPT-5 / classe de raciocínio (médio) | ~18 Wh (até 40) | uma lâmpada durante ~2 horas | Estimativa de computação GPU | URI AI Lab, ago. 2025 |
| Grok / GPT-5.5 (modelos de topo atuais) | Não divulgado | n/d | Sem valor oficial publicado | xAI / OpenAI, 2026 |
Uma ressalva mantém isto honesto. Os valores da Google e da OpenAI medem um pedido mediano eficiente; o benchmark independente «How Hungry is AI?» de Jegham e colegas mede pedidos médios e longos realistas em muitos modelos com toda a sobrecarga, razão pela qual os seus valores são mais elevados. Não são contraditórios, têm âmbitos diferentes, e a secção abaixo mostra como interpretar ambos.
Google Gemini: cerca de 0,24 Wh por pedido
Em agosto de 2025 a Google publicou a medição mais detalhada de parte da empresa até ao momento, com base em dados de produção de maio de 2025. Concluiu que um pedido de texto mediano ao Google Gemini usa 0,24 watt-hora de energia e emite 0,03 gramas de CO2 equivalente. De forma crucial, esse valor não é um caso ótimo selecionado a dedo, pois o método da Google inclui arrefecimento, capacidade de reserva inativa, CPU, RAM e sobrecarga do centro de dados, o que o torna um dos números únicos mais honestos disponíveis. Pode ler o método no relatório de impacto ambiental da Google.
ChatGPT e GPT-5.5: cerca de 0,34 Wh por consulta, modelo de topo não divulgado
Numa publicação de blogue de junho de 2025, o CEO da OpenAI Sam Altman escreveu que uma consulta média ao ChatGPT usa 0,34 watt-hora, o que um forno usaria em pouco mais de um segundo. É o primeiro dado oficial da OpenAI, não foi revisto por pares, e a empresa nunca definiu o que conta como uma consulta «média». Trabalho independente confirma a ordem de grandeza, com o instituto de investigação Epoch AI a estimar uma consulta típica ao GPT-4o em cerca de 0,3 Wh.
Esse valor de 0,34 Wh é anterior ao modelo de topo atual. O GPT-5.5 foi lançado em abril de 2026 e tornou-se o modelo predefinido do ChatGPT em maio de 2026, mas a OpenAI não publicou nenhuma figura de energia por consulta para ele. Como o GPT-5.5 encaminha mais consultas através de raciocínio, a expectativa realista é mais alta do que 0,34 Wh para qualquer coisa que desencadeie pensamento prolongado, mais próxima do nível pesado abaixo do que da mediana eficiente.
Claude: sem valor oficial, cerca de 1 a 5 Wh em benchmarks
A Anthropic não publica uma figura de energia por pedido para o Claude, pelo que todos os valores do Claude são estimativas externas. O mais rigoroso é o benchmark de inferência de Jegham et al. (maio de 2025), que mediu o Claude Sonnet em cerca de 0,8 Wh para um pedido curto, 2,8 Wh para um médio e 5,5 Wh para um longo. O AI Index de 2026 de Stanford chega à mesma conclusão por um método diferente, colocando um modelo Claude de topo próximo da extremidade eficiente dos modelos de fronteira para um pedido médio. O mesmo benchmark classificou o Claude Sonnet como o modelo mais eficiente em termos energéticos no geral, mantendo constante a qualidade das respostas. O Claude fornece respostas sólidas sem a fatura energética descontrolada de um modelo de raciocínio puro.
DeepSeek: barato de comprar, caro de executar
O DeepSeek é o exemplo mais claro de por que preço e energia não são a mesma coisa. A sua API está entre as mais baratas de qualquer modelo de fronteira. No entanto, o benchmark de Jegham mediu o DeepSeek-V3 em cerca de 2 Wh para um pedido médio, enquanto o DeepSeek-R1 com afinação para raciocínio atingiu 29 Wh, entre os modelos mais intensivos em energia testados e muito acima do Claude ou do GPT-4o. O AI Index de 2026 de Stanford encontrou o mesmo padrão, com um modelo DeepSeek a usar várias vezes mais energia por pedido do que um modelo Claude de topo para trabalho comparável.
O mais recente DeepSeek V4, lançado no final de abril de 2026, usa um design de mistura de peritos com 1,6 biliões de parâmetros, com apenas cerca de 49 mil milhões de parâmetros ativos por token (e uma variante Flash de 284B com ~13B ativos), o que o DeepSeek afirma reduzir acentuadamente o custo de inferência. É uma história de eficiência credível no papel, mas ainda não existe nenhuma figura independente de watt-hora por consulta para o V4, por isso trate qualquer afirmação específica de energia do V4 como não verificada por agora.
Grok: valor por pedido não divulgado, a escala do centro de dados é o sinal real
A xAI não publica nenhuma figura de energia por consulta para o Grok, e os intervalos credíveis de terceiros são amplos, desde uma fração de watt-hora para uma consulta simples até vários watt-hora para raciocínio pesado ou execuções agênticas. O sinal mais concreto do Grok é a infraestrutura. O supercomputador Colossus da xAI em Memphis foi reportado na casa das centenas de megawatt, e análises de satélite colocam o mais recente Colossus 2 na gama de gigawatts, a escala à qual um único cluster de IA rivaliza com o consumo elétrico de uma cidade de tamanho médio. Para o Grok, a resposta honesta é que o número por pedido é desconhecido e a pegada ao nível dos sistemas é grande e cresce rapidamente.
Modelos open source: a extremidade eficiente do intervalo
Modelos open source mais pequenos situam-se na extremidade eficiente. No mesmo benchmark, um Llama 3.2 de 1 mil milhão de parâmetros usou cerca de 0,07 Wh para um pedido curto, enquanto o muito maior Llama 3.1 405B usou cerca de 9 Wh para um médio. A conclusão é consistente entre fornecedores: o tamanho e a profundidade de raciocínio impulsionam a energia muito mais do que a empresa que construiu o modelo, razão exata pela qual adaptar o modelo à tarefa é importante.
Por que as estimativas de energia da IA divergem tanto?
A maior parte da confusão vem do que cada número contabiliza. Um valor baixo como 0,24 Wh da Google mede a eletricidade para executar os chips, mais arrefecimento e sobrecarga para um pedido mediano eficiente. Um valor assustador conta um modelo de raciocínio pesado, um pedido longo, o consumo total de energia do centro de dados e, por vezes, a energia para construir o hardware. Âmbitos diferentes produzem números que diferem em mais de 65x, sendo todos tecnicamente corretos.
A arquitetura do modelo é o segundo fator. Um modelo denso executa todos os parâmetros para cada token, enquanto um modelo de mistura de peritos como o DeepSeek V4 ativa apenas uma fatia, pelo que dois modelos com tamanho total semelhante podem diferir enormemente em energia. Os modos de raciocínio acrescentam uma terceira camada. Um modelo que «pensa» antes de responder pode gerar várias vezes mais tokens do que uma resposta direta, razão pela qual o DeepSeek-R1 e os modelos da classe o3 ficam perto dos 20 a 40 Wh enquanto o GPT-4o fica perto de 1 Wh no mesmo teste.
O último fator é treino versus inferência. O treino é uma execução única e muito grande; treinar o GPT-3 usou uma estimativa de 1.287 megawatt-hora, e treinar o GPT-4 é estimado em cerca de 50 gigawatt-hora. A inferência é a eletricidade gasta cada vez que envia um pedido, e como um modelo popular responde a milhares de milhões de pedidos por dia, a inferência domina agora o consumo total de energia da IA. O amplamente citado valor de 2,9 Wh «dez vezes uma pesquisa no Google» data de estimativas iniciais que foram posteriormente revistas para baixo por aproximadamente uma ordem de grandeza, razão pela qual continua a colidir com números mais recentes de fontes oficiais. Este é um dos mitos mais persistentes sobre o consumo de energia da IA.
Quanta energia consomem os centros de dados de IA?
Por pedido os números são pequenos, mas o agregado é de escala nacional. Segundo o relatório Energia e IA da AIE, os centros de dados globais consumiram cerca de 415 terawatt-hora de eletricidade em 2024, aproximadamente 1,5% da eletricidade mundial. O cenário base da AIE projeta que esse valor duplique para cerca de 945 TWh até 2030, pouco menos de 3% da eletricidade global e próximo do uso anual total do Japão. Os servidores acelerados por IA são a componente de crescimento mais rápido, cerca de 30% por ano.
| Métrica | Valor | Ano | Fonte |
|---|---|---|---|
| Eletricidade global de centros de dados | ~415 TWh (~1,5% do total mundial) | 2024 | AIE |
| Centros de dados globais, projetado | ~945 TWh (~3% do total mundial) | 2030 | AIE, cenário base |
| ChatGPT, energia anual estimada | ~310 GWh (≈ 29.000 casas nos EUA) | 2025 | IEEE Spectrum |
| Toda a IA generativa | ~15 TWh | 2025 | IEEE Spectrum |
| Toda a IA generativa, projetado | ~347 TWh | 2030 | IEEE Spectrum |
| Centros de dados dos EUA, quota da eletricidade dos EUA | ~4,4% | 2023 | MIT Technology Review |
Também verá títulos que afirmam que os centros de dados atingirão mais de 1.000 TWh até 2026. Esse valor provém do relatório de eletricidade de 2024 da AIE, uma projeção mais rápida a curto prazo; o relatório mais detalhado de Energia e IA de 2025 da AIE fixou-se no cenário base de ~945 TWh até 2030 usado acima. A trajetória, e não o título de um único ano, é a verdadeira história. Nos EUA especificamente, os centros de dados já consumiam cerca de 4,4% de toda a eletricidade em 2023, com mais de metade projetada para IA até 2028.
Isso é realmente muito? O consumo de energia da IA comparado com outras coisas
Para um indivíduo, um pedido eficiente de IA é um erro de arredondamento no consumo de energia diário. A própria Google enquadra um pedido de 0,24 Wh como aproximadamente a energia de ver televisão durante menos de nove segundos. A conclusão individual honesta é que o uso quotidiano de chatbots eficientes é negligenciável em comparação com um único duche quente ou uma curta viagem de automóvel. Uma hora de streaming de vídeo usa dezenas de watt-hora, superando facilmente centenas de pedidos eficientes. A exceção é o raciocínio pesado, onde uma única resposta do DeepSeek-R1 ou de um modelo da classe GPT-5 pode equivaler a mais de cem pedidos eficientes por si só.
| Atividade | Energia | Equivalente |
|---|---|---|
| Um pedido eficiente de IA (Gemini) | ~0,24 Wh | um portátil durante ~17 segundos |
| Uma pesquisa no Google | ~0,3 Wh | semelhante a um pedido eficiente de IA |
| Uma consulta média ao ChatGPT | ~0,34 Wh | um forno durante ~1 segundo |
| Um pedido médio ao Claude Sonnet | ~2,8 Wh | ~12 pedidos eficientes |
| Um pedido de raciocínio ao DeepSeek-R1 | ~29 Wh | ~120 pedidos eficientes |
| Uma resposta pesada da classe GPT-5 | ~18 Wh | ~75 pedidos eficientes |
| Streaming de 1 hora de vídeo | dezenas de Wh | centenas de pedidos eficientes |
O problema está na escala e na concentração. Pedidos individualmente negligenciáveis somam ~15 TWh em toda a IA generativa em 2025, projetados para perto de 347 TWh até 2030, e essa carga recai sobre redes regionais específicas em vez de se distribuir uniformemente. Por isso, a resposta individual («quase nada») e a resposta sistémica («uma pressão crescente na rede») são ambas verdadeiras, razão exata pela qual o tema é tão fácil de apresentar em qualquer direção.
A IA está a tornar-se mais eficiente em termos energéticos?
Por pedido, sim, e rapidamente. A Google relatou que a energia de um pedido mediano ao Gemini caiu cerca de 33 vezes em doze meses graças a melhores modelos, hardware e software. Os designs de mistura de peritos como o DeepSeek V4 empurram na mesma direção ao ativar apenas uma fração dos parâmetros por token. O problema é o efeito Jevons, onde uma IA mais barata e melhor é usada muito mais, pelo que o consumo total continua a crescer mesmo que cada pedido fique mais limpo.
Essa tensão é o núcleo de para onde a IA está a caminhar em 2026. Os ganhos de eficiência são reais e grandes, mas os sistemas agênticos mudam a matemática, porque um pedido a um agente de IA pode ramificar-se em dezenas de chamadas de modelo encadeadas. Os valores eficientes por pedido não captam um fluxo de trabalho que silenciosamente executa um modelo de raciocínio cinquenta vezes para completar uma tarefa, que é a próxima lacuna de medição que os dados públicos mal começaram a abordar.
A única alavanca sob o seu controlo: a escolha do modelo
A coisa mais eficaz que um indivíduo controla é qual o modelo que responde à pergunta, porque a diferença entre modelos é enorme. Enviar uma consulta simples a um modelo de raciocínio de fronteira pode usar cerca de 10x a 65x mais energia do que um modelo eficiente que dê uma resposta igualmente boa, e como a tabela acima mostra, essa diferença mantém-se no Claude, no DeepSeek, no Gemini e nos modelos da classe GPT. Adaptar o modelo à tarefa faz mais do que qualquer quantidade de otimização de pedidos. Comparações como DeepSeek vs ChatGPT, ChatGPT vs Gemini, e o nosso guia dos modelos de IA mais capazes mostram o quanto os perfis de eficiência diferem realmente. O nosso resumo dos modelos de IA mais ecológicos cobre as ferramentas mais verdes a escolher.
Na prática, isso significa usar por defeito um modelo mais leve para perguntas do dia a dia e reservar os modelos de raciocínio pesados para problemas que os exijam. Executar vários modelos a partir de um único lugar torna «escolher a ferramenta certa» algo realista em vez de teórico. É esse o objetivo de uma configuração multi-modelo como a do nosso guia de introdução ao Fello AI, onde uma subscrição dá-lhe Claude, ChatGPT, Gemini, Grok e DeepSeek lado a lado. A opção eficiente está a um toque da opção pesada. Nada disto requer culpa; significa apenas usar a opção pesada deliberadamente em vez de por defeito.
Conclusão
Então, quanta energia consome a IA? Um pedido normal num modelo eficiente é realisticamente 0,24 a 0,34 watt-hora, mas o modelo importa mais do que qualquer outra coisa, com o Claude Sonnet perto de 2,8 Wh, o DeepSeek-R1 perto de 29 Wh, e o raciocínio da classe GPT-5 em 18 Wh ou mais, uma amplitude de mais de 65x. À escala os números são grandes e crescem rapidamente, com os centros de dados globais em cerca de 415 TWh em 2024 e previstos para duplicar até 2030. O próximo passo mais útil não é parar de usar IA; é ser deliberado sobre qual o modelo a que recorre, começando por uma visão clara de como os modelos principais diferem realmente.
FAQ
Quanta energia usa um pedido ao ChatGPT?
Cerca de 0,34 watt-hora para uma consulta média, o valor que o CEO da OpenAI, Sam Altman, publicou em junho de 2025, aproximadamente o que um forno usa num segundo. Esse número é anterior ao GPT-5.5, que é agora o modelo predefinido e não tem nenhuma figura publicada por consulta, pelo que as respostas com raciocínio intensivo provavelmente usam consideravelmente mais.
Qual o modelo de IA que usa mais energia?
Entre os modelos amplamente testados, os modelos de raciocínio lideram. Num benchmark consistente de 2025, o DeepSeek-R1 usou cerca de 29 Wh e os modelos da classe o3 atingiram 20 a 40 Wh para pedidos médios a longos, em comparação com cerca de 2,8 Wh para o Claude Sonnet e cerca de 1 Wh para o GPT-4o. O DeepSeek é barato de comprar, mas caro de executar.
Um pedido de IA usa mais energia do que uma pesquisa no Google?
Não para modelos eficientes. Os valores oficiais de 2025 colocam um pedido normal de IA em cerca de 0,24 a 0,34 Wh, aproximadamente o mesmo que uma pesquisa na web. A antiga afirmação de «dez vezes uma pesquisa no Google» provinha de estimativas iniciais que foram posteriormente revistas em baixa. No entanto, pedidos de raciocínio pesado podem usar muito mais do que uma pesquisa.
Quanta eletricidade usam os centros de dados de IA?
Os centros de dados globais usaram cerca de 415 TWh em 2024, aproximadamente 1,5% da eletricidade mundial. A AIE projeta que esse valor duplique para cerca de 945 TWh até 2030, próximo do uso nacional total do Japão, com a IA como o fator de crescimento mais rápido.
Qual o modelo de IA mais eficiente em termos energéticos?
Os modelos mais pequenos e eficientes são muito mais eficientes do que os modelos de raciocínio de fronteira, muitas vezes por 10x ou mais para uma resposta quotidiana comparável. Entre os principais modelos de chat, o Claude Sonnet obteve a melhor pontuação de eficiência energética mantendo constante a qualidade das respostas. A maior poupança sob o seu controlo é adaptar o modelo à tarefa, e ferramentas que privilegiam a pesquisa como a pesquisa de IA ecológica da Ecosia usam por defeito modelos mais pequenos.