O fim do resfriamento reativo em potências acima de 100 kW.
Publicado em 27 de julho de 2026,
by
Quando um cluster de treinamento de inteligência artificial (IA) é inicializado, sua carga de trabalho não aumenta gradualmente. A dissipação térmica aumenta instantaneamente. Um rack cheio de GPUs de alto desempenho passa da ociosidade à utilização máxima em uma fração de segundo, consumindo quantidades enormes de energia e irradiando calor intenso.
Durante décadas, os operadores de data centers gerenciaram as cargas térmicas de forma reativa. Um sensor detectava um aumento de temperatura e a instalação respondia ligando ventiladores, abrindo válvulas ou injetando mais água gelada na sala. Essa abordagem funcionava bem o suficiente para a computação empresarial tradicional.
Hoje, essa abordagem reativa está efetivamente morta.
À medida que a densidade de racks ultrapassa 100 kW, os métodos de resfriamento tradicionais não conseguem acompanhar a velocidade vertiginosa dos picos térmicos da IA. O resfriamento a ar atinge um limite máximo de aproximadamente 30 kW por rack. Para sobreviver à era moderna da IA, os data centers dependem de Unidades de Distribuição de Refrigerante (CDUs) líquido-líquido e sistemas de resfriamento direto no chip. No entanto, mesmo o resfriamento líquido se mostra insuficiente se o sistema de controle demorar a reação para que o calor chegue.
Para proteger equipamentos caros e evitar o desperdício de energia, os data centers precisam mudar sua estratégia. Eles necessitam de resfriamento preditivo para IA. Ao utilizar sinais preditivos de carga da infraestrutura de TI, os gerentes de instalações podem pré-resfriar os circuitos de fluidos e ajustar os sistemas de refrigeração antes que a carga computacional atinja o pico.
A Onda de Choque da Inteligência Artificial: Por que mais de 100 kW mudam tudo
As cargas de trabalho de inteligência artificial são excepcionalmente exigentes. Ao contrário dos servidores web padrão, que experimentam ondas de tráfego previsíveis e contínuas, os modelos de aprendizado de máquina executam tarefas de processamento paralelas e massivas simultaneamente.
Quando um cientista de dados inicia uma sequência de treinamento de um modelo de linguagem (LLM) de grande porte, milhares de GPUs são acionadas simultaneamente. De acordo com relatórios da Data Center Dynamics (DCD) , essa demanda instantânea cria uma "onda de choque" térmica dentro do data center. O consumo de energia em um único gabinete pode disparar instantaneamente de uma base de alguns quilowatts para bem mais de 100 quilowatts.
Pesquisas do JLL Global Data Center Outlook confirmam que esse rápido aumento na densidade de racks está se tornando o novo padrão. Instalações que antes tinham uma média de 5 kW a 10 kW por rack agora estão sendo modernizadas para suportar configurações de 50 kW, 80 kW e mais de 100 kW para acomodar clusters de silício da Nvidia, AMD e personalizados.
Por que o resfriamento a ar atinge um limite
Com 100 kW, o resfriamento a ar deixa de ser uma questão de retornos decrescentes; ele viola as leis da termodinâmica. O ar não possui a densidade e a capacidade térmica necessárias para dissipar a energia térmica gerada por servidores de IA compactados.

- Limites de fluxo de ar: Para resfriar um rack de 100 kW com ar, seriam necessários ventos com força de furacão soprando através do gabinete. Isso arrancaria os cabos de seus conectores e danificaria componentes delicados.
- Danos acústicos: Ventoinhas de servidores de alta velocidade operando em capacidade máxima geram níveis de ruído superiores a 100 decibéis. Vibrações acústicas de alta frequência podem degradar o desempenho de discos rígidos e interferir em equipamentos de rede óptica.
- Ineficiência: O resfriamento a ar exige ventiladores enormes do sistema de ar condicionado da sala de computadores (CRAH) funcionando em velocidade máxima. Isso aumenta o... Eficácia do uso de energia (PUE) e desperdiça enormes quantidades de eletricidade.
O Uptime Institute observa consistentemente que ultrapassar 30 kW exige refrigeração líquida. O líquido retém aproximadamente 3,000 vezes mais calor por volume do que o ar. Sistemas de refrigeração direta ao chip e unidades de refrigeração líquido-líquido levam o fluido refrigerante diretamente à fonte de calor, evitando as ineficiências da movimentação de grandes volumes de ar.
A armadilha de resfriamento reativo
A atualização para refrigeração líquida resolve o problema de capacidade, mas não resolve o problema de temporização.

Em um data center padrão com resfriamento reativo, a sequência de eventos se parece com isto:
- O gatilho: O processo de treinamento de IA começa. As GPUs atingem instantaneamente a temperatura máxima.
- O atraso: Os componentes aquecidos aquecem o circuito de líquido circundante. O líquido aquecido percorre os tubos de volta à CDU.
- A Detecção: Um sensor térmico dentro da CDU detecta o aumento da temperatura da água de retorno.
- A resposta: O sistema de gerenciamento de instalações comanda o circuito principal de água gelada para aumentar o fluxo e instrui a central de resfriamento a acelerar o processo.
- A recuperação: Água mais fria finalmente chega à prateleira para estabilizar as temperaturas.
Esse ciclo reativo cria uma lacuna de tempo perigosa. De acordo com o Data Center Knowledge , essa lacuna pode durar de 30 segundos a vários minutos, dependendo do comprimento da tubulação e do projeto do sistema.
Durante esse período de latência, as GPUs superaquecem. Para evitar danos físicos, os chips acionam o controle térmico. Eles reduzem artificialmente a velocidade de seus clocks para gerar menos calor.
A limitação térmica anula completamente o propósito de investir em hardware de IA caro. Se o seu cluster de GPUs de milhões de dólares tiver sua taxa de desempenho reduzida em 30% a cada pico de carga de trabalho, você estará perdendo uma quantidade enorme de capacidade computacional. Além disso, a exposição repetida a picos térmicos degrada o silício ao longo do tempo, reduzindo a vida útil da sua infraestrutura crítica.
Comparando estratégias de resfriamento de data centers
Para entender a evolução do gerenciamento térmico, precisamos analisar como diferentes sistemas lidam com um pico repentino de carga de trabalho de IA.

A tabela abaixo contém as mesmas informações apresentadas no infográfico acima.
| Estratégia de Resfriamento | Mecanismo Primário | Tempo de resposta a picos de carga de trabalho | Risco de limitação térmica acima de 100 kW | Perfil de Eficiência Energética |
| Resfriamento de ar tradicional | Unidades CRAH soprando ar frio nos corredores. | Muito lento (minutos) | Certo (O ar não pode fisicamente suportar 100 kW) | Ruim (Ventiladores consomem muita energia) |
| Resfriamento líquido reativo | Unidades de distribuição de calor (CDUs) em resposta ao retorno de água quente. | Moderado (30 a 90 segundos) | Alto (As batatas fritas superaquecem antes da chegada do líquido frio) | Moderado (Reage ao calor residual posteriormente) |
| Resfriamento líquido preditivo | O software antecipa a carga de TI antes do pico. | Instantâneo (Pré-resfriamento antes da geração de calor) | Zero (Estabilidade térmica mantida sem interrupções) | Excelente (A capacidade de refrigeração corresponde à necessidade real de TI) |
A vantagem da Nlyte: Sinais de carga preditivos
Para solucionar a lentidão dos sistemas reativos, a infraestrutura do data center precisa se comunicar diretamente com o hardware de TI. É aí que a Nlyte Software muda o paradigma.
Em vez de esperar que a água nos canos esquente, a Nlyte preenche a lacuna entre a infraestrutura de TI e as instalações. Por meio de integrações profundas com sistemas de gerenciamento de serviços de TI, agendadores de tarefas e telemetria em nível de servidor, a Nlyte sabe exatamente o que os servidores estão fazendo e, mais importante, o que eles estão prestes a fazer.

Pré-resfriamento dos circuitos de fluido
Quando uma carga de trabalho de IA é agendada para execução, a camada de orquestração de TI sabe o momento exato em que as GPUs serão ativadas. O Nlyte captura esse sinal preditivo de carga.
Antes mesmo que as GPUs comecem a processar os dados, a Nlyte envia um sinal automatizado para o Sistema de Gerenciamento Predial (BMS) da instalação ou diretamente para as Unidades de Distribuição de Refrigerante. A instalação começa a bombear líquido mais frio e a aumentar a velocidade das bombas preventivamente.
Quando as GPUs atingem seu pico térmico, o circuito de resfriamento já está saturado com a quantidade exata de líquido frio para absorver o calor instantaneamente. A curva de temperatura permanece perfeitamente plana. As GPUs nunca sofrem throttling e o hardware nunca fica sobrecarregado termicamente.
Este é o verdadeiro poder do resfriamento preditivo para IA. Você não está mais correndo atrás do calor; você está esperando por ele.
Otimizando a Central de Águas Refrigeradas com a Carrier
A capacidade da Nlyte de prever cargas térmicas vai muito além do rack de servidores. Como empresa da Carrier, a Nlyte integra-se profundamente à infraestrutura de instalações de nível empresarial.
Quando a Nlyte detecta uma tarefa de IA de grande porte no horizonte, ela pode se comunicar com a central de refrigeração. As centrais de refrigeração utilizam compressores de grande porte e inversores de frequência (VSDs) para gerar a água gelada que abastece o data center. A ativação desses sistemas leva tempo e requer muita energia.
Se uma central de refrigeração reage cegamente a um aumento repentino de calor, muitas vezes "ultrapassa a capacidade". Ela aumenta a potência dos compressores para 100% para combater o pico repentino de temperatura, desperdiçando enormes quantidades de eletricidade, antes de eventualmente reduzir a potência novamente.
Com a sinalização preditiva da Nlyte, a central de água gelada recebe avisos antecipados. Os inversores de frequência podem aumentar a velocidade de forma suave e eficiente antes do previsto. Isso evita picos extremos de energia, reduz o desgaste mecânico dos chillers Carrier e melhora drasticamente a eficiência geral da instalação.
Energia para a Era da Alta Densidade: Energia Renovável
À medida que os data centers adotam o resfriamento preditivo para IA, eles também enfrentam um desafio maior: obter a imensa energia necessária para operar racks com mais de 100 kW. A transição para o resfriamento líquido melhora a eficiência, mas o consumo absoluto de energia das instalações de IA continua a aumentar.
Analistas renomados da Newmark e da Colliers destacam que as exigências de sustentabilidade estão forçando os data centers a abandonar os combustíveis fósseis. Os principais provedores de hiperescala e colocation estão integrando ativamente fontes de energia renováveis em suas escolhas de locais de alta densidade.
No entanto, conciliar os requisitos de energia constante e de base de um centro de dados de IA com a natureza variável da energia renovável exige um planejamento cuidadoso. Os operadores devem equilibrar as restrições de espaço, os custos iniciais e a confiabilidade.
Comparação de energia renovável para data centers

A tabela abaixo contém as mesmas informações apresentadas no infográfico acima.
| Fonte de energia renovável | Requisitos de terreno/espaço | Confiabilidade (Capacidade de Carga Base) | Custo inicial de capital | Escalabilidade operacional para centros de dados |
| Solar Fotovoltaica (PV) | Extremamente alto (requer uma área enorme para geração em escala de serviços públicos) | Intermitente (Requer armazenamento de bateria de grande capacidade para operação 24 horas por dia, 7 dias por semana) | Moderado a Alto (Custos de hardware decrescentes, custos de terreno elevados) | Fácil de escalar incrementalmente, mas limitado pelo espaço disponível. |
| Energia Eólica | Muito alto (requer corredores geográficos e espaçamento específicos) | Intermitente (Altamente dependente dos padrões climáticos e das estações do ano) | Alto (Fabricação de turbinas e instalação especializada) | Escalável em áreas rurais, mas impossível em centros urbanos de dados. |
| Hidrelétrica | Fixo (Requer proximidade a barragens existentes ou grandes rios) | Muito Alto (Fornece excelente e consistente potência de base) | Muito alto (requer obras de engenharia civil de grande porte para novas construções) | Baixa escalabilidade (limitado geograficamente a regiões específicas). |
| Geotérmica | Baixa (pequena área ocupada após a perfuração) | Muito alto (geração de energia de base constante, 24 horas por dia, 7 dias por semana) | Extremamente alto (a perfuração e exploração em águas profundas acarretam alto risco financeiro) | Excelente em regiões ativas (ex.: Islândia), altamente restrito em outros locais. |
| Pequenos Reatores Modulares (SMRs - Nucleares) | Muito baixo (tamanho compacto, adequado para instalação no local) | Definitivo (Energia de base ininterrupta por décadas) | Proibitivo (Atualmente em desenvolvimento, com imensos obstáculos regulatórios) | Alto potencial futuro para campus de IA com mais de 100 kW; atualmente limitado. |
Ao utilizar IA operacional, os data centers podem alinhar melhor suas cargas de trabalho computacionais com a disponibilidade de energia renovável. Se uma instalação depende fortemente de energia solar, a Nlyte pode ajudar a agendar cargas de trabalho de treinamento de IA não urgentes durante os horários de pico de luz solar, quando a energia renovável e barata é abundante. Essa sinergia entre orquestração de TI, refrigeração da instalação e aquisição de energia representa o ápice da gestão moderna de data centers.
O futuro pertence aos proativos.
Acabou a era de esperar que um servidor esquentasse antes de tentar resfriá-lo. As leis da física em racks de IA com mais de 100 kW tornam isso absolutamente impossível.
Confiar no gerenciamento térmico reativo garante a limitação térmica, danifica clusters de GPUs caros e força o equipamento de resfriamento a picos de energia reativos e ineficientes. A transição para o resfriamento líquido é um primeiro passo obrigatório, mas o hardware por si só não basta. É preciso a inteligência do software para controlá-lo.
Os data centers precisam preencher a lacuna entre a carga de trabalho de TI e a infraestrutura das instalações. Ao implementar o resfriamento preditivo para IA, os operadores garantem a estabilidade térmica, maximizam a utilização da GPU e reduzem significativamente seus custos de energia para refrigeração. Ao aproveitar o software Nlyte e os recursos avançados de infraestrutura da Carrier, suas instalações podem antecipar o calor antes mesmo que ele se materialize.
Pare de reagir ao calor. Comece a prevê-lo.
Assuma o controle da sua infraestrutura de IA de alta densidade hoje mesmo. Entre em contato com a Nlyte Software para descobrir como a sinalização preditiva de carga e a IA operacional podem proteger seu hardware e otimizar suas instalações.
Solicite uma demonstração aqui: https://www.nlyte.com/nlyte-in-action/see-a-demo/