La desaparición de la refrigeración reactiva a más de 100 kW

Cuando se pone en marcha un clúster de entrenamiento de inteligencia artificial (IA), su carga de trabajo no aumenta gradualmente. La generación de calor se dispara instantáneamente. Un rack repleto de GPU de alto rendimiento pasa de estar inactivo a funcionar a pleno rendimiento en una fracción de segundo, consumiendo enormes cantidades de energía y generando un calor intenso.

Durante décadas, los operadores de centros de datos gestionaron las cargas térmicas de forma reactiva. Un sensor detectaba un aumento de temperatura y la instalación respondía activando los ventiladores, abriendo válvulas o inyectando más agua fría en la sala. Este método funcionó bastante bien para la informática empresarial tradicional.

Hoy en día, ese enfoque reactivo está prácticamente extinto.

A medida que la densidad de racks supera los 100 kW, los métodos de refrigeración tradicionales resultan insuficientes para contrarrestar la vertiginosa velocidad de los picos térmicos generados por la IA. La refrigeración por aire alcanza un máximo de aproximadamente 30 kW por rack. Para sobrevivir a la era moderna de la IA, los centros de datos recurren a unidades de distribución de refrigerante líquido-líquido (CDU) y sistemas de refrigeración directa a los chips. Sin embargo, incluso la refrigeración líquida se queda corta si el sistema de control espera a que llegue el calor antes de reaccionar.

Para proteger equipos costosos y evitar el desperdicio de energía, los centros de datos deben replantear su estrategia. Necesitan refrigeración predictiva para la IA. Mediante el uso de señales de carga predictivas de la infraestructura de TI, los administradores de las instalaciones pueden preenfriar los circuitos de fluidos y ajustar los sistemas de refrigeración antes de que la carga de procesamiento alcance su punto máximo.

La onda expansiva de la IA en el sector energético: por qué más de 100 kW lo cambia todo.

Las cargas de trabajo de inteligencia artificial son excepcionalmente exigentes. A diferencia de los servidores web estándar, que experimentan oleadas de tráfico predecibles y fluctuantes, los modelos de aprendizaje automático ejecutan simultáneamente tareas de procesamiento masivas y en paralelo.

Cuando un científico de datos inicia una secuencia de entrenamiento de un modelo de lenguaje (LLM) de gran tamaño, miles de GPU se activan simultáneamente. Según informes de Data Center Dynamics (DCD) , esta demanda instantánea genera una "onda expansiva" térmica dentro del centro de datos. El consumo de energía dentro de un solo gabinete puede dispararse instantáneamente desde unos pocos kilovatios hasta superar los 100 kilovatios.

Un estudio del informe JLL Global Data Center Outlook confirma que este rápido aumento en la densidad de racks se está convirtiendo en el nuevo estándar. Las instalaciones que antes promediaban entre 5 kW y 10 kW por rack ahora se están adaptando para admitir configuraciones de 50 kW, 80 kW e incluso más de 100 kW para dar cabida a clústeres de silicio de Nvidia, AMD y personalizados.

¿Por qué la refrigeración por aire llega a un punto muerto?

A 100 kW, la refrigeración por aire ya no supone un rendimiento decreciente; viola las leyes de la termodinámica. El aire carece de la densidad y la capacidad calorífica necesarias para disipar la energía térmica generada por servidores de IA densamente agrupados.

Infografía sobre por qué la refrigeración por aire llega a su límite

  • Límites del flujo de aire: Para refrigerar un rack de 100 kW con aire, se necesitarían vientos huracanados que atravesaran el gabinete. Esto arrancaría los cables de sus enchufes y dañaría los componentes delicados.
  • Daños acústicos: Los ventiladores de servidores de alta velocidad que funcionan a su máxima capacidad generan niveles de ruido superiores a 100 decibelios. Las vibraciones acústicas de alta frecuencia pueden degradar el rendimiento de los discos duros e interferir con los equipos de redes ópticas.
  • Ineficacia: La refrigeración por aire requiere enormes ventiladores de la unidad de tratamiento de aire de la sala de computadoras (CRAH) funcionando a máxima velocidad. Esto aumenta el Eficacia del uso de energía (PUE) y desperdicia enormes cantidades de electricidad.

El Uptime Institute señala constantemente que para superar los 30 kW se requiere refrigeración líquida. El líquido retiene aproximadamente 3,000 veces más calor por volumen que el aire. Los sistemas de refrigeración directa al chip y las unidades de refrigeración líquida (CDU) llevan el refrigerante directamente a la fuente de calor, evitando las ineficiencias que supone mover grandes volúmenes de aire.

La trampa de enfriamiento reactivo

La actualización a refrigeración líquida resuelve el problema de capacidad, pero no el problema de sincronización.

Infografía sobre la trampa de enfriamiento reactivo

En un centro de datos estándar con refrigeración reactiva, la secuencia de eventos es la siguiente:

  1. El gatillo: Comienza el proceso de entrenamiento de la IA. Las GPU alcanzan instantáneamente su temperatura máxima.
  2. El retraso: Los componentes calientes calientan el circuito de líquido circundante. El líquido calentado viaja a través de las tuberías de regreso a la unidad de distribución de refrigerante (CDU).
  3. La detección: Un sensor térmico situado en el interior de la unidad de tratamiento de agua detecta el aumento de la temperatura del agua de retorno.
  4. La respuesta: El sistema de gestión de las instalaciones ordena al circuito principal de agua fría que aumente el caudal e indica a la planta de refrigeración que incremente su potencia.
  5. La recuperación: Finalmente, llega agua más fría al sistema para estabilizar las temperaturas.

Este bucle reactivo crea un peligroso lapso de tiempo. Según Data Center Knowledge , este lapso puede durar desde 30 segundos hasta varios minutos, dependiendo de la longitud de la tubería y el diseño del sistema.

Durante ese lapso, las GPU se sobrecalientan. Para evitar que se fundan físicamente, los chips activan la limitación térmica. Reducen artificialmente su velocidad, disminuyendo sus frecuencias de reloj para generar menos calor.

La limitación térmica anula por completo el propósito de comprar hardware de IA costoso. Si su clúster de GPU de un millón de dólares se ralentiza un 30 % cada vez que aumenta la carga de trabajo, está perdiendo una enorme capacidad de cálculo. Además, la exposición repetida a picos de temperatura degrada el silicio con el tiempo, acortando la vida útil de su infraestructura crítica.

Comparación de estrategias de refrigeración para centros de datos

Para comprender la evolución de la gestión térmica, debemos analizar cómo los diferentes sistemas manejan un aumento repentino en la carga de trabajo de la IA.

Infografía comparativa de estrategias de refrigeración para centros de datos

La tabla que aparece a continuación contiene la misma información que se detalla en la infografía anterior.

Estrategia de enfriamiento Mecanismo primario Tiempo de respuesta ante picos de carga de trabajo Riesgo de limitación térmica a más de 100 kW Perfil de eficiencia energética
Refrigeración por aire tradicional Unidades CRAH que impulsan aire frío hacia los pasillos. Muy lento (minutos) Cierto (El aire no puede soportar físicamente 100 kW) Pobre (Los ventiladores consumen muchísima energía)
Refrigeración líquida reactiva Las unidades de distribución de agua (CDU) responden al agua de retorno caliente. Moderado (de 30 a 90 segundos) Alto (Las patatas fritas se sobrecalientan antes de que llegue el líquido frío) Moderado (Reacciona al calor residual a posteriori)
Refrigeración líquida predictiva El software anticipa la carga de trabajo de TI antes del pico de demanda. Instantáneo (Preenfriamiento antes de que se genere calor) Cero (Estabilidad térmica mantenida sin interrupciones) Excelente (adapta la potencia del enfriador a las necesidades reales de TI)

 

La ventaja de Nlyte: Señales de carga predictivas

Para solucionar la lentitud de los sistemas reactivos, el centro de datos debe comunicarse directamente con el hardware informático. Aquí es donde Nlyte Software cambia el paradigma.

En lugar de esperar a que el agua de las tuberías se caliente, Nlyte cierra la brecha entre la infraestructura de TI y la infraestructura de las instalaciones. Mediante una profunda integración con los sistemas de gestión de servicios de TI, los planificadores de tareas y la telemetría a nivel de servidor, Nlyte sabe exactamente qué están haciendo los servidores y, lo que es más importante, qué están a punto de hacer.

La ventaja de Nlyte

Preenfriamiento de los circuitos de fluidos

Cuando se programa la ejecución de una carga de trabajo de IA, la capa de orquestación de TI conoce el momento exacto en que se activarán las GPU. Nlyte captura esta señal de carga predictiva.

Antes incluso de que las GPU comiencen a procesar los datos, Nlyte envía una señal automatizada al sistema de gestión de edificios (BMS) de la instalación o directamente a las unidades de distribución de refrigerante. La instalación comienza a bombear líquido más frío y a aumentar la velocidad de las bombas de forma preventiva.

Para cuando las GPU generan su pico térmico, el circuito de refrigeración ya está saturado con la cantidad precisa de líquido frío para absorber el calor al instante. La curva de temperatura se mantiene perfectamente plana. Las GPU nunca reducen su rendimiento y el hardware nunca sufre estrés térmico.

Este es el verdadero poder de la refrigeración predictiva para la IA. Ya no tienes que perseguir el calor; ahora lo esperas.

Optimización de la planta de refrigeración con Carrier

La capacidad de Nlyte para predecir las cargas térmicas va mucho más allá del rack de servidores. Como empresa de Carrier, Nlyte se integra profundamente con la infraestructura de instalaciones de nivel empresarial.

Cuando Nlyte detecta una tarea de IA de gran envergadura, puede comunicarse con la planta de refrigeración central. Estas plantas utilizan compresores de gran tamaño y variadores de velocidad (VSD) para generar el agua fría que alimenta el centro de datos. Poner en marcha estos sistemas lleva tiempo y requiere una cantidad considerable de energía.

Si una planta de refrigeración reacciona de forma indiscriminada ante un aumento repentino de temperatura, a menudo se produce un "sobrecalentamiento". Aumenta la potencia de sus compresores al 100% para combatir el repentino pico de temperatura, desperdiciando enormes cantidades de electricidad, antes de finalmente reducirla.

Gracias al sistema de señalización predictiva de Nlyte, la planta de refrigeración recibe avisos anticipados. Los variadores de velocidad pueden aumentar la potencia de forma suave y eficiente con antelación. Esto evita picos de energía extremos, reduce el desgaste mecánico de los enfriadores Carrier y mejora drásticamente la eficiencia general de la instalación.

Impulsando la era de la alta densidad: Energía renovable

A medida que los centros de datos adoptan la refrigeración predictiva para la IA, también se enfrentan a un desafío mayor: obtener la enorme cantidad de energía necesaria para alimentar racks de más de 100 kW. La transición a la refrigeración líquida mejora la eficiencia, pero el consumo energético absoluto de las instalaciones de IA sigue aumentando.

Los principales analistas de Newmark y Colliers destacan que las normativas de sostenibilidad están obligando a los centros de datos a abandonar los combustibles fósiles. Los grandes proveedores de servicios de hiperescala y de coubicación están integrando activamente fuentes de energía renovable en la selección de sus emplazamientos de alta densidad.

Sin embargo, para que los requisitos de energía base constantes de un centro de datos de IA coincidan con la naturaleza variable de la energía renovable, se requiere una planificación minuciosa. Los operadores deben equilibrar las limitaciones de espacio, los costos iniciales y la confiabilidad.

Comparación de energías renovables en centros de datos

Infografía comparativa sobre energías renovables en centros de datos

La tabla que aparece a continuación contiene la misma información que se detalla en la infografía anterior.

Fuente de energía renovable Requisitos de terreno/espacio Fiabilidad (capacidad de carga base) Costo de capital inicial Escalabilidad operativa para centros de datos
Energía solar fotovoltaica (FV) Extremadamente alto (requiere una superficie enorme para la generación a gran escala) Intermitente (Requiere una gran capacidad de almacenamiento de baterías para un funcionamiento continuo las 24 horas del día, los 7 días de la semana). De moderado a alto (disminución de los costos de hardware, altos costos de terrenos) Es fácil de escalar gradualmente, pero está limitado por el espacio inmobiliario disponible.
Energía Eólica Muy alto (Requiere corredores geográficos y espaciamiento específicos) Intermitente (depende en gran medida de los patrones climáticos y las estaciones del año) Alta (Fabricación de turbinas e instalación especializada) Es viable en zonas rurales, pero imposible en centros de datos urbanos.
Hidroeléctrico Fijo (Requiere proximidad a presas existentes o ríos grandes) Muy alta (Proporciona una potencia de carga base excelente y constante) Muy alto (Requiere ingeniería civil a gran escala si se construye una obra nueva) Poca escalabilidad (limitado geográficamente a regiones específicas).
Geotérmica Baja (Poca superficie ocupada una vez finalizada la perforación) Muy alta (generación de energía de carga base constante, 24/7) Extremadamente alto (la perforación profunda y la exploración conllevan un alto riesgo financiero). Excelente en regiones con alta actividad (por ejemplo, Islandia), muy restringido en otros lugares.
Reactores modulares pequeños (SMR - Nucleares) Muy bajo (tamaño compacto, ideal para instalación in situ) Máximo rendimiento (potencia base ininterrumpida durante décadas) Prohibitivo (Actualmente en desarrollo, enormes obstáculos regulatorios) Gran potencial futuro para campus de IA de más de 100 kW; actualmente limitado.

Mediante la IA operativa, los centros de datos pueden optimizar la sincronización de sus cargas de trabajo de computación con la disponibilidad de energía renovable. Si una instalación depende en gran medida de la energía solar, Nlyte puede ayudar a programar las cargas de trabajo de entrenamiento de IA no urgentes durante las horas de máxima luz solar, cuando la energía renovable y económica es abundante. Esta sinergia entre la orquestación de TI, la refrigeración de las instalaciones y el suministro de energía representa la máxima expresión de la gestión moderna de centros de datos.

El futuro pertenece a los proactivos.

Se acabaron los tiempos en que había que esperar a que un servidor se calentara antes de intentar enfriarlo. Las leyes de la física de los racks de IA de más de 100 kW lo impiden rotundamente.

Depender de la gestión térmica reactiva garantiza la limitación térmica, daña los costosos clústeres de GPU y fuerza a los equipos de refrigeración a generar picos de energía reactivos e ineficientes. La transición a la refrigeración líquida es un primer paso indispensable, pero el hardware por sí solo no basta. Se necesita la inteligencia del software para gestionarla.

Los centros de datos deben salvar la brecha entre la carga de trabajo de TI y la infraestructura de las instalaciones. Al implementar refrigeración predictiva para IA, los operadores garantizan la estabilidad térmica, maximizan la utilización de la GPU y reducen significativamente sus costos de energía para refrigeración. Gracias al software de Nlyte y las capacidades de infraestructura avanzada de Carrier, sus instalaciones pueden anticipar el calor antes de que se produzca.


Deja de reaccionar ante el calor. Empieza a predecirlo.

Tome el control de su infraestructura de IA de alta densidad hoy mismo. Póngase en contacto con Nlyte Software para descubrir cómo la señalización predictiva de carga y la IA operativa pueden proteger su hardware y optimizar sus instalaciones.

Solicita una demostración aquí: https://www.nlyte.com/nlyte-in-action/see-a-demo/

Noticias relacionadas más recientes

MCP y LLM: El eslabón perdido para operaciones de centros de datos más inteligentes Descubre más
Las principales maneras en que DCIM ayuda a las empresas de servicios públicos Descubre más
Noticias breves de Nlyte - Número 10 Descubre más
Nlyte Seguro. Inteligente. Extensible. Sostenible.

Solicite una demostración hoy