La fin du refroidissement réactif à plus de 100 kW

Lorsqu'un cluster d'entraînement d'intelligence artificielle (IA) démarre, sa charge de travail n'augmente pas progressivement. La dissipation thermique est instantanée. Un rack rempli de GPU hautes performances passe de l'état de veille à une utilisation maximale en une fraction de seconde, consommant une quantité massive d'énergie et dégageant une chaleur intense.

Pendant des décennies, les opérateurs de centres de données ont géré les charges thermiques de manière réactive. Un capteur détectait une hausse de température et le centre réagissait en augmentant la vitesse des ventilateurs, en ouvrant des vannes ou en injectant davantage d'eau glacée dans la pièce. Cette approche convenait parfaitement aux besoins informatiques d'entreprise traditionnels.

Aujourd'hui, cette approche réactive est pratiquement morte.

Avec des densités de racks dépassant les 100 kW, les méthodes de refroidissement traditionnelles ne parviennent plus à suivre la vitesse fulgurante des pics thermiques liés à l'IA. Le refroidissement par air atteint sa limite maximale à environ 30 kW par rack. Pour s'adapter à l'ère moderne de l'IA, les centres de données s'appuient sur des unités de distribution de liquide de refroidissement (CDU) et des systèmes de refroidissement direct des puces. Cependant, même le refroidissement liquide s'avère insuffisant si le système de contrôle attend que la chaleur se manifeste avant de réagir.

Pour protéger les équipements coûteux et éviter le gaspillage d'énergie, les centres de données doivent revoir leur stratégie. Ils ont besoin d'un refroidissement prédictif pour l'IA. En exploitant les signaux de charge prédictifs de l'infrastructure informatique, les responsables des installations peuvent pré-refroidir les circuits de fluides et ajuster les groupes frigorifiques avant les pics de charge de calcul.

L'onde de choc de l'IA : pourquoi une puissance de plus de 100 kW change tout

Les charges de travail liées à l'intelligence artificielle sont particulièrement exigeantes. Contrairement aux serveurs web classiques qui subissent des pics de trafic prévisibles et continus, les modèles d'apprentissage automatique exécutent simultanément des tâches de traitement massives et parallèles.

Lorsqu'un data scientist lance une séquence d'entraînement de modèle de langage (LLM) de grande envergure, des milliers de GPU sont sollicités simultanément. Selon Data Center Dynamics (DCD) , cette demande instantanée engendre une onde de choc thermique au sein du centre de données. La consommation électrique d'une seule baie peut alors passer instantanément de quelques kilowatts à plus de 100 kilowatts.

Une étude de JLL Global Data Center Outlook confirme que cette augmentation rapide de la densité des racks devient la nouvelle norme. Les installations qui consommaient auparavant en moyenne 5 à 10 kW par rack sont désormais modernisées pour supporter des puissances de 50 kW, 80 kW et même plus de 100 kW afin d'intégrer les processeurs Nvidia, AMD et les clusters de puces personnalisés.

Pourquoi le refroidissement par air atteint ses limites

À 100 kW, le refroidissement par air n'est plus une question de rendements décroissants ; il contrevient aux lois de la thermodynamique. L'air n'a ni la densité ni la capacité thermique nécessaires pour évacuer l'énergie thermique générée par des serveurs d'IA très denses.

Infographie : Pourquoi le refroidissement par air atteint ses limites

  • Limites du débit d'air : Pour refroidir un rack de 100 kW par air, il faudrait des vents de force ouragan soufflant à travers l'armoire. Cela arracherait les câbles de leurs prises et endommagerait les composants fragiles.
  • Dommages acoustiques : Les ventilateurs de serveurs à grande vitesse fonctionnant à pleine capacité génèrent des niveaux sonores dépassant 100 décibels. Les vibrations acoustiques à haute fréquence peuvent dégrader les performances des disques durs et perturber les équipements de réseau optique.
  • Inefficacité: Le refroidissement par air nécessite des ventilateurs de salle informatique (CRAH) de grande capacité fonctionnant à plein régime. Cela entraîne une augmentation de la température. Efficacité d'utilisation de l'énergie (PUE) et gaspille d'énormes quantités d'électricité.

L' Uptime Institute souligne régulièrement que le passage à une puissance supérieure à 30 kW nécessite un refroidissement liquide. Un liquide peut contenir environ 3 000 fois plus de chaleur que l'air, à volume égal. Les systèmes de refroidissement direct sur la puce et les unités de refroidissement liquide-liquide acheminent le fluide caloporteur directement vers la source de chaleur, évitant ainsi les pertes liées à la circulation de grands volumes d'air.

Le piège à refroidissement réactif

Le passage au refroidissement liquide résout le problème de capacité, mais pas le problème de synchronisation.

Infographie sur le piège à refroidissement réactif

Dans un centre de données standard à refroidissement réactif, la séquence des événements se présente comme suit :

  1. Le déclencheur : La tâche d'entraînement de l'IA démarre. Les GPU atteignent instantanément leur température maximale.
  2. Le décalage : Les composants chauds chauffent le circuit de liquide environnant. Le liquide chauffé circule ensuite dans les tuyaux pour retourner à l'unité de distillation atmosphérique.
  3. La détection : Un capteur thermique situé à l'intérieur de l'unité de distribution d'eau (CDU) détecte l'élévation de la température de l'eau de retour.
  4. La réponse: Le système de gestion des installations commande au circuit principal d'eau glacée d'augmenter le débit et demande à la centrale de refroidissement d'augmenter sa vitesse.
  5. La récupération: L'eau plus froide arrive finalement au niveau du support pour stabiliser les températures.

Cette boucle de rétroaction crée un intervalle de temps critique. Selon Data Center Knowledge , cet intervalle peut durer de 30 secondes à plusieurs minutes, en fonction de la longueur de la canalisation et de la conception du système.

Pendant ce laps de temps, les GPU surchauffent. Pour éviter une surchauffe, les puces activent une limitation thermique. Elles ralentissent artificiellement leur fréquence d'horloge afin de générer moins de chaleur.

La limitation thermique compromet tout l'intérêt d'investir dans du matériel d'IA coûteux. Si votre cluster de GPU à plusieurs millions de dollars ralentit de 30 % à chaque pic de charge, vous perdez une puissance de calcul considérable. De plus, l'exposition répétée à ces pics thermiques dégrade le silicium au fil du temps, réduisant ainsi la durée de vie de votre infrastructure critique.

Comparaison des stratégies de refroidissement des centres de données

Pour comprendre l'évolution de la gestion thermique, il faut examiner comment différents systèmes gèrent un pic soudain de charge de travail d'IA.

Infographie comparative des stratégies de refroidissement des centres de données

Le tableau ci-dessous reprend les mêmes informations que celles présentées dans l'infographie ci-dessus.

Stratégie de refroidissement Mécanisme primaire Temps de réponse à un pic de charge de travail Risque de limitation thermique à partir de 100 kW Profil d'efficacité énergétique
Refroidissement par air traditionnel Des unités CRAH soufflent de l'air froid dans les allées. Très lent (minutes) Certes (l'air ne peut physiquement pas supporter 100 kW) Mauvais (les ventilateurs consomment énormément d'énergie)
Refroidissement liquide réactif Unités de distribution d'air (CDU) réagissant au retour d'eau chaude. Modéré (30 à 90 secondes) Élevé (les chips surchauffent avant l'arrivée du liquide froid) Modéré (Réagit à la chaleur résiduelle après coup)
Refroidissement liquide prédictif Le logiciel anticipe la charge informatique avant le pic. Instantané (Pré-refroidissement avant génération de chaleur) Zéro (Stabilité thermique maintenue sans interruption) Excellent (La puissance du refroidisseur correspond aux besoins informatiques réels)

 

L'avantage Nlyte : signaux de charge prédictifs

Pour pallier le délai de réponse des systèmes réactifs, le centre de données doit communiquer directement avec le matériel informatique. C'est là que Nlyte Software révolutionne le secteur.

Au lieu d'attendre que l'eau dans les canalisations chauffe, Nlyte assure la liaison entre l'infrastructure informatique et les locaux. Grâce à une intégration poussée avec les systèmes de gestion des services informatiques, les planificateurs de tâches et la télémétrie au niveau des serveurs, Nlyte sait précisément ce que font les serveurs et, plus important encore, ce qu'ils s'apprêtent à faire.

L'avantage Nlyte

Prérefroidissement des circuits de fluide

Lorsqu'une charge de travail d'IA est planifiée pour s'exécuter, la couche d'orchestration informatique connaît le moment précis où les GPU seront activés. Nlyte capture ce signal de charge prédictif.

Avant même que les GPU ne commencent à traiter les données, Nlyte envoie un signal automatique au système de gestion technique du bâtiment (GTB) ou directement aux unités de distribution de liquide de refroidissement. L'installation commence alors préventivement à injecter du liquide plus froid et à augmenter la vitesse des pompes.

Au moment où les GPU atteignent leur pic de température, le circuit de refroidissement est déjà saturé avec la quantité exacte de liquide froid nécessaire pour absorber instantanément la chaleur. La courbe de température reste parfaitement plate. Les GPU ne subissent jamais de réduction de fréquence et le matériel n'est jamais soumis à des contraintes thermiques.

C’est là toute la puissance du refroidissement prédictif pour l’IA. Vous ne courez plus après la chaleur ; vous l’attendez.

Optimisation de l'installation de refroidissement avec Carrier

La capacité de Nlyte à prédire les charges thermiques s'étend bien au-delà des baies de serveurs. En tant que filiale de Carrier, Nlyte s'intègre parfaitement aux infrastructures des grandes entreprises.

Lorsque Nlyte détecte une tâche d'IA de grande envergure à venir, il peut communiquer avec la centrale de refroidissement. Ces centrales utilisent des compresseurs puissants et des variateurs de vitesse pour produire l'eau froide alimentant le centre de données. La montée en puissance de ces systèmes est un processus long et énergivore.

Si une centrale de refroidissement réagit de manière aveugle à une brusque montée de chaleur, elle « surréagit » souvent. Elle fait alors fonctionner ses compresseurs à 100 % pour lutter contre la brusque augmentation de température, gaspillant ainsi d'énormes quantités d'électricité, avant de finalement réduire sa puissance.

Grâce à la signalisation prédictive de Nlyte, la centrale de refroidissement est avertie à l'avance. Les variateurs de vitesse peuvent ainsi monter en puissance de manière progressive et efficace. Ceci évite les pics de consommation d'énergie, réduit l'usure mécanique des groupes frigorifiques Carrier et améliore considérablement l'efficacité globale de l'installation.

Alimenter l'ère de la haute densité : les énergies renouvelables

Alors que les centres de données adoptent le refroidissement prédictif pour l'IA, ils sont confrontés à un défi plus vaste : l'approvisionnement en énergie nécessaire au fonctionnement des racks de plus de 100 kW. La transition vers le refroidissement liquide améliore l'efficacité, mais la consommation électrique absolue des installations d'IA continue d'augmenter.

Les principaux analystes de Newmark et Colliers soulignent que les exigences en matière de développement durable contraignent les centres de données à abandonner les énergies fossiles. Les grands fournisseurs de services cloud et de colocation intègrent activement les énergies renouvelables dans leurs choix de sites à haute densité.

Cependant, concilier les besoins énergétiques constants et de base d'un centre de données d'IA avec la nature variable des énergies renouvelables exige une planification rigoureuse. Les opérateurs doivent trouver un équilibre entre les contraintes d'espace, les coûts initiaux et la fiabilité.

Comparaison des énergies renouvelables pour les centres de données

Infographie comparative des énergies renouvelables pour les centres de données

Le tableau ci-dessous reprend les mêmes informations que celles présentées dans l'infographie ci-dessus.

Source d'énergie renouvelable Besoins en terres et en espace Fiabilité (capacité de charge de base) Coût en capital initial Évolutivité opérationnelle des centres de données
Solaire Photovoltaïque (PV) Extrêmement élevé (nécessite une superficie immense pour une production à grande échelle) Fonctionnement intermittent (nécessite une batterie de grande capacité pour un fonctionnement 24h/24 et 7j/7) Modéré à élevé (Baisse des coûts du matériel, coûts fonciers élevés) Facile à mettre à l'échelle progressivement, mais limité par la surface immobilière disponible.
Parcs éoliens Très élevé (Nécessite des corridors géographiques et un espacement spécifiques) Intermittent (Fortement dépendant des conditions météorologiques et des saisons) Haute (Fabrication de turbines et installation spécialisée) Adaptable aux zones rurales, mais impossible à déployer dans les centres de données urbains.
Hydro-électrique Fixe (Nécessite la proximité de barrages existants ou de grands fleuves) Très élevé (Fournit une excellente puissance de base constante) Très élevé (Nécessite d'importants travaux de génie civil pour toute nouvelle construction) Faible évolutivité (géographiquement limité à des régions spécifiques).
géothermie Faible (Empreinte au sol réduite une fois le forage terminé) Très élevé (production d'électricité de base constante, 24h/24 et 7j/7) Extrêmement élevé (le forage et l'exploration en profondeur comportent un risque financier élevé) Excellent dans les régions actives (ex. : Islande), très limité ailleurs.
Réacteurs modulaires de petite taille (SMR - Nucléaires) Très faible (Encombrement réduit adapté au déploiement sur site) Alimentation de base ininterrompue (Ultime) pendant des décennies Prohibitif (Actuellement en développement, obstacles réglementaires immenses) Fort potentiel futur pour les campus d'IA de plus de 100 kW ; actuellement limité.

Grâce à l'IA opérationnelle, les centres de données peuvent mieux adapter leurs charges de calcul à la disponibilité des énergies renouvelables. Si un site dépend fortement de l'énergie solaire, Nlyte peut planifier les tâches d'entraînement d'IA non urgentes pendant les heures d'ensoleillement maximales, lorsque l'énergie renouvelable et bon marché est abondante. Cette synergie entre l'orchestration informatique, le refroidissement des installations et l'approvisionnement en énergie représente le summum de la gestion moderne des centres de données.

L'avenir appartient aux proactifs

L'époque où l'on attendait qu'un serveur chauffe avant de tenter de le refroidir est révolue. Les contraintes physiques des racks d'IA de plus de 100 kW l'interdisent formellement.

Le recours à une gestion thermique réactive entraîne inévitablement une limitation de la fréquence, endommage les coûteux clusters de GPU et contraint les systèmes de refroidissement à des pics de consommation d'énergie inefficaces et réactifs. La transition vers un refroidissement liquide est une première étape indispensable, mais le matériel seul ne suffit pas. Il faut également une intelligence logicielle pour le piloter.

Les centres de données doivent assurer l'adéquation entre la charge de travail informatique et l'infrastructure. En mettant en œuvre un refroidissement prédictif pour l'IA, les opérateurs garantissent la stabilité thermique, optimisent l'utilisation des GPU et réduisent considérablement leurs coûts énergétiques liés au refroidissement. Grâce aux solutions logicielles avancées de Nlyte Software et de Carrier, votre centre de données peut anticiper les problèmes de surchauffe.


Au lieu de réagir à la chaleur, commencez à l'anticiper.

Prenez le contrôle de votre infrastructure d'IA haute densité dès aujourd'hui. Contactez Nlyte Software pour découvrir comment la signalisation prédictive de la charge et l'IA opérationnelle peuvent protéger votre matériel et optimiser vos installations.

Demandez une démonstration ici : https://www.nlyte.com/nlyte-in-action/see-a-demo/

Articles les plus récents liés

MCP et LLM : le chaînon manquant pour des opérations de centres de données plus intelligentes En savoir plus
Les principaux avantages que DCIM offre aux entreprises de services publics En savoir plus
Nlyte Newsbytes - Numéro 10 En savoir plus
Nlyte : Sécurisé. Intelligent. Extensible. Durable.

Demandez une démo aujourd'hui