La fine del raffreddamento reattivo a oltre 100 kW

Quando un cluster di addestramento per l'intelligenza artificiale (IA) si avvia, il suo carico di lavoro non aumenta gradualmente. La produzione di calore aumenta istantaneamente. Un rack pieno di GPU ad alte prestazioni passa dallo stato di inattività al massimo utilizzo in una frazione di secondo, assorbendo enormi quantità di energia e irradiando calore intenso.

Per decenni, gli operatori dei data center hanno gestito i carichi termici in modo reattivo. Un sensore rilevava un aumento della temperatura e la struttura reagiva aumentando la velocità delle ventole, aprendo le valvole o immettendo più acqua refrigerata nella stanza. Questo approccio funzionava abbastanza bene per l'informatica aziendale tradizionale.

Oggi, questo approccio reattivo è di fatto superato.

Con la densità dei rack che supera i 100 kW, i metodi di raffreddamento tradizionali non riescono a tenere il passo con la rapidità dei picchi termici generati dall'intelligenza artificiale. Il raffreddamento ad aria raggiunge un massimo di circa 30 kW per rack. Per sopravvivere all'era moderna dell'IA, i data center si affidano a unità di distribuzione del refrigerante liquido-liquido (CDU) e a sistemi di raffreddamento diretto al chip. Tuttavia, anche il raffreddamento a liquido risulta insufficiente se il sistema di controllo attende l'arrivo del calore prima di reagire.

Per proteggere apparecchiature costose ed evitare sprechi energetici, i data center devono cambiare strategia. Hanno bisogno di un raffreddamento predittivo per l'intelligenza artificiale. Sfruttando i segnali di carico predittivi provenienti dall'infrastruttura IT, i responsabili delle strutture possono preraffreddare i circuiti dei fluidi e regolare gli impianti di refrigerazione prima che il carico di calcolo raggiunga il picco.

L'onda d'urto dell'intelligenza artificiale: perché oltre 100 kW cambiano tutto.

I carichi di lavoro dell'intelligenza artificiale sono particolarmente impegnativi. A differenza dei server web standard, che gestiscono flussi di traffico prevedibili e irregolari, i modelli di apprendimento automatico eseguono simultaneamente enormi quantità di elaborazione in parallelo.

Quando un data scientist avvia una sequenza di addestramento di un modello linguistico su larga scala (LLM), migliaia di GPU si attivano contemporaneamente. Secondo i report di Data Center Dynamics (DCD) , questa richiesta istantanea crea un'onda d'urto termica all'interno del data center. Il consumo energetico all'interno di un singolo armadio rack può schizzare alle stelle in un istante, passando da un valore di base di pochi kilowatt a ben oltre 100 kilowatt.

Una ricerca del JLL Global Data Center Outlook conferma che questa rapida escalation nella densità dei rack sta diventando il nuovo standard. Le strutture che in precedenza avevano una media di 5-10 kW per rack vengono ora ammodernate per supportare potenze di 50 kW, 80 kW e oltre 100 kW, al fine di ospitare cluster di chip Nvidia, AMD e personalizzati.

Perché il raffreddamento ad aria raggiunge un limite

A 100 kW, il raffreddamento ad aria non è più una questione di rendimenti decrescenti; viola le leggi della termodinamica. L'aria non ha la densità e la capacità termica necessarie per dissipare l'energia termica generata dai server AI densamente assemblati.

Perché il raffreddamento ad aria raggiunge i suoi limiti (infografica)

  • Limiti del flusso d'aria: Per raffreddare un rack da 100 kW con l'aria, sarebbero necessari venti di forza uraganica che attraversassero l'armadio. Questo strapperebbe i cavi dalle loro prese e danneggerebbe i componenti delicati.
  • Danni acustici: Le ventole dei server ad alta velocità, quando funzionano alla massima capacità, generano livelli di rumore superiori a 100 decibel. Le vibrazioni acustiche ad alta frequenza possono effettivamente compromettere le prestazioni dei dischi rigidi e interferire con le apparecchiature di rete ottica.
  • Inefficienza: Il raffreddamento ad aria richiede enormi ventilatori per le unità di trattamento dell'aria delle sale computer (CRAH) che funzionano alla massima velocità. Questo fa aumentare il Efficacia nell'uso dell'energia (PUE) e spreca enormi quantità di elettricità.

L' Uptime Institute sottolinea costantemente che superare i 30 kW richiede il raffreddamento a liquido. Un liquido, a parità di volume, immagazzina circa 3,000 volte più calore dell'aria. I sistemi direct-to-chip e le unità di distribuzione dell'energia (CDU) liquido-liquido portano il refrigerante direttamente alla fonte di calore, evitando le inefficienze derivanti dallo spostamento di grandi volumi d'aria.

La trappola di raffreddamento reattivo

Il passaggio al raffreddamento a liquido risolve il problema della capacità, ma non quello delle tempistiche.

Infografica sulla trappola di raffreddamento reattivo

In un data center standard con raffreddamento reattivo, la sequenza degli eventi si presenta in questo modo:

  1. Il grilletto: Il processo di addestramento dell'IA ha inizio. Le GPU raggiungono immediatamente la temperatura massima.
  2. Il ritardo: I componenti caldi riscaldano il circuito di liquido circostante. Il liquido riscaldato viaggia attraverso le tubazioni fino all'unità di distribuzione del refrigerante (CDU).
  3. Il rilevamento: Un sensore termico all'interno dell'unità di distribuzione dell'acqua (CDU) rileva l'aumento della temperatura dell'acqua di ritorno.
  4. La risposta: Il sistema di gestione dell'impianto comanda al circuito primario dell'acqua refrigerata di aumentare il flusso e ordina all'impianto di refrigerazione di incrementare la propria capacità.
  5. Il recupero: Finalmente, l'acqua più fredda arriva al rack per stabilizzare le temperature.

Questo ciclo reattivo crea un pericoloso intervallo di tempo. Secondo Data Center Knowledge , tale intervallo può durare da 30 secondi a diversi minuti, a seconda della lunghezza del canale e della progettazione del sistema.

Durante quel lag, le GPU si surriscaldano. Per evitare la fusione fisica, i chip attivano la limitazione termica. Rallentano artificialmente le proprie prestazioni, riducendo la frequenza di clock per generare meno calore.

Il thermal throttling vanifica completamente lo scopo dell'acquisto di hardware AI così costoso. Se il vostro cluster di GPU da un milione di dollari rallenta del 30% ogni volta che il carico di lavoro aumenta improvvisamente, state perdendo un'enorme quantità di valore computazionale. Inoltre, la ripetuta esposizione a picchi termici degrada il silicio nel tempo, riducendo la durata utile della vostra infrastruttura critica.

Confronto tra strategie di raffreddamento per data center

Per comprendere l'evoluzione della gestione termica, dobbiamo analizzare come i diversi sistemi gestiscono un improvviso picco di carico di lavoro dell'intelligenza artificiale.

Infografica a confronto tra le strategie di raffreddamento dei data center

La tabella sottostante riporta le stesse informazioni illustrate nell'infografica precedente.

Strategia di raffreddamento Meccanismo primario Tempo di risposta al picco di carico di lavoro Rischio di limitazione termica a 100 kW e oltre Profilo di efficienza energetica
Raffreddamento ad aria tradizionale Unità CRAH che soffiano aria fredda nei corridoi. Molto lento (minuti) Certamente (l'aria non può fisicamente supportare 100 kW) Scarso (i ventilatori consumano un'enorme quantità di energia)
Raffreddamento a liquido reattivo Unità di distribuzione del carbonio (CDU) che reagiscono al ritorno dell'acqua calda. Moderato (da 30 a 90 secondi) Alto (le patatine si surriscaldano prima che arrivi il liquido freddo) Moderato (reagisce al calore di scarto a posteriori)
Raffreddamento a liquido predittivo Il software prevede il carico IT prima del picco. Raffreddamento istantaneo (preraffreddamento prima che si generi calore) Zero (stabilità termica mantenuta senza interruzioni) Eccellente (la potenza del refrigeratore corrisponde alle effettive esigenze IT)

 

Il vantaggio Nlyte: segnali di carico predittivi

Per superare il problema della latenza dei sistemi reattivi, l'infrastruttura del data center deve comunicare direttamente con l'hardware IT. È qui che Nlyte Software cambia il paradigma.

Anziché attendere che l'acqua nei tubi si riscaldi, Nlyte colma il divario tra lo stack IT e l'infrastruttura della struttura. Grazie a profonde integrazioni con i sistemi di gestione dei servizi IT, gli scheduler di processi e la telemetria a livello di server, Nlyte sa esattamente cosa stanno facendo i server e, soprattutto, cosa stanno per fare.

Il vantaggio Nlyte

Preraffreddamento dei circuiti fluidici

Quando si programma l'esecuzione di un carico di lavoro di intelligenza artificiale, il livello di orchestrazione IT conosce il momento esatto in cui le GPU si attiveranno. Nlyte cattura questo segnale di carico predittivo.

Ancor prima che le GPU inizino a elaborare i dati, Nlyte invia un segnale automatico al sistema di gestione degli edifici (BMS) dell'impianto o direttamente alle unità di distribuzione del refrigerante. L'impianto inizia quindi a immettere liquido più freddo e ad aumentare preventivamente la velocità delle pompe.

Nel momento in cui le GPU generano il picco termico, il circuito di raffreddamento è già saturo con la giusta quantità di liquido freddo per assorbire il calore istantaneamente. La curva di temperatura rimane perfettamente piatta. Le GPU non subiscono mai un throttling e l'hardware non è mai sottoposto a stress termico.

Questo è il vero potere del raffreddamento predittivo per l'IA. Non si insegue più il calore, ma lo si aspetta.

Ottimizzazione dell'impianto di refrigerazione con Carrier

La capacità di Nlyte di prevedere i carichi termici si estende ben oltre il rack dei server. In quanto azienda del gruppo Carrier, Nlyte si integra profondamente con le infrastrutture aziendali.

Quando Nlyte rileva un'attività di intelligenza artificiale di grandi dimensioni in arrivo, può comunicare con l'impianto di refrigerazione centrale. Gli impianti di refrigerazione utilizzano compressori di grandi dimensioni e azionamenti a velocità variabile (VSD) per generare l'acqua fredda che alimenta il data center. L'avvio di questi sistemi richiede tempo e un notevole dispendio energetico.

Se un impianto di refrigerazione reagisce in modo indiscriminato a un improvviso aumento di temperatura, spesso "esagera". Aumenta la velocità dei compressori al 100% per contrastare il picco di temperatura, sprecando enormi quantità di elettricità, prima di tornare gradualmente alla normalità.

Grazie al sistema di segnalazione predittiva di Nlyte, l'impianto di refrigerazione riceve un preavviso. Gli azionamenti a velocità variabile possono quindi aumentare gradualmente ed efficientemente la potenza in anticipo. Ciò previene picchi di consumo energetico eccessivi, riduce l'usura meccanica dei refrigeratori Carrier e migliora drasticamente l'efficienza complessiva dell'impianto.

Alimentare l'era dell'alta densità: le energie rinnovabili

Con l'adozione del raffreddamento predittivo per l'intelligenza artificiale nei data center, si presenta anche una sfida più ampia: reperire l'enorme quantità di energia necessaria per alimentare rack da oltre 100 kW. Il passaggio al raffreddamento a liquido migliora l'efficienza, ma il consumo energetico assoluto delle infrastrutture per l'IA continua ad aumentare.

I principali analisti di Newmark e Colliers sottolineano che i mandati in materia di sostenibilità stanno costringendo i data center ad abbandonare i combustibili fossili. I principali fornitori di servizi hyperscale e di colocation stanno integrando attivamente le fonti di energia rinnovabile nella selezione dei siti ad alta densità.

Tuttavia, conciliare il fabbisogno energetico costante di un data center per l'intelligenza artificiale con la natura variabile delle energie rinnovabili richiede un'attenta pianificazione. Gli operatori devono trovare un equilibrio tra vincoli di spazio, costi iniziali e affidabilità.

Confronto tra energie rinnovabili nei data center

Infografica comparativa sulle energie rinnovabili nei data center

La tabella sottostante riporta le stesse informazioni illustrate nell'infografica precedente.

Fonte di energia rinnovabile Requisiti di terreno/spazio Affidabilità (capacità di carico di base) Costo capitale iniziale Scalabilità operativa per i data center
Solare Fotovoltaico (FV) Estremamente elevato (richiede vaste aree per la produzione di energia su scala industriale) Funzionamento intermittente (richiede un'enorme capacità di accumulo di energia tramite batterie per un funzionamento 24 ore su 24, 7 giorni su 7). Da moderato ad alto (costi dell'hardware in calo, costi del terreno elevati) Facile da scalare gradualmente, ma limitato dallo spazio disponibile.
Wind Power Molto elevato (richiede corridoi geografici e spaziature specifici) Intermittente (fortemente dipendente dalle condizioni meteorologiche e dalle stagioni) Elevata (produzione di turbine e installazione specializzata) Scalabile nelle aree rurali, ma impossibile nei centri dati urbani.
idroelettrico Fisso (richiede la vicinanza a dighe esistenti o a grandi fiumi) Molto elevato (fornisce un'eccellente e costante potenza di base) Molto elevato (richiede imponenti opere di ingegneria civile in caso di nuova costruzione) Scarsa scalabilità (limitata geograficamente a regioni specifiche).
Geotermico Basso (Ingombro ridotto una volta completata la perforazione) Molto elevato (produzione di energia di base costante, 24 ore su 24, 7 giorni su 7) Rischio estremamente elevato (le perforazioni profonde e l'esplorazione comportano un elevato rischio finanziario) Eccellente nelle regioni più attive (ad esempio, l'Islanda), fortemente limitato altrove.
Reattori modulari di piccole dimensioni (SMR - Nucleari) Ingombro molto basso (adatto all'installazione in loco) Il massimo (alimentazione di base ininterrotta per decenni) Proibitivo (Attualmente in fase di sviluppo, con enormi ostacoli normativi) Elevato potenziale futuro per campus di intelligenza artificiale da oltre 100 kW; attualmente limitato.

Grazie all'utilizzo dell'IA operativa, i data center possono allineare meglio i carichi di lavoro di calcolo con la disponibilità di energia rinnovabile. Se una struttura si affida in larga misura all'energia solare, Nlyte può contribuire a programmare i carichi di lavoro di addestramento dell'IA non urgenti durante le ore di punta della luce diurna, quando l'energia rinnovabile a basso costo è abbondante. Questa sinergia tra orchestrazione IT, raffreddamento degli impianti e approvvigionamento energetico rappresenta l'apice della moderna gestione dei data center.

Il futuro appartiene a chi è proattivo

I tempi in cui si aspettava che un server si surriscaldasse prima di tentare di raffreddarlo sono finiti. Le leggi della fisica relative ai rack AI da oltre 100 kW lo impediscono categoricamente.

Affidarsi a una gestione termica reattiva garantisce il thermal throttling, danneggia i costosi cluster di GPU e costringe le apparecchiature di raffreddamento a subire inefficienti picchi di consumo energetico reattivi. Il passaggio al raffreddamento a liquido è un primo passo imprescindibile, ma l'hardware da solo non basta. È necessario un software intelligente che lo gestisca.

I data center devono colmare il divario tra il carico di lavoro IT e l'infrastruttura della struttura. Implementando il raffreddamento predittivo per l'IA, gli operatori garantiscono la stabilità termica, massimizzano l'utilizzo delle GPU e riducono significativamente i costi energetici per il raffreddamento. Sfruttando il software Nlyte e le funzionalità infrastrutturali avanzate di Carrier, la vostra struttura può prevedere il surriscaldamento prima ancora che si manifesti.


Smetti di reagire al caldo. Inizia a prevederlo.

Assumi oggi stesso il controllo della tua infrastruttura AI ad alta densità. Collabora con Nlyte Software per scoprire come la segnalazione predittiva del carico e l'IA operativa possono proteggere il tuo hardware e ottimizzare il tuo impianto.

Richiedi una demo qui: https://www.nlyte.com/nlyte-in-action/see-a-demo/

Storie correlate più recenti

MCP e LLM: l'anello mancante per una gestione più intelligente dei data center. Scopri di più
I principali modi in cui DCIM aiuta le aziende di servizi pubblici Scopri di più
Nlyte Newsbytes - Numero 10 Scopri di più
Nlyte Sicuro. Intelligente. Estensibile. Sostenibile.

Richiedi una demo oggi