Охолодження гарячою водою: новий стандарт для інфраструктури штучного інтелекту

  • Перехід на рідинне охолодження безпосередньо до кристала є вкрай необхідним через щільність потужності, що перевищує 50 кВт на стійку.
  • Використання гарячої води (до 45 °C) дозволяє відмовитися від чилерів та значно зменшує споживання води та енергії.
  • Скоординована інтеграція між розподілом електроенергії та управлінням теплопостачанням може збільшити обчислювальну продуктивність до 33%.

Системи охолодження для штучного інтелекту

Термічний менеджмент у центрах обробки даних перестав бути простою технічною деталлю та став... центральна вісь, що визначає життєздатність Штучний інтелект. Зі стрімким розвитком генеративного штучного інтелекту ми бачимо стійки, щільність потужності яких перевищує 50 кВт, що робить традиційне кондиціонування повітря неадекватним і повністю неможливим. Це не повільна зміна, а різкий перехід на рідинне охолодження безпосередньо до процесора, що вже не є лабораторним експериментом, а основою будь-якої установки, яка хоче залишатися конкурентоспроможною.

У цьому новому сценарії концепція охолодження гарячою водоюВикористання систем охолодження, де охолоджуюча рідина надходить з температурою понад 40 або навіть 45°C, перевертає проектування центрів обробки даних з ніг на голову. Йдеться не просто про зміну охолоджуючої рідини; це фундаментальний зсув. переосмислення електричної архітектури та розподільчих систем. Сьогодні успіх вимірюється не лише показником PUE, а й оцінкою того, скільки реальної обчислювальної потужності можна вичавити з кожного кіловата, підключеного до електричної мережі, що робить теплову ефективність питанням... Чиста та проста прибутковість для бізнесу.

Інфраструктура штучного інтелекту для центрів обробки даних
Пов’язана стаття:
Революція інфраструктури центрів обробки даних на основі штучного інтелекту переосмислює енергетичний та технологічний суверенітет

Технічний стрибок: навіщо використовувати гарячу воду?

На перший погляд, охолодження чіпсів водою з температурою 45°C звучить божевільно, майже як використання води з гарячої ванни, але саме в цьому і полягає магія ефективності. Логіка проста: чим вища температура циркулюючої рідини, Легше вивести жар назовні без необхідності використання компресорів або чилерів, які споживають величезну кількість енергії. Це дозволяє центрам обробки даних використовувати сухі чилери замкнутого циклу, практично усуваючи залежність від випарного охолодження та зменшуючи споживання води майже до нуля у сприятливих кліматичних умовах.

Щоб це спрацювало, важливо виконати наступне: вдосконалені холодні пластини з внутрішніми мікроструктурамиЦі високоточні компоненти дозволяють відводити від 80% до 90% тепла безпосередньо в графічний або процесорний процесор. Якщо материнська плата посередня, система вийде з ладу; якщо вона високої якості, теплом можна керувати на рівні чіпа настільки ефективно, що тепер можна перенаправити енергетичний бюджет, який раніше витрачався на повітряне охолодження. перенаправлення для живлення більшої кількості графічних процесорівЦе призводить до збільшення обчислювальної потужності та відповідає революція теплового обладнання струм

Альянс Intel та Foxconn для створення інфраструктури штучного інтелекту
Пов’язана стаття:
Intel та Foxconn об'єднують зусилля для трансформації глобальної інфраструктури штучного інтелекту

Критичні компоненти: CDU та мережева архітектура

Серцем цієї системи є блоки розподілу холодоагенту або Розумні блоки живлення (CDU)Ці блоки не лише переміщують рідину, але й діють як «мозок», який координує охолодження з електричною архітектурою. Коли обидві системи спроектовані разом, Набагато більша надійність від чіпа до мережізапобігання перетворенню ХДУ на операційне вузьке місце.

  • Холодні плити: Розроблено для обробки теплової потужності до 1.500 Вт, сумісне з кремнієвими процесорами NVIDIA, AMD або Intel.
  • Інтелектуальні блоки CDU: Вони керують витратами та потужностями від 105 кВт до 2,3 МВт.
  • Рейкові колектори: Колектори з нержавіючої сталі, що забезпечують плавний та безпротікальний потік між пластинами та блоком опалення.
  • Теплообмінники задніх дверей (RDHx): Рішення, що відводять тепло за допомогою рідинноохолодженого повітря, потужністю до 75 кВт.

Впровадження цих технологій дозволяє використовувати рідинне охолодження до 3.000 разів ефективніший за повітря для збору теплової енергії. Крім того, завдяки зменшенню шуму та викидів вуглецю створюються набагато стійкіші та безпечніші умови експлуатації, що зменшує залежність від важкої інфраструктури, такої як CRAH або традиційні конденсатори.

Функції та обіцянки Intel 18a
Пов’язана стаття:
Intel 18A: особливості, обіцянки та його вплив на штучний інтелект

Економічний вплив та бачення «Фабрик штучного інтелекту»

Ми переходимо від сприйняття центру обробки даних як холодної кімнати, повної серверів, до розуміння його як оптимізований промисловий заводЦя концепція «фабрики штучного інтелекту» спрямована на максимізацію виробництва токенів та навчання масивних моделей. Згідно з галузевими даними, інтеграція передового рідинного охолодження може представляти собою економія енергії від 20% до 40%, що безпосередньо впливає на звіт про прибутки та збитки.

Стратегія таких гігантів, як NVIDIA, з їхніми референсними платформами, такими як DSX та покоління Rubin, вказує на... 100% рідинно-охолоджена інфраструктураЦе передбачає повне виключення внутрішніх вентиляторів, інтеграцію мережевих, обчислювальних та енергетичних компонентів в єдину екосистему. Оптимізуючи тепловий дизайн, можна досягти до [відсутній процент]. На 33% більше обчислювальної продуктивності на одне електричне підключення, що дозволяє розмістити більше енергії на меншій площі квадратних метрів.

Хоча це здається панацеєю, перехід від добре налаштованої системи повітряного охолодження до рідинної системи охолодження пов'язаний з експлуатаційними ризиками та значною складністю інтеграції. Однак, коли стійки перевищують 50 кВт, Рідинне охолодження більше не є необов'язковимЦе вже не розкіш для високопродуктивних обчислень (HPC) або наукових обчислень, а незамінна вимога для підтримки робочого навантаження моделей великих мов програмування (LLM) без збоїв обладнання через перегрів або скорочення терміну його служби.


Додати як пріоритетне джерело в Google