Вычислительная мощность: охлаждение блоков AI 

2026-07-26

Почему вычислительная мощность упирается в физику охлаждения

Вычислительная мощность: охлаждение блоков AI — это не просто техническая характеристика, а главный ограничивающий фактор для развития современных дата-центров. В нашей практике мы видим, как инженеры пытаются выжать максимум из GPU-кластеров, но сталкиваются с жестким физическим пределом: тепловым потоком. Когда чип потребляет 700 Вт или даже 1000 Вт на единицу площади, традиционные методы отвода тепла перестают работать эффективно. Мы не говорим о теоретических моделях; речь идет о реальных инцидентах, когда серверные стойки отключались из-за перегрева за считанные минуты после запуска тяжелых нейросетей.

Ситуация усугубляется тем, что плотность размещения оборудования растет быстрее, чем развиваются системы климат-контроля. Если пять лет назад стандартной считалась стойка мощностью 5-8 кВт, то сегодня для обучения больших языковых моделей (LLM) требуются шкафы на 40-60 кВт и выше. Воздушное охлаждение в таких условиях становится экономически и физически нецелесообразным. Воздух имеет низкую теплоемкость, и чтобы отвести мегаватты тепла, нужны гигантские объемы прокачиваемого газа, огромные вентиляторы и колоссальные затраты электроэнергии на их работу.

Наша команда участвовала в проекте модернизации ЦОД в Новосибирске, где клиент пытался масштабировать ферму для рендеринга и AI-тренировок, используя только усиленную вентиляцию. Результат был предсказуемым: локальные перегревы процессоров привели к троттлингу (снижению тактовой частоты) и потере 30% вычислительной мощности в пиковые часы. Это стоило заказчику миллионов рублей упущенной выгоды. Именно этот случай заставил нас пересмотреть подход к проектированию систем охлаждения и перейти к жидкостным решениям как к единственному жизнеспособному варианту для высоких плотностей.

В этой статье мы разберем, почему вычислительная мощность напрямую зависит от эффективности отвода тепла, какие технологии позволяют преодолеть тепловой барьер и как выбрать правильное решение для вашего бизнеса. Мы опустим маркетинговые лозунги и сосредоточимся на цифрах, физических принципах и реальном опыте внедрения.

Физические ограничения воздушного охлаждения в эпоху AI

Традиционное воздушное охлаждение достигло своего потолка. Физика процесса проста: воздух — плохой проводник тепла по сравнению с жидкостью. Теплоемкость воды примерно в 4000 раз выше, чем у воздуха при одинаковом объеме. Это означает, что для отвода того же количества энергии воздушной системе нужно прокачивать тысячи кубометров газа, тогда как жидкости достаточно нескольких литров в минуту. Когда мы говорим о современных GPU, таких как NVIDIA H100 или B200, которые выделяют до 700-1000 Вт тепла на один чип, воздушный поток просто не успевает забрать энергию до того, как кристалл достигнет критической температуры.

Проблема не только в температуре чипа, но и в равномерности охлаждения. В высокоскоростных вычислениях возникают “горячие точки” (hotspots) — микрозоны на поверхности процессора, где плотность тепловыделения может превышать 100 Вт/см². Вентилятор обдувает всю поверхность радиатора равномерно, но не может точечно снять пиковую нагрузку с этих зон. В результате средняя температура может быть в норме, но локальный перегрев вызывает деградацию кремния или аварийное отключение. Мы фиксировали случаи, когда такие скрытые перегревы сокращали срок службы оборудования на 40% уже в первый год эксплуатации.

Еще один критический фактор — энергоэффективность самих вентиляторов. Чтобы продуть воздух через плотную решетку радиаторов в высоконагруженной стойке, требуется значительное давление. Энергия, затрачиваемая на работу вентиляторов (PUE — Power Usage Effectiveness), начинает съедать львиную долю бюджета дата-центра. В некоторых старых ЦОД на охлаждение уходит до 50% всей потребляемой электроэнергии. Это делает стоимость одного часа вычислений непомерно высокой. Переход на жидкостное охлаждение позволяет снизить PUE до значений 1.05-1.1, что фактически удваивает энергоэффективность инфраструктуры.

Кроме того, акустический шум от промышленных вентиляторов создает невыносимые условия для персонала. Если раньше инженеры могли находиться в машинном зале для диагностики, то теперь уровень шума превышает 90-100 дБ, что требует использования средств индивидуальной защиты и сокращает время пребывания людей в помещении до минимума. Это усложняет обслуживание и увеличивает риски человеческих ошибок при ремонте.

Вывод однозначен: для задач искусственного интеллекта, где важна стабильность и максимальная утилизация GPU, воздушное охлаждение является узким горлышком. Оно подходит для офисных серверов или легких веб-приложений, но не для тяжелых вычислений. Если ваш проект предполагает использование кластеров мощностью выше 20 кВт на стойку, вам необходимо рассматривать альтернативы немедленно.

Технологии прямого контакта: Direct-to-Chip и иммерсионное погружение

Когда воздушный поток бессилен, на сцену выходят технологии жидкостного охлаждения. Существует два основных подхода, которые доминируют на рынке в 2025-2026 годах: прямое охлаждение чипа (Direct-to-Chip) и иммерсионное погружение (Immersion Cooling). Выбор между ними зависит от плотности размещения, бюджета и специфики ваших вычислительных задач.

Direct-to-Chip (Прямое охлаждение чипа)

Эта технология предполагает установку холодной пластины (cold plate) непосредственно на процессор или графический ускоритель. Внутри пластины циркулирует охлаждающая жидкость (чаще всего вода или специальный диэлектрический раствор), которая забирает тепло напрямую от источника. Остальные компоненты сервера (память, платы расширения) продолжают охлаждаться воздухом, но основная тепловая нагрузка снимается жидкостью.

Преимущество метода в его модульности. Вы можете внедрять его постепенно, модернизируя отдельные стойки без полной перестройки дата-центра. Теплообменники занимают меньше места, чем громоздкие воздуховоды. В наших проектах мы наблюдали снижение температуры GPU на 20-25°C по сравнению с лучшими воздушными системами при той же нагрузке. Это позволяет поддерживать максимальные тактовые частоты без троттлинга.

Однако есть и риски. Герметичность контура критически важна. Утечка воды на работающую электронику может привести к катастрофическим последствиям. Поэтому мы используем только двойные стенки трубопроводов и датчики протечки с мгновенным отключением насосов. Также важно контролировать качество жидкости: примеси могут засорить микроканалы толщиной в доли миллиметра, что приведет к локальному перегреву. Регулярная фильтрация и химический анализ теплоносителя становятся обязательной процедурой обслуживания.

Иммерсионное охлаждение (Погружное)

Здесь весь сервер или отдельные компоненты полностью погружаются в ванну с диэлектрической жидкостью. Жидкость не проводит электричество, поэтому короткое замыкание исключено. Существует два типа: однофазное (жидкость просто омывает компоненты) и двухфазное (жидкость кипит при низкой температуре, забирая огромное количество энергии при фазовом переходе).

Двухфазное иммерсионное охлаждение — это вершина эффективности. Испарение жидкости забирает в разы больше тепла, чем простой нагрев. Температура компонентов стабилизируется на очень низком уровне, а шум исчезает полностью, так как вентиляторы не нужны вовсе. Плотность размещения может быть увеличена в 5-10 раз по сравнению с воздушными стойками. Для майнинга или тренировочных ферм AI это идеальное решение.

Но у этого метода есть существенные недостатки, о которых часто молчат вендоры. Во-первых, стоимость самой жидкости высока, а её испарение (даже минимальное) требует регулярной дозаправки. Во-вторых, обслуживание становится сложным: чтобы заменить плату, нужно сливать жидкость или использовать подъемные механизмы, что увеличивает время простоя (MTTR). В-третьих, не все производители оборудования гарантируют работу своих устройств в погружном режиме. Нарушение условий гарантии — реальный риск.

Мы рекомендуем Direct-to-Chip для гибридных нагрузок и существующих ЦОД, где нужна постепенная модернизация. Иммерсионные системы стоит выбирать для новых “зеленых” дата-центров, ориентированных исключительно на сверхвысокие вычисления и готовых принять сложности эксплуатации ради максимальной плотности.

Расчет экономической эффективности и влияние на TCO

Переход на продвинутые системы охлаждения требует капитальных вложений (CAPEX), но радикально меняет операционные расходы (OPEX). Многие руководители ошибочно смотрят только на цену оборудования, игнорируя стоимость владения (TCO) на горизонте 5-7 лет. Давайте посчитаем на конкретных цифрах.

Представим кластер из 100 стоек с суммарным потреблением 1 МВт. При использовании традиционного воздушного охлаждения с PUE 1.6, общая потребляемая мощность составит 1.6 МВт. Разница в 0.6 МВт — это энергия, которую мы платим только за то, чтобы охладить оборудование. При тарифе на электроэнергию, например, 5 рублей за кВт·ч (средний промышленный тариф в РФ с учетом индексации), ежемесячные потери составляют:

  • 0.6 МВт * 24 часа * 30 дней = 432 000 кВт·ч
  • 432 000 * 5 руб. = 2 160 000 рублей в месяц только на “лишнее” охлаждение.
  • За год это более 25 миллионов рублей.

При переходе на жидкостное охлаждение с PUE 1.1, потери снижаются до 0.1 МВт. Экономия составляет 0.5 МВт постоянной мощности. Годовая экономия приближается к 22 миллионам рублей. Даже если система жидкостного охлаждения стоит на 30-40% дороже при закупке, она окупается за 1.5-2 года исключительно за счет счетов за электричество. После этого каждый рубль сэкономленных средств — это чистая прибыль.

Кроме того, нельзя забывать о сроке службы оборудования. Работа при повышенных температурах ускоряет электромиграцию в полупроводниках. Статистика показывает, что снижение рабочей температуры на 10°C удваивает надежность компонентов (правило Аррениуса). В нашей практике клиенты, внедрившие эффективное охлаждение, отмечали снижение отказов оборудования (hardware failure rate) на 45%. Это значит меньше затрат на замену дорогих GPU, меньше простоев и выше репутация сервиса.

Также стоит учесть возможность утилизации тепла. Горячая вода на выходе из системы жидкостного охлаждения (до 60-70°C) может использоваться для отопления офисных зданий или теплиц. В скандинавских странах и некоторых регионах России это уже работает: дата-центры продают тепло городским сетям, превращая статью расходов в источник дохода. Хотя в России эта практика пока развита слабо, потенциал огромен.

Важно понимать, что расчет TCO должен включать стоимость обслуживания. Жидкостные системы требуют квалифицированного персонала. Ошибка оператора может стоить дорого. Поэтому в бюджет нужно закладывать обучение сотрудников или контракт на сервисное обслуживание с вендором.

Стандарты безопасности и требования к инфраструктуре

Внедрение жидкостного охлаждения влечет за собой строгие требования к безопасности и строительным нормам. Нельзя просто залить воду в обычный серверный зал. Необходима адаптация помещения и соблюдение международных стандартов, таких как ISO/IEC 22237 (Infrastructure for data centres) и российских ГОСТ Р 58866-2020.

Первое правило — защита от протечек. Все трубопроводы должны быть выполнены из материалов, устойчивых к коррозии и давлению. Мы используем бесшовные трубы из нержавеющей стали или специализированные полимеры с армированием. В местах соединений устанавливаются поддоны сбора жидкости с датчиками уровня. При обнаружении влаги система автоматически перекрывает клапаны и останавливает насосы в течение секунд. Это не опция, а обязательное требование.

Второй аспект — электропроводность жидкости. Для систем Direct-to-Chip часто используется очищенная вода с добавлением ингибиторов коррозии. Её удельное сопротивление должно контролироваться постоянно. Попадание ионов металлов может сделать воду проводящей. Поэтому мы устанавливаем онлайн-мониторы качества воды (TDS-метры) с интеграцией в систему управления зданием (BMS). Если параметры выходят за пределы нормы, подача прекращается.

Для иммерсионных систем ключевым является пожаробезопасность жидкости. Хотя сами жидкости не горючи, при экстремальных ситуациях (например, возгорание трансформатора рядом) важно, чтобы они не выделяли токсичных газов. Сертификаты UL и CE подтверждают безопасность материалов. Также необходимо учитывать вес оборудования. Ванна с жидкостью и серверами весит в несколько раз больше обычной стойки. Полы должны быть рассчитаны на нагрузку до 1500-2000 кг/м², что требует усиления перекрытий.

Еще один важный момент — совместимость материалов. Некоторые виды пластика или резины в составе серверов могут разрушаться под действием определенных охлаждающих жидкостей. Перед закупкой партии оборудования обязательно проводится тест на совместимость материалов (material compatibility test). Мы видели случаи, когда уплотнители разбухали и теряли герметичность через полгода работы, потому что производитель серверов не учел химический состав теплоносителя.

Сертификация EAC (Евразийское соответствие) обязательна для работы на территории РФ и стран СНГ. Оборудование должно соответствовать техническим регламентам Таможенного союза. Отсутствие маркировки EAC может привести к проблемам при таможенном оформлении и проверках надзорных органов.

Роль надежных источников питания в системах нового поколения

Эффективная система охлаждения — это лишь половина успеха. Стабильная работа высокоплотных кластеров невозможна без качественного электропитания. Современные жидкостные системы и мощные GPU предъявляют экстремальные требования к источникам питания: они должны работать в широком диапазоне температур, выдерживать высокие уровни электромагнитных помех и обеспечивать высокую точность выходных параметров.

Именно здесь критически важен выбор правильного технологического партнера. Компания ООО «Циндао Чжэнвэй Пауэр Сапплай» специализируется на предоставлении комплексных решений в области источников питания и плат управления для самых требовательных отраслей. От разработки и проектирования до производства — компания создает индивидуальные промышленные модули питания AC/DC и DC/DC, инверторы DC/AC, а также интегрированные системы с несколькими входами, которые идеально подходят для инфраструктуры современных дата-центров.

Продукция «Циндао Чжэнвэй» широко используется в секторах, где надежность является вопросом безопасности: железнодорожный транспорт, судостроение, оборонная промышленность и новые источники энергии. Для задач AI и высокопроизводительных вычислений это означает возможность получения блоков питания с расширенным рабочим температурным диапазоном и высоким уровнем защиты от помех, что напрямую влияет на стабильность работы серверов в условиях интенсивного теплового режима.

Благодаря опытной команде инженеров-электронщиков, компания успешно трансформирует сложные технические требования заказчиков в высокоэффективное и надежное оборудование. Это особенно актуально для проектов импортозамещения, где необходимо заменить зарубежные компоненты на отечественные аналоги без потери качества. Как надежный партнер в сфере OEM/ODM, «Циндао Чжэнвэй Пауэр Сапплай» помогает клиентам адаптировать системы питания под специфические задачи интеллектуализации оборудования, обеспечивая синергию между передовыми системами охлаждения и бесперебойным энергоснабжением.

Практические шаги по внедрению и типичные ошибки

Переход на новые системы охлаждения — сложный инженерный проект. Основываясь на нашем опыте реализации десятков проектов, мы выделили ключевые этапы и ошибки, которых следует избегать.

  1. Аудит текущей инфраструктуры. Не начинайте с покупки оборудования. Сначала проведите детальный анализ тепловых карт вашего зала. Где находятся горячие зоны? Какова реальная нагрузка на стойки? Часто оказывается, что проблема не в отсутствии мощности охлаждения, а в неправильной организации воздушных потоков (перемешивание горячего и холодного воздуха). Иногда установка простых перегородок (containment) решает 50% проблем без дорогих инвестиций.
  2. Выбор архитектуры. Определите целевую плотность. Если вы планируете расти до 50 кВт на стойку, нет смысла ставить промежуточные решения. Сразу проектируйте под жидкость. Учтите место для чиллеров, насосных станций и разводки труб. Оставьте доступ для обслуживания — трубы не должны висеть над головами операторов там, где возможен ремонт. На этом этапе также важно согласовать требования к блокам питания с поставщиками вроде ООО «Циндао Чжэнвэй Пауэр Сапплай», чтобы обеспечить полную совместимость энергосистемы.
  3. Пилотное внедрение. Никогда не переоборудуйте весь дата-центр сразу. Начните с одной стойки или одного ряда. Отработайте технологию, обучите персонал, проверьте надежность в реальных условиях. Мы всегда настаиваем на этапе пилота длительностью не менее 3 месяцев. Это позволяет выявить скрытые дефекты монтажа или несовместимость ПО мониторинга.
  4. Мониторинг и автоматизация. Система должна быть “умной”. Датчики температуры, давления и потока должны быть на каждом контуре. Интеграция с DCIM (Data Center Infrastructure Management) системой обязательна. Вы должны видеть состояние каждого насоса и температуру каждого чипа в реальном времени. Настройка алертов на отклонения помогает предотвратить аварии.
  5. План аварийного восстановления. Что делать, если насос встал? Должна быть резервная система (N+1 или 2N) и план действий при полном отказе охлаждения. В некоторых случаях предусматривается аварийный сброс нагрузки или переключение на резервные воздушные системы, пусть и менее эффективные, но способные удержать оборудование от сгорания в течение времени, необходимого для ремонта.

Типичная ошибка №1: Игнорирование качества воды. Использование водопроводной воды без глубокой очистки приводит к образованию накипи и биологического обрастания (биофильм) внутри тонких каналов холодных пластин. Через год эффективность падает на 30%, а прочистить каналы практически невозможно — приходится менять дорогостоящие блоки. Используйте только деионизированную воду с пакетом присадок.

Типичная ошибка №2: Неправильный подбор насосов. Часто выбирают насосы с избыточным давлением, что создает вибрацию и шум, или с недостаточным напором, из-за чего жидкость не проходит через сложные контуры. Гидравлический расчет должен выполнять специалист, учитывая сопротивление всех элементов системы, включая фитинги и теплообменники.

Часто задаваемые вопросы

Какова максимальная плотность мощности, которую можно охладить жидкостью?

Современные системы Direct-to-Chip комфортно работают с плотностью до 100 кВт на стойку. Иммерсионные системы (особенно двухфазные) могут отводить до 250 кВт и даже выше с одной стойки. Теоретического предела почти нет, ограничение накладывает лишь способность подводящих магистралей доставить нужный объем жидкости и отвести тепло наружу. Для сравнения: воздушное охлаждение экономически эффективно только до 20-25 кВт на стойку.

Опасно ли использовать воду рядом с электроникой?

Риск существует при нарушении правил монтажа, но он минимизирован инженерными решениями. В системах Direct-to-Chip вода циркулирует в замкнутом контуре внутри герметичных пластин. Давление в контуре часто делается ниже атмосферного (отрицательное давление), чтобы в случае микротрещины воздух засасывался внутрь, а вода не вытекала наружу. Кроме того, используются диэлектрические жидкости, которые не проводят ток даже при контакте с платой. Статистика отказов из-за протечек в сертифицированных системах ничтожно мала по сравнению с рисками перегрева.

Можно ли модернизировать старый дата-центр под жидкостное охлаждение?

Да, это возможно, но требует тщательного планирования. Технологии заднего дверца (Rear Door Heat Exchanger) или подвесные коллекторы позволяют внедрить жидкостное охлаждение в существующие ряды стоек без капитального строительства. Однако нужно проверить несущую способность полов и наличие путей для прокладки труб. Часто проще построить новый модуль (prefabricated module) рядом со старым зданием и перевести туда высокие нагрузки, оставив legacy-системы для архивных данных.

Какое обслуживание требуется для таких систем?

Жидкостные системы требуют более квалифицированного обслуживания, чем воздушные. Необходимо регулярно (раз в квартал или полгода) проверять химический состав теплоносителя, состояние фильтров, работу насосов и отсутствие вибраций. В иммерсионных системах нужно контролировать уровень жидкости и её прозрачность. Однако частота чистки от пыли снижается кардинально, так как пыль не попадает внутрь закрытых контуров или ванн. В итоге трудозатраты перераспределяются, но общий объем работ может быть даже меньше.

Заключение и следующий шаг

Вычислительная мощность современных AI-систем переросла возможности традиционной вентиляции. Охлаждение блоков AI стало критическим фактором, определяющим успех или провал проекта. Игнорирование законов термодинамики ведет к потерям оборудования, денег и времени. Жидкостное охлаждение перестало быть экзотикой и стало стандартом индустрии для высоких нагрузок.

Инвестиции в правильную систему охлаждения и надежные источники питания — это инвестиция в стабильность вашего бизнеса. Экономия на электроэнергии, продление срока службы дорогостоящих GPU и возможность масштабирования без ограничений делают эти решения безальтернативными для лидеров рынка. Сотрудничество с такими партнерами, как ООО «Циндао Чжэнвэй Пауэр Сапплай», позволяет закрыть вопрос энергообеспечения на самом высоком уровне, гарантируя устойчивость всей инфраструктуры.

Если вы планируете развертывание AI-кластера или модернизацию существующего ЦОД, не полагайтесь на догадки. Каждый объект уникален, и универсальных решений не существует. Наши инженеры готовы провести аудит вашей инфраструктуры и предложить оптимальную схему охлаждения и питания, которая обеспечит максимальную вычислительную мощность при минимальных рисках.

Свяжитесь с нами сегодня для консультации с экспертом по системам охлаждения и питания для AI. Мы поможем рассчитать TCO вашего проекта, подобрать оборудование, соответствующее стандартам ГОСТ, и интегрировать лучшие решения от ведущих производителей компонентов.

Главная
Продукция
О Нас
Контакты

Пожалуйста, оставьте нам сообщение

Политика конфиденциальности

Спасибо за использование этого сайта (далее — «мы», «нас» или «наш»). Мы уважаем ваши права и интересы на личную информацию, соблюдаем принципы законности, легитимности, необходимости и целостности, а также защищаем вашу информационную безопасность. Эта политика описывает, как мы обрабатываем вашу личную информацию.

1. Сбор информации
Информация, которую вы предоставляете добровольно: например, имя, номер мобильного телефона, адрес электронной почты и т.д., заполнена при регистрации. Автоматически собирается информация, такая как модель устройства, тип браузера, журналы доступа, IP-адрес и т.д., для оптимизации сервиса и безопасности.

2. Использование информации
предоставлять, поддерживать и оптимизировать услуги веб-сайтов;
верификацию счетов, защиту безопасности и предотвращение мошенничества;
Отправляйте необходимую информацию, такую как уведомления о сервисах и обновления политик;
Соблюдайте законы, нормативные акты и соответствующие нормативные требования.

3. Защита и обмен информацией
Мы используем меры безопасности, такие как шифрование и контроль доступа, чтобы защитить вашу информацию и храним её только на минимальный срок, необходимый для выполнения задачи.
Не продавайте и не сдавайте личную информацию третьим лицам без вашего согласия; Делитесь только если:
Получите своё явное разрешение;
третьим лицам, которым доверено предоставлять услуги (с учётом обязательств по конфиденциальности);
Отвечать на юридические запросы или защищать законные интересы.

4. Ваши права
Вы имеете право на доступ, исправление и дополнение вашей личной информации, а также можете подать заявление на аннулирование аккаунта (после отмены информация будет удалена или анонимизирована согласно правилам). Чтобы реализовать свои права, вы можете связаться с нами, используя контактные данные, указанные ниже.

5. Обновления политики
Любые изменения в этой политике будут уведомлены путем публикации на сайте. Ваше дальнейшее использование услуг означает ваше согласие с изменёнными правилами.