Нейросеть, которой вы пользуетесь каждый день, не находится внутри одного огромного компьютера.
За ответами ChatGPT, Gemini и других передовых моделей стоят тысячи связанных ускорителей, высокоскоростные сети, системы хранения данных и электростанции.
Разбираемся, чем сервер для ИИ отличается от обычного, что происходит внутри специализированного ЦОДа, сколько вычислителей требуется передовой нейросети. А ещё узнаем, в каких странах сосредоточена основная инфраструктура.
Кто помог разобраться в теме
Изучение этого вопроса мы доверили Алисе AI в новом агенте «Исследовать».
Что даёт агент «Исследовать» в Алисе AI
Агент «Исследовать» помогает разобрать сложную техническую систему по уровням: отдельно изучить вычислители, сети, охлаждение, энергопотребление и реальные примеры крупнейших кластеров.
Что такое сервер для ИИ и почему одной мощной видеокарты уже мало
Главное: отдельного универсального типа устройства под названием «сервер искусственного интеллекта» не существует. Обычно так называют сервер, в котором основную работу выполняют специализированные ускорители: GPU NVIDIA или AMD, TPU Google и другие процессоры для матричных вычислений.
Обычный веб-сервер хорошо справляется с сайтами, базами данных и корпоративными приложениями. Большие нейросети требуют одновременно выполнять огромное количество умножений матриц, поэтому центральные процессоры уступают специализированным ускорителям по скорости и энергоэффективности.
Один современный ИИ-сервер может содержать восемь GPU, несколько терабайт оперативной памяти, десятки терабайт быстрых SSD и сетевые адаптеры с пропускной способностью в сотни гигабит в секунду. Например, NVIDIA DGX H100 объединяет восемь H100 с 640 ГБ общей видеопамяти, 2 ТБ системной памяти и восемью накопителями по 3,84 ТБ. Максимальная мощность такого сервера достигает 10,2 кВт.
1. Внутри сервера находятся не только видеокарты. Ускорители действительно выполняют основную математику, но без остальных компонентов они не смогут постоянно получать данные и обмениваться результатами.
Основные элементы ИИ-сервера
- GPU или TPU. Выполняют матричные операции, на которых основаны обучение и генерация ответов.
- Видеопамять. Хранит параметры модели, промежуточные вычисления и контекст пользовательского запроса.
- Центральные процессоры. Подготавливают данные, управляют операционной системой и распределяют задания между ускорителями.
- Оперативная память. Используется для загрузки датасетов, буферов и вспомогательных процессов.
- NVMe-накопители. Хранят части обучающих наборов, кеши и контрольные копии состояния модели.
- Высокоскоростная сеть. Соединяет GPU внутри сервера и тысячи серверов между собой.
- Система управления. Следит за температурой, питанием, ошибками памяти и состоянием каждого ускорителя.
Главное отличие от игрового компьютера заключается не только в количестве GPU. Ускорители должны общаться друг с другом настолько быстро, чтобы весь кластер воспринимался программой почти как один гигантский вычислитель.
2. Обучение и работа готовой модели — это разные задачи. Во время обучения нейросеть последовательно обрабатывает огромный набор текста, изображений, аудио и видео. После каждого шага тысячи ускорителей обмениваются результатами и корректируют миллиарды параметров модели.
Этот процесс выполняется относительно редко. Компания может несколько месяцев обучать базовую модель, а затем проводить дополнительные этапы настройки, тестирования и обучения на пользовательских предпочтениях.
После запуска начинается инференс — использование уже обученной модели. Каждый запрос нужно разбить на токены, провести через нейросеть, сформировать ответ и отправить пользователю.
Один запрос требует намного меньше вычислений, чем полное обучение. Но ChatGPT или Gemini одновременно обслуживают огромное количество людей, поэтому компаниям приходится создавать множество копий модели в разных дата-центрах.
Обучение можно сравнить со строительством завода, а инференс — с его непрерывной эксплуатацией. На создание новой модели уходит огромный разовый объём ресурсов, но по мере роста аудитории ежедневная работа сервиса способна потреблять ещё больше энергии.
Кстати: в отличие от обычного ответа, агент «Исследовать» в Алисе AI работает как ресёрч.
Он может отдельно изучить обучение модели, её ежедневную работу и инфраструктуру ЦОДов, чтобы не смешивать потребление одного запроса с энергией, затраченной на создание всей нейросети.
3. Сколько серверов требуется для обучения передовой модели. Точное количество зависит от размера модели, поколения ускорителей, объёма данных и срока, за который разработчики хотят закончить обучение.
Чем больше ускорителей подключено к задаче, тем быстрее можно завершить расчёты. Но бесконечно увеличивать кластер нельзя: GPU постоянно обмениваются данными, а при слишком медленной сети начинают ждать друг друга.
Один из наиболее понятных публичных примеров — Llama 3.1 405B. Meta сообщила, что обучала модель с 405 млрд параметров более чем на 16 000 ускорителей NVIDIA H100.
Если условно разделить 16 000 GPU на серверы по восемь ускорителей, получится около 2000 машин класса DGX H100. При максимальной паспортной мощности таких серверов только вычислительные узлы могли бы требовать до 20,4 МВт, без учёта сети, накопителей и охлаждения.
В 2020 году суперкомпьютер Microsoft для OpenAI состоял из 10 000 NVIDIA V100 и более чем 285 000 процессорных ядер. На нём обучали GPT-3, а последующие системы Azure стали ещё крупнее.
xAI позже построила кластер Colossus сначала на 100 000, а затем на 200 000 ускорителей H100. Важно, что весь этот кластер не обязательно используется для одного единственного запуска. Его мощности распределяются между обучением, дополнительной настройкой, экспериментами и обслуживанием моделей Grok.
4. Никто не знает точное количество серверов ChatGPT и Gemini. Компании не раскрывают полную архитектуру производственных кластеров, число работающих копий моделей и распределение нагрузки между странами.
OpenAI подтвердила, что GPT-4 обучался на суперкомпьютерах Microsoft Azure, но не опубликовала количество параметров, ускорителей и объём затраченных вычислений. Это сознательное ограничение технического отчёта, а не пробел в открытой статистике.
Google сообщила, что Gemini 1.0 обучали на собственной инфраструктуре с TPU v4 и TPU v5e. Точное число чипов также не раскрывалось. Один полный кластер TPU v4 мог объединять до 4096 ускорителей, а обучение крупной модели может распределяться между несколькими такими системами.
Поэтому утверждения о конкретном количестве серверов, которые якобы «питают ChatGPT», обычно являются оценками. Более корректно говорить о порядке масштаба: передовым моделям требуются десятки тысяч ускорителей для обучения и большое количество отдельных кластеров для обслуживания пользователей.
Как включить агент «Исследовать»
В браузере его можно включить на странице Алисы AI: откройте чат, выберите агент «Исследовать» и задайте вопрос. На смартфоне он доступен в приложениях Алисы или Яндекса: откройте Алису AI и выберите агент «Исследовать» перед отправкой запроса.
5. Для работы готовой модели не всегда нужны тысячи серверов одновременно. Один пользовательский запрос обычно обрабатывается одной копией модели, размещённой на одном или нескольких связанных вычислительных узлах.
Размер необходимой системы зависит прежде всего от объёма параметров. Например, только веса модели Llama 3.1 405B занимали бы около 810 ГБ при хранении каждого параметра в 16-битном формате или примерно 405 ГБ в 8-битном.
К этому нужно добавить память для контекста, промежуточных вычислений и одновременной обработки запросов. Поэтому крупная модель может занимать несколько ускорителей даже без обучения.
Сжатие и квантование позволяют размещать модель на меньшем количестве GPU, но могут влиять на качество, скорость или максимальный объём контекста. Другой вариант — использовать архитектуру Mixture of Experts, при которой для одного токена активируется только часть нейросети.
Для работы массового сервиса создаются сотни или тысячи одинаковых групп серверов. Пользователь подключается не ко всему суперкомпьютеру, а к свободной копии модели в подходящем регионе.
6. Что происходит внутри ЦОДа для ИИ. Внешне такой объект похож на обычный дата-центр: длинные ряды стоек, кабельные трассы, трансформаторы, резервные аккумуляторы, генераторы и системы охлаждения.
Разница заключается в плотности мощности. Обычная серверная стойка может потреблять несколько киловатт, тогда как современные стойки с ускорителями требуют десятки и даже больше 100 кВт.
NVIDIA GB200 NVL72 занимает одну стойку и объединяет 72 GPU Blackwell, 36 процессоров Grace, 18 вычислительных модулей и девять модулей с коммутаторами NVLink. Приблизительное энергопотребление одной стойки составляет 120 кВт.
Воздухом отвести такое количество тепла уже сложно. Процессоры и ускорители GB200 охлаждаются жидкостью, которая проходит через специальные холодные пластины. Сеть и часть накопителей по-прежнему обдуваются вентиляторами.
Во время работы ЦОДа одновременно происходят несколько процессов
- планировщик распределяет обучение и пользовательские запросы между свободными узлами
- серверы постоянно загружают части данных из распределённого хранилища
- ускорители обмениваются результатами через NVLink, InfiniBand или быстрый Ethernet
- система записывает контрольные копии обучения, чтобы не потерять недели работы при аварии
- датчики отслеживают температуру, утечки жидкости, питание и ошибки памяти
- охлаждение переносит тепло от чипов к внешним градирням или другим системам отвода тепла
Совет, как улучшить промпт: при исследовании ИИ-инфраструктуры стоит отдельно попросить сравнить обучение, инференс и энергопотребление всего ЦОДа. Иначе в ответе легко смешать мощность одного сервера, затраты на создание модели и расход энергии на один пользовательский запрос.
7. Сеть внутри ЦОДа почти так же важна, как сами ускорители. В домашнем компьютере видеокарта обменивается данными только с процессором и локальной памятью. В крупном обучающем кластере тысячи GPU должны синхронизироваться после каждого этапа вычислений.
Если один ускоритель получил данные позднее остальных, часть кластера будет простаивать. Поэтому задержки даже в доли секунды, случайные потери пакетов и перегруженный коммутатор способны замедлить всю тренировку.
В DGX H100 каждый ускоритель получает отдельное сетевое подключение InfiniBand со скоростью до 400 Гбит/с. Внутри одного сервера GPU соединяются через NVLink и NVSwitch.
В стойке GB200 суммарная пропускная способность домена NVLink достигает 130 ТБ/с. NVIDIA описывает такую стойку как единую систему из 72 тесно связанных GPU, рассчитанную на обучение и работу моделей с триллионами параметров.
Даже при такой сети сбои неизбежны. На масштабе тысяч серверов регулярно выходят из строя накопители, блоки питания, кабели и сетевые адаптеры. Программное обеспечение должно исключать повреждённый узел, переносить задачу и продолжать обучение с последней сохранённой копии.
8. Сколько ИИ-серверов находится в каждой стране. Точного мирового реестра не существует. Amazon, Microsoft, Google, Meta, OpenAI, ByteDance и другие компании не публикуют полные списки своих серверов.
Само слово «сервер» тоже мешает подсчёту. Один корпус DGX содержит восемь ускорителей, а современная стойка NVL72 фактически объединяет 18 вычислительных узлов и 72 GPU. Два дата-центра с одинаковым количеством серверов могут отличаться по производительности в десятки раз.
В качестве приблизительного ориентира можно использовать TOP500 — список 500 самых производительных публично заявленных суперкомпьютеров. В ноябре 2025 года распределение выглядело так:
- США — 171 система
- Япония — 43 системы
- Германия — 40 систем
- Китай — 40 систем
- Франция — 23 системы
- Канада — 19 систем
- Италия — 18 систем
- Южная Корея — 15 систем
- Тайвань и Бразилия — по 10 систем
TOP500 не показывает реальное количество коммерческих ИИ-серверов. В список попадают только системы, владельцы которых согласились провести тест и раскрыть результат. В нём также присутствуют научные суперкомпьютеры, не предназначенные исключительно для нейросетей.
Более широкий показатель — энергопотребление всех дата-центров. По расчётам Международного энергетического агентства, в 2024 году на США приходилось около 45% мирового потребления электричества ЦОДами, на Китай — 25%, на Европу — 15%. Эти цифры тоже включают не только ИИ, но хорошо показывают концентрацию основной вычислительной инфраструктуры.
9. Сколько электричества потребляет искусственный интеллект. Отделить ИИ от остальных облачных задач сложно. Один и тот же дата-центр может одновременно обслуживать нейросети, видеохостинг, базы данных, корпоративные приложения и обычные сайты.
По оценке Международного энергетического агентства, все дата-центры мира использовали около 415 ТВт·ч электроэнергии в 2024 году. Это примерно 1,5% мирового потребления. К 2030 году показатель может вырасти до 945 ТВт·ч, а ИИ станет главным источником этого роста.
Потребление ускоренных серверов, которые в основном используются для ИИ, по базовому сценарию IEA будет увеличиваться примерно на 30% в год. На них придётся почти половина всего прироста потребления дата-центров до конца десятилетия.
В США ЦОДы могут обеспечить почти половину роста спроса на электроэнергию до 2030 года. К концу десятилетия американские дата-центры, по прогнозу IEA, станут потреблять больше электричества, чем производство всех энергоёмких товаров страны вместе взятых.
Проблема проявляется не только на уровне целой страны. Новый ИИ-ЦОД может потребовать сотни мегаватт в одном конкретном районе, где электросети, трансформаторы и линии передачи не рассчитывались на такую нагрузку.
10. Один запрос к нейросети потребляет относительно немного. В 2025 году Google опубликовала собственную методику измерения Gemini. Медианный текстовый запрос в приложениях Gemini потреблял около 0,24 Вт·ч электричества и 0,26 мл воды с учётом инфраструктуры дата-центра.
OpenAI Academy приводит оценку Epoch AI, согласно которой типичный запрос к GPT-4o требует примерно 0,3 Вт·ч. Компания отдельно отмечает, что старые оценки на уровне 3 Вт·ч часто опирались на устаревшие предположения.
Эти значения нельзя переносить на любой запрос. Короткий текстовый ответ, длинное рассуждение, генерация изображения и создание видео требуют разного количества вычислений.
Кроме того, малая цифра на один запрос умножается на миллионы пользователей. Именно массовый инференс постепенно превращается в один из главных потребителей вычислительной мощности.
Энергоэффективность при этом быстро улучшается. Google утверждает, что за один 12-месячный период медианное потребление энергии на текстовый запрос Gemini сократилось в 33 раза при одновременном повышении качества ответов.
Почему для ИИ строят отдельные электростанции и новые дата-центры
Существующий ЦОД не всегда можно просто заполнить современными ускорителями. Здание может не выдержать нужную нагрузку на электросеть, систему охлаждения и пол.
Один DGX H100 весит около 130 кг и потребляет до 10,2 кВт. В стандартную стойку рекомендуется устанавливать не больше четырёх таких серверов из-за ограничений по охлаждению.
Новые системы Blackwell довели потребление одной стойки примерно до 120 кВт. Для десятков таких стоек нужны отдельные трансформаторы, мощные насосы, жидкостное охлаждение, резервное питание и несколько независимых подключений к энергосети.
Технологические компании заключают долгосрочные договоры с атомными, газовыми, солнечными и геотермальными электростанциями. По прогнозу IEA, почти половину дополнительного спроса ЦОДов до 2035 года обеспечат возобновляемые источники, но значительная часть также придётся на газ и атомную энергетику.
Строительство самого вычислительного корпуса может занять меньше времени, чем создание новых линий электропередачи и генерирующих мощностей. Поэтому доступ к электричеству становится для ИИ-компаний не менее важным ограничением, чем поставки GPU.
Можно ли запустить собственный ИИ без гигантского ЦОДа
Для использования искусственного интеллекта не всегда нужны тысячи серверов. Небольшие модели работают на одном GPU, обычном компьютере и даже смартфоне.
Крупная компания может взять готовую открытую модель, уменьшить её точность, ограничить длину контекста и обслуживать сотрудников на одном или нескольких серверах. Такой вариант подходит для поиска по документам, расшифровки звонков, подготовки текстов и внутренних помощников.
Огромные кластеры нужны для создания передовых универсальных моделей и обслуживания массовой аудитории. Разница между локальной нейросетью и ChatGPT заключается не только в качестве модели, но и в количестве одновременных пользователей, скорости ответа, резервировании и доступности по всему миру.
Поэтому один ИИ может работать внутри смартфона, а другой занимать несколько дата-центров. Обе системы остаются нейросетями, но решают задачи совершенно разного масштаба.
Что на самом деле ограничивает развитие ИИ
Несколько лет назад главным ограничением считалось количество доступных ускорителей. Теперь к нему добавились электросети, охлаждение, трансформаторы, сетевое оборудование и площадки, способные принять стойки мощностью больше 100 кВт.
Передовая модель требует не одного суперсервера, а правильно собранной системы. Тысячи GPU должны получать данные, обмениваться результатами, сохранять контрольные копии и продолжать работу даже после отказов отдельных узлов.
США пока сохраняют самое большое количество публично известных суперкомпьютеров и крупнейшую долю энергопотребления ЦОДов. Китай занимает второе место по потреблению, а Европа, Япония, Южная Корея и другие регионы активно строят собственную инфраструктуру.
В ближайшие годы победителем станет не обязательно компания, купившая больше всего чипов. Не менее важно, кто сумеет обеспечить их электричеством, связать быстрой сетью, отвести тепло и постоянно загружать полезной работой.
Агент «Исследовать» помогает собрать глубокий разбор по теме: разложить вопрос на части, пройтись по источникам, сопоставить факты и собрать структурированный вывод.
В браузере его можно включить на странице Алисы AI: откройте чат, выберите агент «Исследовать» и задайте вопрос. На смартфоне он доступен в приложениях Алисы или Яндекса: откройте Алису AI и выберите агент «Исследовать» перед отправкой запроса.
Ваше слово: согласны или нет?