Тариф успешно добавлен в корзину
В корзину

Анатомия дата-центра: как устроены ЦОДы изнутри

Дата-центр — это объект, на котором размещается серверное и сетевое оборудование. Внутри таких площадок сосредоточены вычислительные мощности, системы хранения данных и инженерная инфраструктура: электропитание, охлаждение и безопасность.

Для бизнеса ЦОДы стали основой IT-инфрастурктуры. Компании используют их для развертывания собственной инфраструктуры, разработки приложений, перепродажи вычислительных мощностей и т. д. В этой статье разберем, как устроен современный дата-центр и на какие критерии стоит опираться при его выборе.

Устройство дата-центра

Системы электропитания

Дата-центр не может получать энергию напрямую из городской сети из-за большого количества помех и постоянных скачков и просадок напряжения. Чтобы защитить оборудование, используют источники бесперебойного питания (ИБП) вместе с резервными генераторами (ДГУ).

Обычно в дата-центрах применяют статические ИБП с двойным преобразованием, которые состоят из выпрямителя, аккумулятора и инвертора. Выпрямитель преобразовывает переменное напряжение из городской сети в постоянное, инвертор же делает обратное действие. На выходе получается чистый переменный ток без помех.

Кроме того, в ИБП есть аккумулятор, который позволяет проработать некоторое время при резком отключении электроэнергии и перейти на резервный источник питания. Если же основной луч электропитания пропадет, в течении нескольких секунд запускаются ДГУ, которые постоянно находятся в режиме горячего резерва. Пока дизельные генераторы запускаются, система работает на ИБП. Как только ДГУ выходит на рабочую мощность, происходит переключения питания ЦОД с ИБП на ДГУ.

Машинный зал

В крупных дата-центрах под оборудование могут отводить сотни и тысячи квадратных метров. Каждое устройство помещается в специальный шкаф — серверную стойку. Это простой металлический каркас, где размещаются серверы, системы хранения, маршрутизаторы и коммутаторы.

Такие шкафы чаще всего имеют ширину 19 дюймов. Высота измеряется в юнитах (U, 1U = 1,75 дюйма) и зависит от типа конструкции, но большинство стоек изготавливаются высотой 42U или 48U. Дополнительно внутри могут находиться блоки распределения питания с розетками, к которым подключается все остальные компоненты, и горизонтальные или вертикальные лотки для кабелей.

Сетевая архитектура дата-центра

3-stage Clos

Современные дата-центры строятся на основе частного случая сетей Клоза — 3-х уровневой топологии Spine-Leaf, которая состоит из двух типов коммутаторов: Spine и Leaf.

Spine-коммутаторы формируют транзитный слой. Их основная задача — максимально быстро передавать трафик между Leaf-коммутаторами. При этом Spine не подключают конечные устройства напрямую.

Leaf-коммутаторы, в свою очередь, являются точками подключения инфраструктуры дата-центра. Именно к ним подключаются серверы, системы хранения данных, маршрутизаторы, балансировщики нагрузки и другие устройства.

На скрине ниже еще изображены Edge-Leaf. Это те же Leaf-коммутаторы, но их задача — выход во внешнюю сеть.

Базовая топология Spine-Leaf
Базовая топология Spine-Leaf

Ключевая особенность такой архитектуры заключается в том, что каждый Leaf подключен ко всем Spine-коммутаторам, а каждый Spine — ко всем Leaf. Благодаря этому между любой парой устройств существует сразу несколько равноценных маршрутов передачи трафика, а количество доступных путей напрямую зависит от числа Spine-коммутаторов.

При обмене данными между устройствами, подключенными к разным Leaf, трафик проходит всегда одинаковое количество шагов: Leaf — Spine — Leaf. При этом часть трафика может оставаться внутри одного Leaf-коммутатора и не подниматься на уровень Spine. Например, если балансировщик нагрузки и frontend-сервер подключены к одному Leaf, обмен данными между ними будет происходить без задействования транзитного слоя.

ECMP

Стоит немного сказать про ECMP (Equal-Cost Multi-Path). Это устройство, которое распределяет трафик между разными Spine, что позволяет использовать все доступные каналы, а не держать часть соединений в резерве.

Балансировка выполняется с помощью хэша, который вычисляется на основе параметров: IP и порта отправителя и получателя, а также названия протокола — все вместе это называется 5-Tuple. Благодаря этому хэшу пакеты одного соединения всегда идут по одному и тому же маршруту.

ECMP также повышает отказоустойчивость сети. Если один из Spine-коммутаторов становится недоступен, трафик автоматически перераспределяется по оставшимся маршрутам.

5-stage Clos и Super-Spine

Мы рассмотрели 3-х уровневую архитектуру. Однако, когда одного уровня Spine не хватает для масштабирования, применяется 5-stage Clos-топология. Здесь добавляется дополнительный транзитный уровень, который называют Super-Spine или Spline Level 2.

Маршрут трафика выглядит так: Leaf — Spine — Super-Spine — Spine — Leaf. При этом вся сеть делится на POD’ы, которые состоят из Leaf и Spine первого уровня.

Spine в одном POD’е соединены со Spine’ами в другом POD’е через Super-Spine. Однако не все Spine первого уровня включены во все Super-Spine. Сеть дополнительно разделяют по плоскостям, так что по одному Spine из каждого POD’а выводится в отдельную плоскость, в которой есть свой отдельный Super-Spine.

Проще это понять по схеме (здесь Super-Spine назван Level 2 Spine):

5-stage Clos
5-stage Clos

5-ти уровневая структура сложнее в проектировании и эксплуатации, но дает значительно большее число подключаемых Leaf-коммутаторов.

Преимущества Spine-Leaf

Архитектура подходит современным ЦОДам, где значительная часть обмена данными происходит внутри инфраструктуры, а не только между пользователями и внешними сервисами.

Основные преимущества:

  • Горизонтальная масштабируемость. Новые Leaf можно добавлять пока не кончатся порты, а количество портов можно увеличить за счет новых Spine.
  • Отказоустойчивость. Если один Spine выйдет из строя — просядет пропускная способность, но лишь на 1/n, где n — число маршрутизаторов.
  • Эффективная работа с трафиком «восток-запад». Spine-Leaf архитектура дает широкий горизонтальный канал.
  • Предсказуемость маршрутов.

Охлаждение

Серверные стойки в ЦОДе размещают рядами. Фронтальные стороны обращены друг к другу и образуют холодный коридор, а тыльные — горячий. В холодный коридор подается охлажденный воздух температурой 22–24 °C. Далее происходит цикл:

  1. Серверные вентиляторы забирают его через переднюю панель.
  2. Воздух проходит через оборудование, нагревается до 35–45 °C и выбрасывается через заднюю стенку в горячий коридор. 
  3. Оттуда нагретый воздух забирают прецизионные кондиционеры (CRAC/CRAH), установленные по периметру зала или между рядами стоек.
  4. После охлаждения воздух снова подается в холодный коридор.

Для этого есть три основных способа подачи воздуха. Самый распространенный — через фальшпол. Его строят из перфорированной плитки, под которой находится свободное пространство, где нагнетается давление холодного воздуха. Так как давление под полом выше, чем над ним, воздух выходит через отверстия в холодный коридор.

Схема охлаждения
Схема охлаждения

Если фальшпола нет, используют потолочную подачу. Поток направляется сверху по воздуховодам и равномерно распределяется диффузорами в холодном коридоре.

Также применяют In-row охлаждение, особенно в дата-центрах, где стоят GPU-кластеры. Кондиционеры ставятся прямо внутри ряда, между двух стоек. Они забирают горячий воздух из соседнего горячего коридора, охлаждают и выдувают в холодный коридор.

In-row кондиционеры
In-row кондиционеры

Чтобы горячий и холодный воздух не смешивались между собой, коридоры дополнительно герметизируют. Самый бюджетный способ — повесить шторки на торцах. Однако есть более практичные подходы:

  • CAC (Cold Aisle Containment) — над холодным коридором делают крышку из поликарбоната, торцы закрывают дверьми, а внутри создается избыточное давление.
  • HAC (Hot Aisle Containment) — наоборот, герметизируют горячий коридор. Воздух из него засасывается вытяжным каналом.

Система жидкостного охлаждения

Современные высоконагруженные стойки с GPU часто переводят на жидкостное охлаждение, так как воздушная система не справляется с мощностью выше 30–50 кВт.

Внутри серверной стойки алюминиевые радиаторы заменяются медными пластинами, через которые проходит жидкость и забирает тепло. Далее вода попадает в теплообменник задней двери (Rear Door Heat Exchanger), который находится позади сервера. Здесь она охлаждается, лишнее тепло уходит в горячий коридор, а жидкость возвращается обратно в систему.

Однако такой способ охлаждает только самое горячее: CPU и GPU — для остального оборудования применяют воздух.

Куда уходит тепло из машинного зала

Тепло из горячего коридора, нужно куда-то рассеивать. Стандартный метод для этого — фреоновые системы (DX). Принцип работы простой:

  1. В машзале находится внутренний блок с теплообменником, в которые засасывают горячий воздух.
  2. Воздух отдает энергию фреону и охлаждается. Затем по воздуховоду он переносится под фальшпол, а оттуда — в холодный коридор.
  3. Фреон под воздействием теплого воздуха переходит в газообразное состояние. Далее по трубам газ попадает на внешний блок, расположенный на улице. Здесь теплоноситель охлаждается и в жидком виде попадает обратно в кондиционер.

Такая система отлично работают в небольших серверных, однако со временем ЦОД сталкивается с проблемами — не хватает места под кондиционеры и длины трассы.

Фреоновая система

Поэтому, крупные дата-центры чаще используют чиллеры с фанкойлами. Работает это следующим образом:

  1. Фанкойл — устройство с теплообменником и вентилятором — стоит в помещении. Внутри него находится теплообменник, по которому циркулирует чистая вода или водно-гликолевый раствор.
  2. Фанкойлы забирают горячий воздух из помещения, пропускают его через радиатор с охлажденным теплоносителем и подают обратно уже охлажденным. 
  3. Нагретая вода по трубам поступает на чиллер. Это холодильная машина для охлаждения жидкости, которую размещают на улице.

Еще один способ рассеять тепло — Free cooling (фрикулинг). Если дата-центр находится в холодном регионе, компрессоры в чиллере могут вообще не включаться, так как теплоноситель будет остывать только за счет низкой температуры на улице. Также, если у ЦОДа небольшая мощность, возможно организовать прямой фрикулинг, когда воздух из окружающей среды подается напрямую в машзал.

Правила эффективной работы

Независимо от того, какую систему вы собираетесь использовать нужно следовать основным правилам:

  • Использовать заглушки. Все пустые места в стойках должны закрываться заглушками, чтобы холодный воздух не уходил в обход серверов прямо в горячий коридор.
  • Соблюдать баланс воздуха. Количество подаваемого холодного воздуха должно быть чуть больше или равно количеству, засасываемому серверами.
  • Использовать датчики. Термодатчики устанавливаются у всасывающих отверстий серверов со стороны холодного коридора. С их помощью контролируют температуру всасываемого воздуха — она должна быть 18–27°C.

Программные решения (SDN) и инфраструктура управления (NOC)

Современные дата-центры используют SDN — программы для управления сетью. Они позволяют централизованно контролировать маршрутизацию, балансировку нагрузки и политику безопасности без необходимости ручной настройки каждого сетевого устройства. Также применяются приложения мониторинга и эксплуатации — Network Operations Center (NOC). Они обеспечивают круглосуточный контроль состояния всех систем дата-центра: от серверов и сетевого оборудования до инженерной инфраструктуры.

VMmanager
Пример работы в VMmanager

Схемы резервирования

Каждому дата-центру необходимо минимальное количество резервных источников питания, ИБП, систем охлаждения, кабелей питания, трубопроводов и прочего оборудования, чтобы нормально функционировать. Без этого необходимого минимума система не сможет работать, если один из компонентов выйдет из строя. 

Чтобы серверы могли обслуживать клиентов независимо от поломок в оборудовании, для каждого звена устанавливают запасной модуль. Обязательное количество принимают за N, а дополнительную технику пишут через плюс. Например, «+1» означает, что в дата-центре стоит по одному запасному кондиционеру, дизельному генератору, ИБП и т. д.

Есть несколько схем резервирования:

  • N+0 — резервные источники питания, кондиционеры или кабели не используются.
  • N+1 — на каждую систему в дата-центре устанавливают один запасной модуль. Например, стоит 3 ИБП: один запасной и два основных, включенных постоянно.
  • 2N — одна из самых надежных схем резервирования. Предполагает, что все компоненты ЦОДа продублированы. При этом основной и резервный модуль работают параллельно. Если же один из модулей сломается, второй возьмет всю нагрузку на себя.
  • 3/2N — на каждые два рабочих модуля (например, сервера) предусмотрено три источника. Например, три ИБП обеспечивают энергией две серверные стойки. При выходе одного из источников оставшиеся два продолжают покрывать потребности системы.

Также существуют другие схемы: 2(N+1), 2N+1, 6/5N.

Уровни надежности

Существует международная система классификации надежности дата-центров от организации Uptime Institute, на основе которой можно определить надежность ЦОДа. Чем выше уровень, тем лучше продумана защита от разных рисков: отключение электричества, выход из строя оборудования, пожар и т. д.

Tier I

Это самый простой уровень защищенности, который не предполагает резервирования. Такому дата-центру нужны: дизельный генератор, источник бесперебойного питания, охлаждение и IT-оборудование. При этом максимальное время простоя не должно превышать 28,8 часов в год.

Tier II

Для второго уровня уже применяется схема резервирования N+1. Такие дата-центры более надежны: при выходе из строя, например ИБП, сервер продолжит обслуживать клиентов. Недостаток такого ЦОДа — один энерговвод, от которого запитывается все оборудование. Если он повредится, сервер остановится. Максимально допустимое время простоя — 22 часа в год.

Tier III

От предыдущих уровней эти дата-центры отличаются тем, что позволяют проводить профилактические работы без отключения всей системы. Клиенты такого ЦОДа даже не узнают, что на объекте что-то ремонтировалось или менялось.

Tier III требует двух независимых энерговводов и резервирования по схеме 2N. При этом IT-оборудование может дублироваться по более дешевой модели N+1. Максимальное время простоя не превышает 1,6 часа в год.

Tier IV

Последний уровень используется редко из-за высокой стоимости, однако обеспечивает наибольшую отказоустойчивость. Такой дата-центр простаивает не более 26 минут в год.

Инженерные системы резервируются по схеме 2(N+1) при этом все компоненты разнесены по разным помещениям. Кроме того, на всем пути трубопроводы, трассы, кабели питания и прочие коммуникации должны идти разными путями. Так пути ввода будут изолированы при серьёзной аварии — например, пожаре.

Виды дата-центров

Дата-центры различаются по модели владения и эксплуатации инфраструктуры. Выбор подходящего варианта зависит от требований к контролю, масштабируемости и бюджета компании.

Корпоративный

Корпоративный дата-центр строится и обслуживается самой компанией. Бизнесу необходимо построить или арендовать здание, организовать систему электропитания, охлаждения и безопасности, а также закупить IT-оборудование.

Плюсы:

  • Полный контроль над инфраструктурой — компания самостоятельно управляет оборудованием, данными и политиками безопасности.
  • Совместимость с любыми системами — можно использовать устаревшее или специфическое ПО без ограничений со стороны провайдера.
  • Быстрый доступ к ресурсам — минимальные задержки при работе с локальными сервисами и данными.

Минусы:

  • Сложная реализация — требуются значительные инвестиции и экспертиза для строительства своего ЦОДа.
  • Ограниченная гибкость — масштабирование требует времени и дополнительных затрат на оборудование и инфраструктуру.
  • Кадровые сложности — опытных специалистов по эксплуатации дата-центров мало, а наём таких сотрудников стоит довольно дорого.

Colocation

Модель colocation предполагает аренду инфраструктуры у оператора дата-центра. Компания размещает собственное оборудование в арендованных стойках или залах, используя готовые инженерные системы.

Плюсы:

  • Простое масштабирование — увеличение мощностей достигается за счет аренды дополнительных стоек или площадей.
  • Снижение требований к персоналу — часть задач по обслуживанию инфраструктуры берет на себя оператор ЦОДа.
  • Готовая инфраструктура — электропитание, охлаждение, безопасность и резервирование уже реализованы.

Минус — ограниченный доступ. Чтобы что-то изменить или устранить критическую ошибку, сотрудникам придется тратить время на дорогу.

Облачный

Облачный дата-центр отличается от colocation тем, что клиент не размещает собственное оборудование, а арендует ресурсы, полностью управляемые провайдером.

Плюсы:

  • Отсутствие капитальных затрат — не требуется закупка и размещение оборудования, оплата идет только за используемые ресурсы.
  • Гибкое масштабирование — увеличение мощностей выполняется через панель управления прямо в браузере. Физически взаимодействовать с оборудованием не нужно.
  • Минимальные требования к персоналу — обслуживание, обновления и устранение сбоев выполняет провайдер.

Минусы:

  • Ограниченный контроль — данные и инфраструктура находятся на стороне провайдера.
  • Зависимость от поставщика — облачный провайдер в любой момент может прекратить оказание услуги.

Какие услуги предлагает ЦОД

Часто компании обращаются за арендой физических серверов, на которых разворачивают собственную инфраструктуру, а также за облачными ресурсами. Также ЦОДами пользуется большинство хостинг-сервисов, которые арендуют сразу несколько физических стоек в разных городах для большей отказоустойчивости.

Отдельное направление — мощности для задач искусственного интеллекта. Дата-центры предлагают физические и виртуальные серверы с GPU, на которых уже установлены нужные модели.

Кроме того, дата-центры предлагают и другие услуги:

  • Облачные базы данных. Провайдер берет на себя администрирование, резервное копирование, обновления и обеспечение отказоустойчивости.
  • Услуги хранения данных. Компании нужно где-то хранить архивные данные, а устанавливать ленточные накопители в офисе — слишком дорого и неудобно.
  • Инфраструктура для CI/CD. ЦОДы предоставляют готовые среды для разработки и развертывания приложений. Они уже включают настроенные инструменты автоматизации сборки, тестирования и доставки кода.
  • Готовые серверы для 1С. Если у компании несколько офисов или часть сотрудников работает удаленно, приходится арендовать мощности под сервер 1С.

Как выбрать ЦОД

Данные о компании

При выборе любого контрагента в первую очередь следует проверить базовую юридическую информацию:

  • возраст компании;
  • соответствие юридического и фактического адреса;
  • среднесписочная численность сотрудников;
  • финансовые показатели — оборот за год и объем уплаченных налогов;
  • судебная история и исполнительные производства.

Кроме того, провайдер должен предоставлять не только контакты службы поддержки, но и данные руководства, чтобы у клиента всегда была возможность обратиться напрямую к руководителю для решения сложных вопросов.

Критерии выбора

При выборе дата-центра важно учитывать несколько ключевых факторов:

  1. Физическое местонахождение дата-центра. Оптимально размещать инфраструктуру в том же регионе, где находится ваша компания или основная аудитория пользователей. Это снижает задержки при передаче данных и упрощает доступ к оборудованию. Кроме того, если речь идет о хранении персональных данных, важно учитывать требования законодательства: серверы должны располагаться на территории РФ.
  2. Надежность и сертификация. Уровень отказоустойчивости подтверждается Tier. Четвертый уровень стоит достаточно дорого и подходит только финансовым или государственным учреждениям. Первый и второй не обеспечивают достаточную защиту, поэтому самый логичный вариант Tier III.
  3. Стоимость. Цена в большинстве случаев — не главный фактор: разница между провайдерами одного класса невелика. Гораздо важнее уровень надежности и качество поддержки.

Выводы

Из этой статьи вы узнали, что такое дата-центр и как он устроен. Собственный ЦОД стоит создавать, если вы:

  • хотите полный контроль над инфраструктурой и данными;
  • готовы к крупным инвестициям;
  • у вас есть ресурсы для найма и содержания ИТ-команды.

Colocation-варианты подойдут для тех, кто:

  • также хочет иметь контроль над своим оборудованием;
  • уже приобрел серверное оборудование;
  • не готов инвестировать в собственный проект и содержать команду.

Облачный вариант стоит рассмотреть, если:

  • нужен быстрый запуск без капитальных затрат;
  • непредсказуемая нагрузка на оборудование;
  • нет своей команды специалистов.

Возможно, вам будет интересно

Было интересно?

Назад к списку
Скидка новым клиентам
Закажите сервер сегодня и получите скидку на первый месяц аренды!
Наш сайт использует cookies Вы можете отключить их в настройках браузера, но это может ограничить функционал. Оставаясь на сайте, вы соглашаетесь с использованием cookies.