OpenPing Technology
Подразделения
Шесть бизнес-подразделений — сеть, связь, ЦОД, хостинг, платформа, системы — работают по единым правилам и приёмке, каждое отвечает за свою область целиком.
Деление проведено не по технологическому стеку
А по тому, кто отвечает при сбое и с какого уровня начинать разбор.
Сеть недоступна, звонки не проходят, в ЦОД пропало питание, размещённый сервер встал, кластер контейнеров ведёт себя странно, системная служба прервана — для клиента всё это просто «сломалось», но пути диагностики совершенно разные. Подразделения существуют для того, чтобы у каждого вида сбоя были ясная первая ответственность и ясный документ действий, а не чтобы клиент угадывал, кому звонить.
При этом шесть подразделений не работают порознь. Межобластные сбои — самый затратный по времени вид: сеть выглядит исправной, узел выглядит исправным, а служба не соединяется, и проблема часто находится ровно на стыке двух областей. Общие архитектурные документы, реестры оборудования и журналы изменений позволяют вести межобластной разбор на едином наборе фактов.
Сетевое подразделение
Отвечает за три системы — магистральную, региональную и управляющую сеть, — включая подключение внешних линий, маршрутизацию BGP, межзонное соединение, планирование VLAN, политики межсетевых экранов, VPN, управление сегментами и адресами, домены и DNS, а также выпуск и ротацию сертификатов. Оборудование включает маршрутизаторы MikroTik, коммутаторы Dell EMC и D-Link, коммутаторы Extreme и межсетевые экраны OPNsense.
Самое трудное в эксплуатации сети — не ввести конфигурацию, а знать, какова она сейчас и почему её задали именно так. Сегменты, VLAN, маршруты и списки доступа ведутся из единого источника, а конфигурация оборудования порождается из него средствами автоматизации, а не набирается вручную на каждом устройстве.
Управляющая сеть полностью изолирована от магистральной и региональных: даже при атаке на магистраль с затронутым оборудованием можно работать через управляющую сеть.
Телекоммуникационное подразделение
Отвечает за подключение внешних линий, выделенные каналы, соединение площадок и корпоративные коммуникации, включая доступ в интернет, корпоративные выделенные линии, соединения между площадками, облачную АТС, голосовую и видеосвязь, а также измерение и обеспечение качества связи.
Ценность услуг связи в обычное время почти незаметна и обнаруживается лишь в те несколько минут, когда связь пропала. Поэтому эксплуатация сосредоточена на двух вещах: на резервировании, где у линии, маршрута и оборудования есть явно определённый путь переключения, и на измерении — постоянном контроле задержки, потерь и доступности, чтобы устранять проблемы прежде, чем их заметит клиент.
Подразделение ЦОД
Отвечает за стойки, электропитание, охлаждение, физическое оборудование, платформы виртуализации и системы хранения. Виртуализация использует VMware vSphere и Proxmox VE с разделением по характеру нагрузки; хранилища распределены по назначению между Ceph, TrueNAS, QNAP и Synology, а сеть хранения сегментирована по типу оборудования и потребляющей платформе.
Больше всего в эксплуатации ЦОД недооценивают простой вопрос: какое оборудование вообще имеется. Действующий реестр ведётся по кодам физических устройств и сопоставлен один к одному с именами узлов на платформе виртуализации, так что стойка, площадка и роль выводятся из одного кода.
Подразделение хостинга
Отвечает за размещение серверов клиентов, облачные серверы, хостинг баз данных, приложений и хранилищ. Клиенты размещаются по зонам в зависимости от масштаба и требований; клиентские базы данных и хранилища сосредоточены в зоне хостинга, а не разворачиваются в каждой среде отдельно.
Главное обещание хостинга — изоляция. Всё, о чём заявлено как «клиенты не видят друг друга», должно быть действительно проверено, прежде чем попасть в договор: проверяется, может ли ограниченное учётное данное перечислить чужие ресурсы и прочитать чужие данные. Если проверка не пройдена, гранулярность изоляции делается более грубой, а не выдаётся проектное ожидание за факт.
Подразделение платформы
Отвечает за кластеры контейнеров, реестры образов, конвейеры непрерывной интеграции и развёртывания, средства наблюдаемости и очереди сообщений. Оркестрация контейнеров — Kubernetes; образы помечаются идентификатором версии и закрепляются по дайджесту, а сторонние официальные образы всегда закрепляются по версии и дайджесту, а не по подвижному тегу.
Ещё одна задача — различать «служба работает» и «службой действительно пользуются». У кэша, очередей и мониторинга есть общая черта: при отказе они не останавливают службу, а лишь тихо деградируют. Поэтому критерий приёмки — не «приложение ещё живо», а число соединений и трафик на той стороне: отсутствие выработки и есть отказ, даже без сообщения об ошибке.
Системное подразделение
Отвечает за базовые конфигурации ОС, начальную настройку узлов, резервное копирование и восстановление, базовые настройки безопасности и регулярные проверки. Стандартная ОС — Debian; категории исключений перечислены в документации поимённо с обоснованием.
Список исключений сам по себе является средством управления. Правило таково: у исключения должны быть указаны причина и область, и область формулируется узко. Как только причиной исключения становится «так удобнее», список начинает расти без конца, а длинный список лишает смысла сам стандарт.