Направление работ

Мониторинг и сопровождение

Наблюдение за инфраструктурой, настроенное так, чтобы об отказе узнавали вы, а не ваши клиенты. Метрики, пороги, оповещения, централизованный сбор логов. Ставим и тем, у кого есть своя ИТ-служба: наблюдение нужно ей самой.

Когда обращаются

  • О сбое сообщают клиенты

    Сервис лежал сорок минут, и первым это заметил покупатель. Мониторинга нет, и время реакции считается от звонка, а не от отказа.

  • Оповещения перестали читать

    Система стоит, но шлёт письма постоянно, в том числе о том, что чинить не нужно. Их отключили, и теперь не видно настоящих. Шум опаснее тишины: он создаёт видимость.

  • Место кончилось внезапно

    Диск заполнился, база встала. Заполнялся он месяцами, и предупредить об этом было можно за недели.

  • Логи разбросаны по машинам

    Чтобы понять причину сбоя, надо зайти на пять серверов и сопоставить время вручную. К моменту, когда картина сложилась, инцидент уже забыт.

  • Никто не знает, что считать нормой

    Нагрузка выросла, но выросла ли она опасно — сказать не по чему: истории нет, сравнивать не с чем.

Что входит в работы

  • Наблюдение

    • Развёртывание системы мониторинга
    • Метрики серверов, сервисов, каналов и оборудования
    • Проверки со стороны пользователя, а не только изнутри
    • История, по которой видно рост нагрузки заранее
  • Оповещения

    • Пороги, настроенные под вашу нагрузку, а не по умолчанию
    • Каналы оповещения: почта, мессенджер, звонок
    • Разделение по важности: что будит ночью, а что ждёт утра
    • Борьба с шумом — чтобы оповещения продолжали читать
  • Логи

    • Централизованный сбор логов с серверов и сервисов
    • Поиск по всем источникам сразу
    • Хранение с понятным сроком и объёмом
  • Регламентное обслуживание

    • Проверка резервных копий и обновлений
    • Разбор накопившихся предупреждений
    • Отчёт о состоянии инфраструктуры
    • Аварийные работы круглосуточно — по договорам сопровождения

Как идёт работа

01

Что наблюдаем

Определяем, отказ чего именно останавливает работу компании. Наблюдать всё подряд бессмысленно: такой мониторинг превращается в шум и его перестают читать.

02

Развёртывание

Ставим систему, подключаем серверы, сервисы и оборудование, настраиваем сбор логов.

03

Настройка порогов

Пороги подбираются по вашей реальной нагрузке за первые недели наблюдения. Значения по умолчанию дают либо ложные тревоги, либо молчание в нужный момент.

04

Передача

Показываем, как читать панели и что делать по каждому оповещению. Дальше вы можете вести это сами или передать сопровождение нам.

Что остаётся у вас

  • Работающая система мониторинга на вашей стороне
  • История метрик, по которой видно рост нагрузки
  • Описание оповещений: что означает каждое и что по нему делать
  • Собранные в одном месте логи вместо разбросанных по серверам

Вопросы

Чем это отличается от ИТ-аутсорсинга?

Здесь мы ставим наблюдение, и дальше им может пользоваться ваша собственная ИТ-служба. Постоянное сопровождение всей инфраструктуры — отдельный формат, про него написано на странице ИТ-аутсорсинга.

У нас есть системный администратор. Мониторинг всё равно нужен?

Тем более нужен. Администратор не может смотреть на серверы круглосуточно, а система может. Мониторинг не заменяет человека, а сообщает ему вовремя.

Почему нельзя просто включить готовые пороги?

Потому что «нормально» у каждого своё. Загрузка, которая у одних означает аварию, у других обычный вечер. Пороги по умолчанию дают либо поток ложных тревог, либо тишину там, где надо кричать.

Что делать, чтобы оповещения не перестали читать?

Сокращать. Каждое оповещение должно означать действие; то, по чему делать нечего, — не оповещение, а запись в истории. Разбор накопившегося шума входит в работы.

Круглосуточные аварийные работы доступны всем?

Круглосуточное реагирование работает по договорам сопровождения. Разовое внедрение мониторинга само по себе дежурства не включает — скажем об этом сразу, а не после.

Мониторинг останется у нас или будет у вас?

Разворачиваем на вашей стороне. Данные о вашей инфраструктуре должны оставаться у вас и после окончания работ.

Заявка

Обсудить мониторинг

Расскажите, за чем нужно наблюдать: сколько серверов и сервисов, что уже стоит, были ли сбои, о которых узнали поздно. Ответим в рабочее время.

Почта public@3212.ru

Город Москва

Часы работы 08:00–20:00 МСК, аварийные работы — круглосуточно

Смотрите также