Направление работ
Мониторинг и сопровождение
Наблюдение за инфраструктурой, настроенное так, чтобы об отказе узнавали вы, а не ваши клиенты. Метрики, пороги, оповещения, централизованный сбор логов. Ставим и тем, у кого есть своя ИТ-служба: наблюдение нужно ей самой.
Когда обращаются
-
О сбое сообщают клиенты
Сервис лежал сорок минут, и первым это заметил покупатель. Мониторинга нет, и время реакции считается от звонка, а не от отказа.
-
Оповещения перестали читать
Система стоит, но шлёт письма постоянно, в том числе о том, что чинить не нужно. Их отключили, и теперь не видно настоящих. Шум опаснее тишины: он создаёт видимость.
-
Место кончилось внезапно
Диск заполнился, база встала. Заполнялся он месяцами, и предупредить об этом было можно за недели.
-
Логи разбросаны по машинам
Чтобы понять причину сбоя, надо зайти на пять серверов и сопоставить время вручную. К моменту, когда картина сложилась, инцидент уже забыт.
-
Никто не знает, что считать нормой
Нагрузка выросла, но выросла ли она опасно — сказать не по чему: истории нет, сравнивать не с чем.
Что входит в работы
-
Наблюдение
- Развёртывание системы мониторинга
- Метрики серверов, сервисов, каналов и оборудования
- Проверки со стороны пользователя, а не только изнутри
- История, по которой видно рост нагрузки заранее
-
Оповещения
- Пороги, настроенные под вашу нагрузку, а не по умолчанию
- Каналы оповещения: почта, мессенджер, звонок
- Разделение по важности: что будит ночью, а что ждёт утра
- Борьба с шумом — чтобы оповещения продолжали читать
-
Логи
- Централизованный сбор логов с серверов и сервисов
- Поиск по всем источникам сразу
- Хранение с понятным сроком и объёмом
-
Регламентное обслуживание
- Проверка резервных копий и обновлений
- Разбор накопившихся предупреждений
- Отчёт о состоянии инфраструктуры
- Аварийные работы круглосуточно — по договорам сопровождения
Как идёт работа
01
Что наблюдаем
Определяем, отказ чего именно останавливает работу компании. Наблюдать всё подряд бессмысленно: такой мониторинг превращается в шум и его перестают читать.
02
Развёртывание
Ставим систему, подключаем серверы, сервисы и оборудование, настраиваем сбор логов.
03
Настройка порогов
Пороги подбираются по вашей реальной нагрузке за первые недели наблюдения. Значения по умолчанию дают либо ложные тревоги, либо молчание в нужный момент.
04
Передача
Показываем, как читать панели и что делать по каждому оповещению. Дальше вы можете вести это сами или передать сопровождение нам.
Что остаётся у вас
- Работающая система мониторинга на вашей стороне
- История метрик, по которой видно рост нагрузки
- Описание оповещений: что означает каждое и что по нему делать
- Собранные в одном месте логи вместо разбросанных по серверам
Вопросы
Чем это отличается от ИТ-аутсорсинга?
Здесь мы ставим наблюдение, и дальше им может пользоваться ваша собственная ИТ-служба. Постоянное сопровождение всей инфраструктуры — отдельный формат, про него написано на странице ИТ-аутсорсинга.
У нас есть системный администратор. Мониторинг всё равно нужен?
Тем более нужен. Администратор не может смотреть на серверы круглосуточно, а система может. Мониторинг не заменяет человека, а сообщает ему вовремя.
Почему нельзя просто включить готовые пороги?
Потому что «нормально» у каждого своё. Загрузка, которая у одних означает аварию, у других обычный вечер. Пороги по умолчанию дают либо поток ложных тревог, либо тишину там, где надо кричать.
Что делать, чтобы оповещения не перестали читать?
Сокращать. Каждое оповещение должно означать действие; то, по чему делать нечего, — не оповещение, а запись в истории. Разбор накопившегося шума входит в работы.
Круглосуточные аварийные работы доступны всем?
Круглосуточное реагирование работает по договорам сопровождения. Разовое внедрение мониторинга само по себе дежурства не включает — скажем об этом сразу, а не после.
Мониторинг останется у нас или будет у вас?
Разворачиваем на вашей стороне. Данные о вашей инфраструктуре должны оставаться у вас и после окончания работ.
Заявка
Обсудить мониторинг
Расскажите, за чем нужно наблюдать: сколько серверов и сервисов, что уже стоит, были ли сбои, о которых узнали поздно. Ответим в рабочее время.
Смотрите также
-
ИТ-аутсорсинг
и абонентское обслуживание
Открыть -
СКС и ВОЛС
проектирование и монтаж
Открыть -
Wi-Fi для склада
и производства
Открыть -
Серверы и базы данных
настройка, миграция, ускорение
Открыть -
Администрирование
Linux и DevOps
Открыть -
Сети и защита
периметра
Открыть -
Разработка
программного обеспечения
Открыть -
Сайты
и веб-сервисы
Открыть -
Аудит и проектирование
инфраструктуры
Открыть -
Все направления
Все 9 направлений на главной странице.
На главную