Перейти к содержимому
WebConto
Разделы
← Все продукты
Система платформы

Мониторинг прод-систем

Отдельная система наблюдения за прод-сервисами платформы. Коллектор опрашивает все цели раз в минуту, движок правил поднимает инцидент по порогу, дежурный получает сообщение в Telegram раньше, чем о сбое напишет пользователь.

В работеДежурный и Ops
Фоновых проб здоровья
8
Опрос целей
60сек
Разделов Ops
10
Уровня порогов
3
Обзор целей мониторинга
Цели мониторинга

Цели под наблюдением

consultant-apiok

Healthz раз в минуту плюс синтетический запрос к модели каждые 10 минут. Ловит случай «UI работает, модель мертва», который обычный healthz пропускает.

Путь инцидента

01ОпросКоллектор опрашивает каждую цель раз в минуту и пишет результат в SQLite.
02ПравилаПороги warning / critical / predictive сравниваются с историей — не только с последним значением.
03ИнцидентОткрывается в UI, попадает в журнал событий; подтверждение дежурного снимает его с обзора.
04ОповещениеСообщение дежурному в Telegram с кулдауном на правило — сбой не заваливает чат повторами.
Инциденты
Инциденты
Ресурсы
Ресурсы

Как устроено наблюдение

Пороги, журнал и граница с вотчдогом.

Общие правила: безопасность и развёртывание →
УзелКак устроено
Только наблюдениеМониторинг не перезапускает сервисы — это задача вотчдога. Здесь только фиксация и оповещение.
Журнал событийКаждое открытие инцидента, подтверждение и административное действие пишется в общий аудит.
Метрики PrometheusДоступность целей, диск и память отдаются наружу для общего дашборда Grafana.
Пороги настраиваютсяРеестр целей и порогов — обычный файл конфигурации, изменения проходят через git.
IdP-админка на местеПользователи, группы, инвайты клиентов и SSO 1С управляются прямо здесь, без отдельного консоли.
Показать инструмент вживуюПокажем цели, пороги и как дежурный получает оповещение.
Другие продукты