На первом этапе подключили системный и прикладной мониторинг. Начали собирать историю загрузки процессора, памяти, дисков и отдельных процессов, анализировать длительность запросов и состояние приложения.
В дальнейшем мониторинг охватил серверы, сайты, MySQL, Redis, Elasticsearch, резервные копии, Kubernetes-компоненты, deployments, CronJob и доступность отдельных сервисов. Для контейнерных компонентов добавлялись метрики Prometheus, а для централизованного анализа событий использовалось хранилище логов.
Это позволило перейти от реакции на сообщения пользователей к обнаружению отклонений по техническим признакам.