На момент обращения портал регулярно становился недоступен ночью. Утром его работа восстанавливалась без явного вмешательства, поэтому сбои сначала выглядели как отдельная проблема приложения.
Проверка показала, что падения совпадали с запуском резервного копирования. Скрипт создавал локальные архивы базы данных и файлов, после чего передавал их во внешнее хранилище. Во время этой операции заканчивалось свободное место в корневом разделе. После автоматического удаления старых копий место освобождалось, и портал снова начинал работать.
Простого расширения раздела сделать было нельзя: дисковое пространство уже было полностью распределено, а существующая схема хранения не позволяла безопасно изменить конфигурацию. Одновременно быстро росла база данных, увеличивались резервные копии, а нагрузка на MySQL периодически достигала предельных значений.
Инфраструктуру можно было временно наблюдать, но надежно поддерживать ее без пересборки было сложно. Не было уверенности в том, как сервер настраивался раньше, какие изменения вносили предыдущие подрядчики и можно ли воспроизвести его состояние после серьезного сбоя.