Мы восстановили архитектуру проекта, сопоставили состояние Kubernetes, логи приложений, графики потребления ресурсов и сценарии запуска контейнеров.
Вместо предположения о том, что приложению просто не хватает вычислительных ресурсов, были выделены несколько связанных причин: отсутствие requests и limits, рост потребления памяти, небезопасная логика миграций и недостатки конфигурации кластера.
Одновременно был проведен аудит безопасности, доступов, хранилищ, CI/CD и вспомогательных виртуальных машин. Это позволило сформировать план не только устранения текущих падений, но и приема проекта на поддержку.