Опишите процесс работы над инцидентом

Например, инженер замечает рост 5xx, определяет, какие сервисы и пользователи затронуты, ищет причину по логам и метрикам. Если есть временное решение — применяет его, чтобы быстрее восстановить работу, но для истории всё равно эскалирует проблему в соответствующую команду. После восстановления проверяет, что сервис действительно работает, а затем команда проводит постмортем, находит первопричину и определяет, как предотвратить повторение инцидента.
Обычно работа над инцидентом состоит из нескольких этапов: обнаружение → первичная диагностика → оценка влияния → локализация → восстановление → проверка → разбор причин и профилактика. На каждом этапе важно фиксировать информацию и своевременно сообщать заинтересованным командам и пользователям о статусе.
Инженер получает информацию о проблеме, передаёт её разработчикам и ждёт, пока они её исправят.