С какими дашбордами приходилось работать?

Хороший инженер поддержки смотрит на систему с разных уровней. Например, рост ошибок на сервисе можно сопоставить с нагрузкой на сервер, а затем проверить, привёл ли этот технический сбой к падению количества успешных заказов. Так можно пройти путь от «что сломалось?» → «где сломалось?» → «кого это затронуло?».
Инфраструктурные (железные): CPU, RAM, загрузка диска, свободное место, сетевой трафик, нагрузка на серверы. Помогают понять, не упирается ли система в ресурсы. Дашборды микросервисов: количество запросов, RPS, latency, процент ошибок, HTTP-коды (4xx/5xx), доступность сервиса, количество активных инстансов, состояние очередей. По ним можно понять, какой именно сервис начал работать неправильно. Дашборды ошибок: количество и типы ошибок, динамика 5xx, частота конкретных исключений, ошибки по эндпоинтам или сервисам. Полезны для поиска момента начала проблемы и оценки её масштаба. Бизнес-дашборды: количество заказов, регистраций, платежей, конверсии, отмены, успешные/неуспешные операции и другие бизнес-метрики. Они позволяют понять, как техническая проблема влияет непосредственно на пользователей и бизнес.
Дашборды нужны только для мониторинга CPU, памяти и других характеристик сервера.