Полный текст
Как добавить системности в мониторинг продакшна: параметры и тулинг для инцидент-менеджментаНа проде что‑то сломалось — такова суровая реальность, случается с лучшими из нас, увы. Что часто происходит в подобных случаях: ловим алерты, бежим смотреть графики и логи, вызваниваем из отпуска разработчика, который занимался этой функциональностью, выкатываем фикс, проводим пост‑мортем. Это реакция на уровне здравого смысла, классика.Но когда речь заходит о недозаработанных из‑за инцидента деньгах, расстроенных пользователях, любое улучшение, даже небольшое, может принести ощутимый результат.Поговорим о том, как подойти к вопросу мониторинга методологически — задействовать инструментарий инцидент‑менеджмента. Обсудим, как оценивать критичность сервисов и какие системы могут быть полезны для отслеживания проблем.