[2/2] A Field Guide to Reliability Engineering at Zalando • Heinrich Hartmann • GOTO 2024 (Рубрика Management)
Продолжая рассказ про выступление Heinrich Hartmann, Head of Reliability Engineering at Zalando SE, хотелось бы рассказать про остальные подходы и принципы, что практикуют ребята
- Многие отчеты по инфре вшиты в платформу и командам не требуется их собирать руками. K8s, redis, jvm и другие дашборды существуют из коробки, также есть гайдлайны для создания хороших отчетов. Автор рассказывает про RED, 4 Golden Signals, которые они отслеживают
- Дальше автор рассказыват про observability, которая позволяет отвечать на сложные вопросы относительно вашей системы. Ребята используют OpenTelemetry для стандартизации сигналов приложений, а также у них есть distributing tracing. Подробнее про observability рекомендую глянуть 2 выступления, про которые я раньше рассказывал:
- What Is This OpenTelemetry Thing? • Martin Thwaites • GOTO 2024
- Observability in an Asynchronous World • James Eastham • GOTO 2024
- В Zalando ребята используют SLO (service level objectives) для работы с reliability и это позволяет
- Понять какую надежность получают пользователи
- Управлять инженерными инвестициями в надежность
- Оценивать влияяние инцидентов
- Тюнить правила алертинга в сторону повышения их качества У ребят есть отчеты, которые ревьювяться менеджментом относительно соблюдения SLO разными бизнес-операциями. В общем, это выливается в очередное правило: Rule of operations #4: SLIs quantify the reliabilty of a user experience
- У ребят выстроен процесс работы с инцидентами и даже есть пятое правило: Rule of operations #5: Past failures lead the way towards future reliability. По-факту, ребята пишут и ревьювят постмортемы, докапываются до root causes, а также ставят и главное выполяют задаки для того, чтобы эти проблемы не повторялись.
- Напоследок автор оставляет рассказ о том, а как выглядит управление всем этим хозяйством и фоормулирует правило Rule of operations #6: You get what you inspect. По-факту, он рассказывает про еженедельные встречи с директорами и ревью отчетов о надежности
Финализирует автор тем, что приводит все принципы в одном списке (под каждым пунктом которого я тоже готов подписаться) 1. Obsess about user experience 2. Engineering for reliability involves people as much as involves technology 3. Alert on user experience ("symptoms") not on server experience 4. SLIs quantify the reliabilty of a user experience 5. Past failures lead the way towards future reliability 6. Past failures lead the way towards future reliability
В общем, это очень хороший доклад про подход к надежности в технологической компании Zalando.
P.S. У автора доклада есть отличный личный блог, где есть еще куча интересного материала.
#SRE #Architecture #DistributedSystems #Software #Observability