Research Insights Made Simple 25: Моделируем надёжность по графу зависимостей (Рубрика SRE)
Можно ли понять, где распределённая система сломается, ещё до дорогого эксперимента со сбоями? В этом выпуске сегодня в 17:00 мы вместе с Анатолием Красновским разберём его работу "Model Discovery and Graph Simulation: A Lightweight Gateway to Chaos Engineering", отмеченную Distinguished Paper Award на ICSE-NIER 2026 (кстати, я разбирал ее раньше).
Анатолий - инженер, который пошёл в науку, чтобы спасти IT от шаманства. За 10+ лет в разработке он устал от того, что сложные системы строятся на интуиции и слепом копировании «лучших практик». Сейчас он пишет кандидатскую по матмоделированию в Иннополисе, чтобы научиться доказывать их устойчивость математически, а не надеяться на эмпирический авось, а также ведет свой канал о том, как на самом деле работают сложные системы: @mb3rlab
Идея подхода Анатолия из этой статьи проста: автоматически извлечь из распределённых трасс граф обязательных вызовов, добавить число реплик и с помощью Monte Carlo оценить доступность системы при отказах. Получается не замена chaos engineering, а дешёвый фильтр перед ним: модель помогает найти подозрительные цепочки, единичные точки отказа и сценарии, которые стоит проверить на живой системе в первую очередь.
С автором обсудим:
- Почему для первого приближения может хватить топологии и числа реплик;
- Как автоматически обнаруживать модель из Jaeger и поддерживать её актуальной вместе с системой;
- Что означает высокая корреляция с живым fault injection и почему один benchmark ещё не доказывает универсальность метода;
- Где заканчиваются возможности модели: gray failures, коррелированные сбои, очереди, retries и асинхронные потоки;
- Как встроить такой анализ в CI/CD, связать его с SLO и превратить в приоритизацию chaos-экспериментов;
- Где проходит граница между полезным упрощением и опасной ложной уверенностью.
Для меня главный вопрос выпуска практический: можем ли мы превратить наблюдаемость из способа расследовать уже случившийся инцидент в исполняемую модель надёжности - и использовать её, чтобы ломать систему реже, но точнее?
#Software #Engineering #Architecture #DevOps #Reliability #Research