
Проектируем надежные системы — стоит ли игра свеч
Риски, SLO, мониторинг и паттерны отказоустойчивости

Риски, SLO, мониторинг и паттерны отказоустойчивости
Риски, SLO, мониторинг и паттерны отказоустойчивости
От риска к отказоустойчивости
Почему надежность забывают
Как выбрать риск: SLI/SLO/SLA
Мониторинг: Golden Signals, RED, USE
Архитектура: domains, DR, resilience
Проблема
Незаметна в норме, дорога при сбое
Invisibility — видны сбои, не стабильность
Assessment — нет формулы «достаточно»
Evolution — вчерашнее ломается завтра
Баланс: надежность vs сбой
SLI · SLO · SLA
Критичность задаёт SLO
Business Critical — простой = прямые потери
Line of Business — есть workaround
Best Effort — допустима деградация
Типу соответствует SLO и бюджет
Метрика/цель/контракт
SLI — latency p99, errors, availability
SLO — внутренняя цель надежности
SLA — внешний контракт и последствия
Error Budget — лимит риска релизов
Golden Signals · RED · USE
Минимальный набор метрик SRE
Latency — время ответа
Traffic — объём нагрузки
Errors — явные и неявные сбои
Saturation — загрузка ресурсов
Сервисы и ресурсы требуют разных линз
RED — rate, errors, duration
USE — utilization, saturation, errors
RED показывает пользовательский опыт
USE показывает состояние ресурсов
Domains · Data · DR
Разделяйте сбои и обновления
Fault Domain — общий отказ
Update Domain — общий rollout
Пересечение = максимальный риск
Blast radius — зона поражения
Данные: не потерять и согласовать
Durability — репликация, бэкапы, WAL
Consistency — strong vs eventual
CAP: partition заставляет выбирать
Практика: AP + idempotency
Планирование disaster recovery
RPO — допустимая потеря данных
RTO — целевое время восстановления
Нули требуют sync + active-active
Ниже цели — выше стоимость
Паттерны
Базовая защита от сбоев зависимостей
Retry — backoff + jitter
Circuit Breaker — остановка каскада
Bulkhead — изоляция пулов
Timeout + Резервный сценарий — деградация
Отказоустойчивость через модель деплоя
Active-Passive — горячий резерв
Active-Active — оба ДЦ активны
N+1 — один запасной узел
Выбор = RPO/RTO и бюджет
Ключевые выводы из доклада
Risk first: тип + SLO
Monitoring: поток и blast radius
Patterns: retry, breaker, bulkhead
Окупается, когда сбой дороже
SRE, SLO, observability, resilience
Google SRE Book: sre.google/books/
Release It! — Michael Nygard
AWS Reliability Pillar
USE / RED / Golden Signals
polomodov.tech
Все слайды и ссылки — в Telegram-канале
Александр Поломодов, Технический директор и Fellow, Т-Технологии
@ai4sdlc