Надёжность и безопасность: фундамент или опция?
Как строить системы, где reliability и security — не afterthought
Как строить системы, где reliability и security — не afterthought
Как строить системы, где reliability и security — не afterthought
Что на кону: простой, утечки, доверие
Эмерджентные свойства систем и процессов
ATAM, риски и угрозы как architecture process
Кейсы Google/Netflix/AWS, Spirit и выводы
Что на кону, когда речь о надёжности и безопасности
Простой и инцидент бьют по доходу, репутации и комплаенсу
Hyper-connected: cloud, микросервисы, IoT
Emergent behavior: баг каскадит в отказ
Rapid change: сотни деплоев в день
Threats: атаки чаще и изощрённее
Reliability и security — свойства всей системы, а не фичи
От процесса и кода к системе и продукту
Не plug-and-play — не купишь как продукт
Whole-system: код, инфра, процессы, люди
Cross-cutting: пронизывает все слои
Фундамент, а не «прикрутим потом»
Резервирование и graceful degradation
Circuit breaker, bulkhead, backpressure
SLO на uptime/latency с самого старта
Chaos-тесты и нагрузка до релиза
Shift left: чем раньше находим — тем дешевле
Формализуем анализ: ATAM, риски, угрозы
Атрибуты качества → анализ → риски и точки чувствительности
Risk Matrix и FMEA превращают тревоги в данные
STRIDE, PASTA, DREAD, MITRE ATT&CK и другие
Google, Netflix, AWS — как это делают лидеры
Benjamin Treynor Sloss, Google
SRE и SLO/error budgets по умолчанию
Design review с секцией reliability/security
Production Readiness Review до запуска
Blameless postmortems, культура обучения
Chaos Monkey гасит инстансы в проде
Проектируют, предполагая сбои
Автономия команд + ответственность
Redundancy, fallback, load shedding
Werner Vogels, Amazon CTO
Безопасность — до всех приоритетов
Encryption и строгий IAM по умолчанию
Сервис не запускают с известной дырой
Well-Architected: security + reliability
Security — ответственность каждого
Reliability — это фича (SLO, error budgets)
Design for failure: предполагай поломку
Лидерство и культура задают тон
continuous improvement — это путь, а не разовый проект
Платформа Spirit: PaaS, observability, инциденты, DevEx
Единый портал, а под ним — весь жизненный цикл сервиса
Единый поисковый движок, алертинг и UI поверх сигналов
От детекции до постмортема и релизов
Nestor — AI-ассистент в IDE
Safeliner подсвечивает уязвимости в коде
Объяснение + предложенное исправление
Security-ревью встроено в поток разработки
Feedback loops, cognitive load, flow state
Satisfaction, Performance, Activity, Communication, Efficiency
Стратегия, культура, архитектура, DevSecOps
Строить
Reliability/security — в OKR
Blameless + security champions
ATAM, threat modeling, DevSecOps
Избегать
Security «потом»
Нет инцидентов — значит ок
Это задача отдела ИБ
AI в ops: помогает и добавляет риски
Zero trust как фундамент security
Serverless/контейнеры меняют resilience
Регуляторы требуют «secure by design»
Что запомнить и с чего начать в понедельник
Reliability и security — built-in качества
Работает микс: архитектура + риски + культура
Учимся у лидеров под свой контекст
Это путь: угрозы и сложность растут
строя надёжно и безопасно, мы даём бизнесу двигаться быстрее
Assess — оцените текущее состояние
Quick wins — threat-модель и chaos-тест
Set targets — SLO для критичных сервисов
Plan — роадмап 12–18 мес.
polomodov.tech
Все слайды и ссылки — в Telegram-канале
Александр Поломодов, Технический директор и Fellow, Т-Технологии
@book_cube