К основному содержимому
Визуальный стиль SmartDev 2023
SmartDev · 21 сентября 2023

Проектируем надёжные системы

От выбора риска до инженерной платформы и культуры

/ Designing Reliable Systems · SmartDev 2023

Содержание слайдов

  1. 1. Проектируем надёжные системы

    От выбора риска до инженерной платформы и культуры

  2. 2. Александр Поломодов

    Technical Director · Tinkoff

    Отвечает за архитектуру

    Отвечает за управление поставкой

    Развивает инженерные практики и платформу

  3. 3. Надёжность начинается с риска и заканчивается культурой

    Почему о надёжности забывают

    Как выбрать и контролировать риск

    Как проектировать надёжные приложения

    Как внедрять, эксплуатировать и растить культуру

  4. 4. Доступность — время, надёжность — вероятность

  5. 5. 01. Почему о надёжности часто забывают?

    Невидимость · оценка · эволюция

  6. 6. Надёжность замечают после отказа

  7. 7. 02. Как выбрать и контролировать риск?

    Класс приложения · SLI/SLO/SLA · мониторинг

  8. 8. Влияние на бизнес задаёт уровень сервиса

  9. 9. SLO становится SLA, когда появляются последствия

  10. 10. White-box и black-box смотрят с разных сторон

  11. 11. RED: четыре сигнала в три

  12. 12. 03. Как проектировать надёжные приложения?

    Домены · данные · восстановление · архетипы

  13. 13. Отказ должен упираться в границу домена

  14. 14. Данные выживают по плану

  15. 15. Цели восстановления выбирают модель развёртывания

  16. 16. Шесть паттернов ограничивают отказ

  17. 17. Доступность стоит денег

  18. 18. Надёжный дизайн готов и к изменению, и к восстановлению

  19. 19. 04. Как внедрять и эксплуатировать?

    Метрики · непрерывная поставка · платформа Spirit

  20. 20. Скорость поставки не требует жертвовать стабильностью

  21. 21. Непрерывная поставка — общая работа команды

  22. 22. Платформа возвращает Dev, Sec, Data и Ops в один поток

  23. 23. Работающий код — только часть хорошего дизайна

    A Philosophy of Software Design

    Не ускорять текущую задачу ценой лишней сложности

    Проектировать систему так, чтобы она продолжала работать

    Считать дизайн основной целью, а не побочным результатом

  24. 24. Платформа закрывает путь от кода до инцидента

  25. 25. 05. Как создать культуру надёжности?

    Aristotle · Westrum · postmortems

  26. 26. Психологическая безопасность — первый фактор команды

  27. 27. Созидательная культура исследует аномалии, а не прячет их

  28. 28. Разбор инцидента должен менять систему

  29. 29. Надёжность окупается, когда сбой стоит дороже

    Сначала выберите приемлемый риск

    Закрепите его через SLI, SLO и SLA

    Ограничьте отказы архитектурой и платформой

    Превратите инциденты в обучение организации

    Да — если цена сбоя выше цены надёжности

  30. 30. Источники, на которые ссылается оригинал

    Site Reliability Engineering · Google

    Deployment Archetypes for Cloud Applications

    Building Secure and Reliable Systems

    Accelerate · A Philosophy of Software Design

  31. 31. Спасибо!

    polomodov.tech

    Слайды, заметки и другие выступления — на сайте

    Александр Поломодов, Technical Director, Tinkoff

    @book_cube