К основному содержимому
DevOps Conf · 14 июня 2022

Проверка навыков SRE

System design vs troubleshooting на SRE-собеседованиях

/ Проверка навыков SRE · DevOps Conf 2022

Содержание слайдов

  1. 1. Проверка навыков SRE

    System design vs troubleshooting на SRE-собеседованиях

  2. 2. Александр Поломодов

    Technical Director & Fellow, Т-Технологии

    Архитектура и инженерные практики

    Найм SRE и backend-инженеров

    Подкаст, канал @book_cube

  3. 3. О чём поговорим

    От процесса найма до конкретных секций интервью

    Воронка найма SRE

    Зачем design / troubleshooting

    Структура секции и методики

    Критерии и выбор одного этапа

  4. 4. 01. Процесс найма SRE

    Воронка и место профильных секций

  5. 5. Стадии найма SRE

    От заявки до оффера

    Pre-interview — резюме и контакт

    Tech — Linux, сети, observability

    Senior+ — Design / Troubleshooting

    Fit / Offer — команда, грейд, условия

  6. 6. Уровни и секции

    Junior / Middle / Senior / Senior+ × секции

    Junior/Middle — база

    Senior — профильные секции

    Senior+ — центральный бар

    Секции те же, бар выше

  7. 7. 02. Зачем эти секции

    Что они дают компании и кандидату

  8. 8. Зачем компании проверять troubleshooting

    Цена downtime растёт быстрее, чем выручка

    Нагрузка растёт каждый год

    Downtime стоит дорого

    Дежурство = решения под давлением

    Видны мышление и коммуникация

  9. 9. Чем секция полезна кандидату

    Не только барьер, но и сигнал о компании

    Видна сложность систем

    Видна incident culture

    Команда читается по вопросам

    Понятны грейд и развитие

  10. 10. 03. Структура troubleshooting

    Как мы проводим эту секцию

  11. 11. Структура секции на 60 минут

    Чёткая последовательность шагов

    Формат и ожидания

    Система и инцидент

    Диагностика: гипотезы → проверки

    Workaround, root cause, follow-up

  12. 12. Задача — деградация API

    Понятный сценарий с реальными цифрами

    30k RPS; p95 80 мс

    Алерт: p95 1200 мс, errors 5%

    CPU/GC OK; БД p95 растёт

    Вопросы и workaround?

  13. 13. USE / RED / 4 Golden Signals

    Три рамки, которые должен знать SRE

    USE — ресурсы

    RED — сервисы

    Golden Signals — надёжность

    Рамка нужна для структуры

  14. 14. 04. Критерии оценки

    По чему ставим уровень

  15. 15. Что мы реально оцениваем

    Четыре ключевых блока

    Формализация симптомов

    Проверяемые гипотезы

    Инструменты и порядок

    Коммуникация под давлением

  16. 16. Граница уровней

    Один и тот же инцидент — разные ответы

    Senior — гипотеза → workaround

    Senior+ — несколько версий

    Staff — предотвращает класс инцидентов

    Все уровни — спокойствие и структура

  17. 17. 05. Design vs Troubleshooting

    Чем отличаются и какой остался

  18. 18. Чем отличаются две секции

    Похожие по форме, разные по сути

    Design — с нуля, горизонт лет

    Troubleshooting — production, минуты

    Design: кругозор и зрелость

    Troubleshooting: давление и инструменты

  19. 19. Почему остался только один этап

    Практика двух лет

    Troubleshooting ближе к работе SRE

    Design уходит в team-секцию

    Две секции дороги для воронки

    Качество сохранилось, скорость выросла

  20. 20. Ссылки и материалы

    SRE, troubleshooting, observability, interviews

    Google SRE Book / Workbook

    Systems Performance

    Release It! + DDIA

    Structured interviews / STAR

  21. 21. Спасибо!

    polomodov.tech

    Все слайды и ссылки — в Telegram-канале

    Александр Поломодов, Technical Director & Fellow, Т-Технологии

    @book_cube