Эволюция SRE: внедрение AI-ассистента в Т-Банке (Рубрика SRE)
Посмотрел интересное выступление своего коллеги, Ивана Юрченко, руководителя FineDog Growth в Т-Банке, который занимается развитием платформы инцидент-менеджмента FineDog, которая помогает банку оперативно выявлять сбои в работе сервисов и сокращать время их устранения. Этот доклад был представлен в рамках конференции Platform Engineering Night и он посвящен внедрению AI-ассистентов в работу инженеров по надежности.
Кстати, про три доклада с Platform Engineering Night я уже рассказывал:
- "AI и Platform Engineering" от Игоря Маслова (VP T-Bank at T-Bank)
- "Разработка собственного AI-ассистента для кода: спринт или марафон?" от Дениса Артюшина (tech product & engineer at T-Bank)
- "AI-помощники при работе с кодом. Взгляд в будущее" от Евгения Колесникова (tech product at Yandex)
Дальше расскажу про основные идеи доклада Ивана.
1. Эволюция инструментов инцидент-менеджмента Иван представил концепцию трехуровневого развития инструментов для работы с инцидентами
- Платформизация — объединение разрозненных инструментов в единую экосистему для более эффективного управления инцидентами
- Автоматизация — упрощение рутинных действий, что позволяет сократить время реакции на инциденты
- Роботизация — автоматизация принятия решений с использованием AI 2. Жизненный цикл инцидента и роль AI Иван подробно описал этапы работы с инцидентом: детекция, работа с инцидентом и пост-анализ. Особое внимание уделил важности сбора контекста для эффективного решения проблем. А AI-ассистент сейчас интегрируется во все этапы этого цикла, помогая не только реагировать на инциденты, но и предсказывать их, анализировать логи и предлагать варианты решения до начала критической ситуации. 3. Инновационные проекты на базе AI Основные проекты, про которые рассказал Иван следующие
- Summarizer - система для агрегации информации и автоматической генерации пост-анализов инцидентов. Использует AI для улучшения качества аналитики и выявления закономерностей в инцидентах
- LogAnalyzer - продвинутый инструмент для анализа логов и поиска связанных инцидентов. Применяет кластеризацию логов для выделения аномалий. Выглядит это примерно так -- Логи скачиваются из Sage (observability платформы) каждые 5 минут -- Дальше происходит предобработка текста и сегментация на фрагменты -- Потом векторизация с помощью TF-IDF и трансформеров -- В финале данные визуализацируются в трехмерном пространстве для наглядного представления аномалий 4. SRE ассистент и его возможности Иван представил AI-ассистента, разработанного для поддержки SRE-команд, который обладает следующими возможностями
- Интеграция с корпоративным мессенджером Time для удобного доступа
- Взаимодействие с различными ботами и LLM-агентами
- Выполняет ключевые сценарии: -- Работа с инцидентами и генерация пост-анализов -- Получение информации из базы данных -- Поиск по базе знаний с использованием RAG-платформы -- Управление дежурствами через мессенджер 5. Метрики и оценка эффективности AI-ассистента Иван рассказал про ключевые метрики: качество ответа, полнота, галлюцинации, ошибки периодов. Оценки на основе ручной разметки около 600 запросов получились такие
- Precision: 0.54
- Recall: 0.43 Для LogAnalyzer результаты были такие
- Precision: 0.64
- Recall: 0.85 6. Перспективы развития В заключительной части выступления Иван обозначил планы на будущее
- Запуск новых итераций SRE-ассистента с улучшенными возможностями
- Дальнейшее совершенствование метрик и интеграция системы обнаружения аномалий
- Постоянный поиск новых идей и обмен опытом с профессиональным сообществом
В общем, доклад мне понравился - интересный баланс общей теории и деталей о конкретных сценариях, которые мы пытаемся AI'фицироватьь для наших SRE инженеров.
P.S. Если тема показалась интересной, то можно еще почитать мой обзор статьи про общие процессы вокруг надежности в Т-Банке, которую написал Леша Мерсон, ex-dev advocate платформы Sage.
#AI #SRE #SystemDesign #Software #Architecture #Metrics #SoftwareArchitecture #Engineering