[2/3] AI Leadership Summit 2025 - AI Leadership (Рубрика AI)
Продолжая рассказ об этой конференции, поделюсь следующей порцией докладов
Booking.com**: Agents With Real ROI (**02:28:27) Бруно Пасос из booking.com и Бьянг из Sourcegraph рассказали о внедрении AI-агентов в booking.com. Изначальным KPI было количество сохраненных часов с использованием Gen AI, потом ребята экспериментировали с подходами и уточнили KPI. Получилась примерно следующая картина - Lead time for change (short term): time to review, time to debug (error log summary), time to merge - Quality (mid term): vulnerability reduction, test coverage, reduce change fail rate - Codebase insights (mid term): track dead code, not performant (redundant queries), replatforming - Tech modernization (long term): monolith reduction, feature flag cleaned (а в booking из-за большого количества экспериментов таких флагов очень много) Ребята сделали GraphQL Query Generator, так как у них достаточно большая и развесистая поверхность GraphQL API. Также они работали над автоматизированной миграцией кода и получили хорошие результаты. Также ребята работали над улучшение Code Review. К концу года все это помогло разработчикам создавать на 30% merge requests, а ключевым фактором успеха было обучение разработчиков работе с этими инструментами.
Writer: Evaluating LLMs for Financial Scenarios (02:49:31) Васим Алик из Writer представил результаты оценки LLM для финансовых сценариев. Они создали набор данных FAIL для оценки моделей в реальных сценариях с ошибками запросов и контекста. Исследование показало, что даже лучшие "думающие" модели часто дают ответы с высоким уровнем галлюцинаций, когда контекст неверен или отсутствует. Алик заключил, что специализированные доменные модели по-прежнему необходимы, несмотря на высокую точность общих моделей.
OpenAI: OpenAI for VPs (03:01:34) Представители OpenAI рассказали о стратегии внедрения их технологий в предприятия из трех фаз
- Создание AI-грамотной рабочей силы (с помощью ChatGPT)
- Автоматизация внутренних операций (с помощью API)
- Интеграция ИИ в конечные продукты Они подчеркнули важность согласования AI-стратегии с общей бизнес-стратегией.
OpenAI: Building Agents the Right Way (03:09:47) Представители OpenAI рассказали о правильных подходах к созданию AI-агентов, где есть три ключевых компонента:
- Надежного контекстного движка
- Высококачественной модели рассуждения
- Безопасной среды выполнения кода Были представлены примеры успешных внедрений агентов в предприятиях, где автоматизировали рутины и повышали эффективность.
Frontier Feud (04:25:41) Панель в виде игры 100 к 1, где надо было угадывать ответы на вопросы. Началось все с самых известных AI ученых, а дальше перешли к "top considerations when choosing model" и так далее. В общем, активность была чисто фановая для участников, но около-бесполезная для зрителей.
Reuters: Missing Pieces of Workflow Automation (04:51:29) Представители Reuters поделились опытом внедрения AI для автоматизации рабочих процессов в медиа-индустрии. Они выделили ключевые "недостающие элементы" успешной автоматизации: интеграцию с существующими системами, обучение сотрудников, управление ожиданиями и создание четких метрик успеха. Особое внимание было уделено тому, как AI помогает журналистам обрабатывать большие объемы информации и быстрее создавать качественный контент.
Arize: Evaluating Agents (05:06:07) Доклад был про методологию оценки эффективности AI-агентов, что собственно и составляет продукт Arize. Причему спикер начала с рассказа про закрытие C раунда финансирования, а дальше представила различные метрики и подходы к тестированию, включая оценку точности, скорости, устойчивости к ошибкам и способности следовать инструкциям. Докладчики подчеркнули важность создания комплексных систем оценки, которые учитывают как технические аспекты работы агентов, так и их практическую полезность для конечных пользователей.
Окончание разбора первого дня саммита в последнем посте.
#AI #Software #Product #Management #Leadership