[2/2] Ranking Engineer Agent: как Meta превращает ML-эксперименты в автономный контур разработки моделей (Рубрика AI)
Продолжая рассказ про ML-агента от запрещенной в России компании Meta, надо рассказать про его архитектуру и устройство. Но начать надо с основных концепций
1️⃣ Hibernate-and-wake mechanism Когда агент запускает долгую training job, он не держит активную сессию, а передает ожидание фоновой системе, сохраняет состояние и потом автоматически продолжает работу после завершения job. Это выглядит как важный паттерн для всех production-агентов, которые работают не с быстрым “ответь на вопрос”, а с процессами на часы, дни и недели.
2️⃣ Dual-source hypothesis engine Гипотезы генерируются не только из головы LLM. REA опирается на два источника:
- Historical insights database - базу прошлых экспериментов, успехов и неудач;
- ML Research Agent - компонент, который исследует baseline-конфигурации и предлагает новые стратегии оптимизации.
3️⃣ Трехфазный planning framework Перед запуском REA предлагает exploration strategy, оценивает GPU cost и согласует подход с инженером. Дальше план обычно идет в три этапа:
- Validation - проверка отдельных гипотез;
- Combination - комбинирование перспективных гипотез;
- Exploitation - более агрессивная оптимизация лучших кандидатов в рамках согласованного бюджета.
4️⃣ Planner + Executor Внутри агент разделен на планировщика и исполнителя: REA Planner и REA Executor. Planner помогает сформировать план экспериментов, а Executor занимается асинхронным выполнением: запускает jobs, ждет, собирает результаты, обрабатывает ошибки и возвращает planner’у уже actionable output.
5️⃣ Skills, Knowledge and Tool System REA подключен к внутренним инструментам Meta: job schedulers, experiment tracking, codebase navigation и другим системам. Плюс он работает на внутреннем agent framework Confucius (есть отдельный whitepaper), который как раз рассчитан на долгие многошаговые задачи в больших кодовых базах.
6️⃣ Guardrails и runbooks Когда агент сталкивается с OOM (out of memory), loss explosion, инфраструктурной ошибкой или плохими результатами, он не зовет инженера по каждому поводу. Он сверяется с runbook’ом типовых проблем и действует в рамках заранее заданных ограничений. Но при этом доступы, preflight checklist, compute budget и остановка при превышении лимитов остаются под контролем людей.
В общем, REA - это связка из агента, памяти, инструментов, очередей, бюджетов, метрик, runbooks и точек контроля. Именно это отличает его от демки и делает production-системой.
У ребят из Meta есть дальнейшие план по развитию этого агента:
- Fine-tuning специализированных моделей для генерации гипотез
- Расширение аналитических инструментов
- Усиление privacy/security/governance
- Перенос подхода на новые домены
И это уже начало происходить. В следующем посте серии Meta рассказала про KernelEvolve - агентную систему для оптимизации низкоуровневых kernels под разные accelerator’ы: NVIDIA GPU, AMD GPU, MTIA и CPU. Там логика похожая: не one-shot генерация кода, а поиск по множеству вариантов, автоматическая проверка correctness/performance, профилирование и итерации. Meta пишет, что KernelEvolve дал более 60% improvement inference throughput для Andromeda Ads model на NVIDIA GPU и более 25% training throughput improvement для ads model на MTIA.
То есть траектория понятна: сначала агент помогает находить лучшие модели, потом помогает делать их production-ready через оптимизацию инфраструктуры, а дальше похожие agentic-подходы можно переносить на compiler optimization, memory management, system configuration и другие инженерные контуры.
#AI #Agents #Engineering #ML #Architecture #DevEx #Productivity #Management #Software #SystemDesign