К основному содержимому
#Agents

[1/2] Hard Won Lessons from Building Effective AI Coding Agents (Рубрика Agents)

#Agents #AI #ML #Software #Engineering #Architecture

Интересный доклад от Nik Pash, Head of AI в Cline с основной мыслью в том, что надо перестать усложнять или почему умный scaffolding убивает AI-агентов. До Cline Ник работал инженером в Meta Reality Labs (2019-2021), Yandex (Image Search), Samsung Electronics. Основные тезисы доклада следующие

1️⃣ Горькая правда в том, что scaffolding устарел Годами разработчики компенсировали слабость моделей clever scaffolding'ом: RAG-индексацией, search trees, хитрыми системами tool calling. Проблема в том, что сейчас frontier-модели побеждают без этих абстракций. То есть capability beats scaffolding. Ник приводит пример Gemini 3.0, что вышел недавно и сразу возглавил Terminal-Bench leaderboard с результатом 54.2% без какой-то агентской обвязки (если глянуть сейчас, то в лидер борде впереди все-таки agentic + model комбинации). Кстати, Terminal-Bench — это интересный "unopinionated generic stripped down harness". Там нет никакого graph search, RAG, индексации — только терминал и задача "разберись сам"

2️⃣ Context engineering tricks — played out Ник откровенно говорит, что вместо отдельных трюков для контекста теперь есть стандартный playbook для поддержки каждой новой модели (Sonnet 4 → 4.5, Gemini 2.5 → 3.0, GPT-5 → 5.1). Tweaks тривиальны, выигрыши маргинальны. По мнению Ника эта тема исчерпана. Новизны в ней не осталось.

3️⃣ Настоящий bottleneck — это бенчмарки и среды для RL (reinforcement learning) Собственно тут зарыта основная мысль доклада: можно построить cleanest agent в мире, но это не улучшит capability модели даже на 1%. Ник говорит

Models only get better when labs train on something hard. And benchmarks, not agent cleverness... determine what frontier models learn to do next. По его мнению модели не "вдруг стали лучше" в использовании инструментов — они стали лучше, потому что построены RL environments, которые заставили их практиковать конкретные действия: обработку моделей отказов, повторов, обработки ошибок. Каждый скачок в reasoning пришел из benchmark'а. Каждый скачок в agent reliability — из RL environment.

Дальше Ник рассказывает как превратить задачи реального мира в данные для тренировок. Cline построил систему под названием "RL Environments Factory" — pipeline для автоматического превращения реальных coding задач в RL environments для обучения моделей. Выглядит это так

Phase 1: Qualification — фильтрация задач Sub-агенты работают параллельно, проверяя, подходит ли задача для превращения в RL environment:

  • Origins: существует ли репозиторий? Доступен ли starting commit? Open source?
  • Journey: что пользователь на самом деле пытался решить? Какова была суть задачи?
  • Outcome: можем ли найти commits/PRs, которые решили проблему в реальности? Откидываются задачи вида: вайбкодинговвый slop, тривиальные задачи, задачи без надежных start/end states[4]

Phase 2: Building RL Environment

  • Archaeology: реконструировать оба состояния (до/после) локально
  • Documentation: задокументировать все obstacles и dependencies
  • Containerization: упаковать в Docker, убрать Git (чтобы агенты не могли reward hack)
  • Verifier: определить, как проверять результат

Интересно, что примерно этим же подходом пользовались ребята из whitepaper "Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks", о котором я рассказывал раньше.

4️⃣ Все делают RL environments но никто ими не делится И тут Ник открыто говорит о том, что каждая крупная agent lab собирает эти данные, то есть все делают какую-то версию RL environment building за кулисами. Но никто не говорит об этом. Эти компании ссылаются на internal benchmarks, но вы никогда не сможете их изучить, потому что они не публикуют их открыто. Эти данные настолько ценны, что их никто не шарит. Agent labs стоят между реальными инженерами, работающими над реальными задачами, и моделями — у них уникальная роль в истории.

В продолжении я расскажу, а что предлагают ребята из Cline, чтобы улучшить ситуацию

#AI #ML #Agents #Software #Engineering #Architecture