[2/2] Hard Won Lessons from Building Effective AI Coding Agents (Рубрика Agents)
Продолжая рассказ про этот доклад, надо рассказать про Cline-Bench - open source benchmark для реальных задач, который анонсирует Cline. Каждая задача внутри бенча это:
- Starting repo snapshot (git commit hash)
- Real prompt from user
- Ground truth tests на основе кода, который реально зашипился
Этот бенч
- Полностью open source, no secret sauce, no locked datasets
- Любой может использовать для SFT, RL, eval
- Любой может поучаствовать
Как контрибьютить
- Работайте над open source проектом с включенным Cline Provider
- Opt into cline-bench initiative
- Если frontier model застрял и вы вмешались, чтобы починить — это идеальный кандидат для benchmark
В общем, просто используйте Cline, наблюдайте, где модель struggles, и Cline подберет эти задачи в open-source benchmark.
P.S. Если подбивать мысли из доклада, то можно вынести следующее 1. Для инженеров, использующих AI coding agents
- Перестаньте over-engineering scaffolding. Проще = лучше - Фокусируйтесь на capability модели, а не на умных абстракциях - Ваши real-world failure cases — самые ценные данные для экосистемы - Contribution в open benchmarks помогает всем 2. Для исследователей и разработчиков моделей
- Сдвиг от scaffolding tricks к environment design - Качество верификатора критично: надо ориентироваться на outcome, а не имплементацию - Автоматизация создания RL environments из реальных задач - Измеряйте модели на реальных engineering work, а не на паззлах 3. Для компаний, строящих AI products
- Доступ к real-world engineering data — ключевое конкурентное преимущество
- RL environments > clever prompting - Benchmarks drive capability improvements - Open source collaboration ускоряет прогресс всей индустрии #AI #ML #Agents #Software #Engineering #Architecture