К основному содержимому
#Agents

[2/2] Hard Won Lessons from Building Effective AI Coding Agents (Рубрика Agents)

#Agents #AI #ML #Software #Engineering #Architecture

Продолжая рассказ про этот доклад, надо рассказать про Cline-Bench - open source benchmark для реальных задач, который анонсирует Cline. Каждая задача внутри бенча это:

  • Starting repo snapshot (git commit hash)
  • Real prompt from user
  • Ground truth tests на основе кода, который реально зашипился

Этот бенч

  • Полностью open source, no secret sauce, no locked datasets
  • Любой может использовать для SFT, RL, eval
  • Любой может поучаствовать

Как контрибьютить

  1. Работайте над open source проектом с включенным Cline Provider
  2. Opt into cline-bench initiative
  3. Если frontier model застрял и вы вмешались, чтобы починить — это идеальный кандидат для benchmark

В общем, просто используйте Cline, наблюдайте, где модель struggles, и Cline подберет эти задачи в open-source benchmark.

P.S. Если подбивать мысли из доклада, то можно вынести следующее 1. Для инженеров, использующих AI coding agents

  • Перестаньте over-engineering scaffolding. Проще = лучше ​- Фокусируйтесь на capability модели, а не на умных абстракциях ​- Ваши real-world failure cases — самые ценные данные для экосистемы ​- Contribution в open benchmarks помогает всем ​ 2. Для исследователей и разработчиков моделей
  • Сдвиг от scaffolding tricks к environment design ​- Качество верификатора критично: надо ориентироваться на outcome, а не имплементацию ​- Автоматизация создания RL environments из реальных задач ​- Измеряйте модели на реальных engineering work, а не на паззлах ​ 3. Для компаний, строящих AI products
  • Доступ к real-world engineering data — ключевое конкурентное преимущество
  • RL environments > clever prompting ​- Benchmarks drive capability improvements ​- Open source collaboration ускоряет прогресс всей индустрии ​ #AI #ML #Agents #Software #Engineering #Architecture