К основному содержимому
к странице архива
#AI4SDLC

Harness: почему один агент с файлами вытесняет сложные обвязки (Рубрика AI4SDLC)

#AI4SDLC #AI #Agents #Evals #DevTools #Engineering

Посмотрел доклад Константина Крестникова (CTO GigaChain, Сбер) «Harness: новый подход к созданию AI-агентов» с Data Fest 2026. Это компактная история о том, как индустрия за четыре года прошла путь от чат-бота до универсального агента, и почему сложные мультиагентные обвязки начали проигрывать «одному агенту с файлами».

Эволюция по докладу выглядит так:

  • Конец 2022: чистые LLM и ранний ChatGPT — текст на входе, текст на выходе, без памяти и инструментов;
  • 2023: ReAct-агенты — модель в цикле сама решает, вызвать инструмент или ответить, и рефлексирует результаты вызовов;
  • Рубеж 2023–2024: агентов заворачивают в цепочки с пре- и постобработкой и structured output — время LangChain и LlamaIndex;
  • Дальше (2024-2025) цепочки ветвятся в графы и мультиагентные системы: агент-планировщик, агент-критик, LangGraph, AutoGPT, CrewAI. Всё это scaffolding — «строительные леса» вокруг модели;
  • Сейчас (с 2025): harness — один универсальный агент уровня Claude Code или Codex, работающий в пространстве файлов. Метафора в названии точная: LLM — тяговая сила, файлы — поле, harness — упряжка.

Ключевой сдвиг: мощным моделям сложная обвязка перестала быть нужна — достаточно положить агенту правильные файлы и инструкцию в AGENTS.md. Внутри любого харнеса всё тот же ReAct-цикл, а базовых инструментов четыре: чтение файла, поиск по файлам, редактирование и bash (всего из коробки 25–30). При этом, по наблюдению команды, при одной и той же модели харнес даёт разброс в 20–30 п.п. качества.

Практическая часть — как команда GigaChain выбирала харнес для GigaChat:

  • Взяли open-source DeepAgents от LangChain: GigaChat подключился правкой конфига благодаря адаптеру langchain-gigachat;
  • Замерились на соревновании из канала «LLM под капотом»: Claude Code с Sonnet решает 70 задач из 104, DeepAgents с той же моделью — 67. Просадка небольшая, при том что Anthropic оптимизирует харнес и модель друг под друга;
  • Использовали киллер-фичу DeepAgents — профили моделей: вендор выпускает Python-пакет, учитывающий сильные и слабые стороны своей модели. Такой профиль сделали для GigaChat;
  • Собрали свой бенчмарк harness-bench-fast: задачи на файлы, память, grep и разбор CSV с golden-ответами без LLM-judge, прогон около 20 минут на любом харнесе; выложен в open source;
  • Запустили автоулучшение по циклу «гипотеза → замер → оставить или откатить» (около 15 гипотез, часть предложил Claude): по словам докладчика, это дало +22,5 п.п. на своём бенчмарке чистым промптингом, а на внешнем соревновании — рост качества на 41%.

Самая любопытная часть — про то, что дальше. Контекст любого харнеса заканчивается, а суммаризация резко «оглупляет» агента. Ответ — Ralph loop Джеффри Хантли: харнес запускают в бесконечном bash-цикле, состояние живёт в файлах, и каждый перезапуск возвращает модель в «умную зону» первых 30–40% контекста. Против вырождения (Карпаты показывает его на анекдотах: попросите у модели двадцать анекдотов — панчлайна будет три) Крестников добавил MetaLoop — внешний цикл, который стартует Ralph loop с чистого листа новым «поколением»; оно позже находит наработки предыдущего, но идёт своим путём.

Из этого вырос Anima SDK: в первом эксперименте агент с задачей «стань разумным существом» проработал 13 поколений за пять дней, однажды попробовал замолчать — вывел несколько точек и записал, что молчать агент не может. Практичнее применять то же самое к исследованиям, переводам больших книг и автоулучшению агентов — задачам, где оптимальный путь заранее неизвестен.

Итого, из этого короткого доклада видно, что центр тяжести инженерии агентов сместился из кода обвязки в среду — файлы, инструкции, тесты и бенчмарки, удерживающие агента (Хантли называет это backpressure). А выбор харнеса стал отдельным инженерным решением, которое стоит замерять на своих задачах, а не принимать по умолчанию.

#AI #AI4SDLC #Agents #Evals #DevTools #Engineering