К основному содержимому
Research Insights Made Simple
Разбор исследованияResearch Insights Made Simple

Обвязка агента: что действительно помогает

Контролируемое сравнение планирования, инструментов и управления контекстом

/ Research Insights Made Simple · Обвязки агентов 5/7 · Эксперимент с обвязкой

Содержание слайдов

  1. 1. Обвязка агента: что действительно помогает

    Контролируемое сравнение планирования, инструментов и управления контекстом

  2. 2. Обвязку можно разбирать по частям

    План · действия · контекст вокруг одного цикла

  3. 3. 176 настроек — не полный перебор

    4 модели × 2 набора задач × 22 настройки

  4. 4. Два набора проверяют разную работу

    Исправить репозиторий ≠ выполнить задачу в терминале

  5. 5. План живёт вне истории диалога

    update_plan → сохранённый план → следующий вход модели

  6. 6. Меняется весь интерфейс действий

    Готовые операции ↔ команды bash

  7. 7. Пять политик собираются из трёх механизмов

    Заглушки · возврат оригинала · пересказ

  8. 8. Сначала дешёвые заглушки, затем пересказ

    T4 сохраняет начало задачи и свежий хвост

  9. 9. Маленькое окно делает управление контекстом ценнее

    Доля решённых задач по размеру окна, оба набора

  10. 10. Большая часть выигрыша — предотвращённый обрыв

    Ошибки переполнения у T0 и длина траекторий

  11. 11. T4 — самая дешёвая из управляемых политик

    У T4 дорогой пересказ срабатывает реже

  12. 12. Модели редко возвращают выводы из-под заглушек

    T2 против T1: возврат добавлен, остальное совпадает

  13. 13. Слабой модели план помогает не бросать задачу

    Nemotron-3 30B · SWE-bench · T4/128k

  14. 14. Сильным моделям план сокращает лишние проверки

    Nemotron-3 550B и Mistral Medium 3.5 · SWE-bench · T4/128k

  15. 15. Bash помогает одной модели и мешает другой

    T4/128k · план включён

  16. 16. Одна модель меняет предпочтение между наборами

    Mistral Medium 3.5 · T4/128k

  17. 17. Каждый компонент оставляет свой след

    Длина траектории · точка остановки · размер действия

  18. 18. Разметку поведения тоже нужно проверять

    LLM-судья + выборка, проверенная людьми

  19. 19. Результат ограничен моделями, задачами и реализацией

    Четыре модели · два семейства · одна попытка на задачу

  20. 20. Симптом в траектории подсказывает компонент

    Наш вывод из исследования

  21. 21. Обвязка должна окупаться

    Управление контекстом снимает ограничение окна

    Заглушки перед пересказом снижают цену

    План меняет момент остановки

    Интерфейс зависит от модели и задачи

    Проверяйте пользу после смены модели

    Измеряйте причину, затем меняйте механизм