DeepSeek Harness: когда история агента становится частью экономики инференса (Рубрика #AI4SDLC)
Посмотрел разбор Cloud Codes про DeepSeek Harness. Он хорошо продолжает мой лонгрид о совместной эволюции AI-разработки: здесь видно, как экономика инференса меняет архитектуру истории агента.
Главное правило DeepSeek Harness простое: если что-то уже увидела модель, запись об этом в журнале не переписывают. Сессия — этоне изменяемый массив сообщений, а append-only журнал типизированных событий. Всё видимое модели должно быть зафиксировано в нём или связанном объекте. Свежий экземпляр сессии может восстановить запрос байт-в-байт и сравнить с запросом рабочего цикла. Так формула Agent = Model + Harness становится конкретнее: обвязка отвечает не только за инструменты и промпт, но и за доказуемое происхождение контекста.
Зачем такая строгость? API модели на каждом шаге снова получает историю, а prefix cache экономит вычисления только на совпадающем начале запроса. Автор ролика получает 120× экономии из таблицы цен на API на момент записи. Но 18 августа 2026 года прайс V4 Pro уже показывает $0,022 против $0,66 off-peak и $0,044 против $1,32 peak — разницу в 30×. Это не 30-кратное удешевление сессии: коэффициент относится только ко входным токенам, без учёта выхода, инструментов и инфраструктуры. Но архитектурный стимул остаётся сильным.
Самый красивый пример — compaction Старый summarizer начинал запрос с нового system prompt и ломал прогретый префикс, когда история была самой длинной. Исправление почти комично: повторить прежние system prompt, tools и сообщения байт-в-байт, а инструкцию «сожми разговор» добавить последним user message. Даже неиспользуемые схемы инструментов остаются для выравнивания токенов.
Авторы правильно разделяют корректность и экономию. Cache hit идет с гарантией best effort: могут отличаться модель, маршрут, header запроса или диапазон compaction. Источником истины остаётся журнал, а независимый инвариант заново собирает запрос и не позволяет кешу рабочей сессии проверять самого себя. Это рифмуется с моим разбором Loop Engineering: сильная часть цикла — механизм, способный доказать, что система не потеряла состояние и не нарушила границу.
В репозитории также лежат сотни Agent Notes со статусами implemented, archived, proposed, rejected и обязательными alternatives considered. Код показывает, что сделали; заметка — почему отказались от других вариантов. Это почти буквальная реализация моего поста про PRD, ADR и BDD для людей и AI.
Связь с коэволюцией стека становится ещё заметнее в minimal preset. Репозиторий прямо описывает его как RL-agent composition:
- фиксированный короткий prompt
- persistent bash и
str\_replace\_editorвоспроизводят среду обучения Получается контурharness → траектории → post-training → тот же harness. Но открытый код не доказывает, что пользовательские сессии идут в обучение; он показывает архитектурную возможность, а не фактическую политику данных.
Поэтому я бы уточнил финальный тезис видео. Продукт — не harness сам по себе, а меняющаяся связка model + serving + harness + tools + traces. Для обычной компании вывод прежний: не обязательно строить ещё один общий агентный цикл. Полезнее разложить стек по слоям и оставить своими воспроизводимые эпизоды, outcome-evals, контракты инструментов, идентичность и политики доступа.
Практически из DeepSeek Harness я бы забрал четыре проверки:
- Можно ли восстановить каждый запрос из долговечного журнала;
- Сохраняет ли compaction смысл истории и стабильный префикс;
- Есть ли независимый инвариант, который не доверяет рабочему циклу;
- Измеряем ли мы стоимость полезного результата, а не только cache hit.
DeepSeek Harness пока developer preview: репозиторий предупреждает о будущих несовместимых изменениях. Нейтрального бенчмарка качества в видео нет. Поэтому рейтинг стоит отложить, а архитектуру — внимательно прочитать.
#AI4SDLC #AI #Agents #Architecture #DevTools #Evals #Engineering