К основному содержимому
#Architecture

ArchBench: хороший каркас, слабый лидерборд (Рубрика Architecture)

#Architecture #AI #AI4SDLC #Evals #Research

Прочитал короткую работу "ArchBench: Benchmarking Generative-AI for Software Architecture Tasks". Идея здравая: собрать разрозненные evals для software architecture в одну расширяемую систему. Но на 19 июля 2026 года это скорее каркас будущего бенчмарка, чем рабочий лидерборд для выбора модели (можете сами оценить лидерборд на сайте бенча).

Команда SERC из индийского IIIT Hyderabad собрала открытую систему из CLI и React-сайта. Каждая задача - это плагин со своим загрузчиком данных, промптом, парсером и метриками. Общий конвейер проходит стадии загрузки, инференса и оценки, сохраняя промпты, сырые ответы, использование токенов и latency. Результаты и новые задачи предполагается принимать через PR.

Но наполнение у самого бенча слабое - всего 5 задач

  • Генерация ADR (architecture decision records)
  • Генерация serverless-компонентов
  • Создание dynamic IoT сервисов
  • Создание микросервисов
  • Восстановление traceability Эти задачи не покрывают архитектурный анализ, размышление о зависимостях, масштабный рефакторинг или работу с компромиссами. Причем end-to-end автоматизированы в CLI только написание ADR и восстановление traceability, а еще три таблицы с метриками перенесены из исходных исследований, их пайплайны для оценок пока интегрируются.

Метрики смешивают разные вещи

  • ROUGE и BERTScore измеряют похожесть текста (для написания ADR)
  • Test pass rate - функциональность кода при генерации сервисов и функций Правда, это далеко от оценки качества архитектуры. Агентных sandbox-окружений для использования инструментов у ребят пока нет пока нет.

Набор моделей тоже удивляет: GPT-3.5, старые GPT-4, Flan-T5/T0, CodeQwen и DeepSeek прежних поколений. В генерации микросервисов есть Codex и Claude Code, но без точных версий и конфигураций, а значит сравнивать такие цифры сложно

Авторы отмечают, что рассчитывают на коммьюнити рост (вот GitHub бенча, если захотите законтрибьютить), но в публичной истории на 19 июля не видно внешних контрибьютов с новыми задачами или результатами моделей. После статьи менялись интерфейс и код, но не сам измерительный корпус.

Итого, этот бенч выглядит как концепт, но он станет реальным бенчом после расширения задач, полной автоматизации, запуска современных версионированных моделей и появления независимых участников. А пока это приглашение строить бенч.

#Architecture #AI #AI4SDLC #Evals #Research