К основному содержимому
#AI

Почему ИИ не работает без настоящего инженера (Рубрика AI)

#AI #Software #Architecture #Metrics #Engineering #ML #Agents

Посмотрел интересный выпуск подкаста "Организованное программирование" Кирилла Мокевина, куда он позвал интересного гостя, Андрея Татаринова, поговорить про AI не только с точки зрения концепций, но и практического применения. Сам Андрей — опытный инженер (ex-Yandex, ex-Google) с бэкграундом в области машинного обучения. После работы в найме он основал собственную команду "Эпоха 8" (Epoch 8), которая специализируется на решении задач методами машинного обучения и помогает стартапам внедрять ИИ в реальные продукты (кстати, в блоге на сайте Андрея интересно почитать кейсы внедрения AI решений). Ниже представлены основные моменты обсуждения, что длилось около 2.5 часов:)

1. ИИ как "волшебные API-вызовы" Андрей отмечает, что сложная тематика машинного обучения превратилась в классические API-вызовы к сервисам. Для большинства разработчиков современный ИИ — это не самостоятельное обучение моделей с нуля, а умелое использование готовых решений через API. 2. Пределы экспоненциального роста Андерй считает, что мы близки к возможному насыщению в развитии AI. Он сравнивает текущую ситуацию с космическими технологиями: после бурного роста наступает плато, требующее качественно новых подходов. Быстрая смена лидеров на бенчмарках указывает на приближение к теоретическому пределу качества. 3. Техническая архитектура LLM Инференс и рантаймы: Нейросети представляют собой последовательность матричных перемножений и нелинейностей. Выбор рантайма критически важен для эффективности, особенно для больших моделей. Языковые модели генерируют токены по одному, запуская инференс многократно для получения полного ответа. Это объясняет стриминговый характер вывода. 4. Практические вызовы внедрения Fine tuning и prompt engineering - это технологии для масс, так как обучение с нуля имеет "заградительный ценник" для обычных компаний. Причем начинать рекомендуется начинать с написания лучшего промта и его тестирования. Отдельно Андрей отметил проблемы совместимости - кастомизация моделей часто приводит к несовместимости с различными рантаймами. Конвертация между рантаймами аналогична кросс-компиляции программ. А вообще, рантаймов много и для LLM есть помимо общих вида PyTorch существуют llama.cpp, Ollama, Llamafile, ... 5. RAG и векторные базы знаний RAG (Retrieval Augmented Generation) решает проблему ограничений промтов по объему. Система использует векторную базу знаний для поиска релевантной информации и "насыщения" промта целевыми данными. Очень популярная техника в текущий момент 6. Ограничения современных моделей Даже с четкими правилами модели могут выдавать неточную информацию из-за своей вероятностной природы. Это особенно критично для специализированных задач, таких как рекомендательные системы в e-commerce. Количество информации, что может усвоить модель на претрейне ограничено количеством гипер-параметров. Дообучение модели иногда приводит к забыванию знаний в других областях, что были усвоены во время тренировок. 7. Будущее ИИ-агентов Стандарт MCP (Model Control Protocol) открывает возможности для создания бизнес-ассистентов. Однако ограничивающим фактором остается способность к многошаговому рассуждению. Андрей скептично относится к возможности создания универсального ассистента, который разумно решал бы многостадийные задачи в ближайшем будущем.

По результатам общения можно выделить ряд практических советов для решения задач с помощью LLM

  • Начинайте с промт-инжиниринга вместо попыток обучить модель с нуля
  • Используйте RAG для работы с большими объемами специализированных данных
  • Тестируйте качество итеративно, как в классическом ML
  • Учитывайте ограничения рантаймов при планировании архитектуры
  • Реалистично оценивайте возможности текущих ИИ-решений

#AI #Software #Architecture #Metrics #Engineering #ML #Agents