К основному содержимому
#AI

Beyond the Hype: A Realistic Look at Large Language Models • Jodie Burchell • GOTO 2024

#AI #ML #Engineering #Software #Architecture #SystemDesign #DistributedSystems

Джоди Берчилл, developer advocate в JetBrains, в своем выступлении в середине 2024 года представила реалистичный взгляд на большие языковые модели (LLM), их развитие, возможности и ограничения. Она стремилась развеять ажиотаж вокруг LLM и представить сбалансированное понимание их применения.

1. История и развитие LLM

  • LLM являются частью долгой истории исследований в области обработки естественного языка (NLP), начиная с автоматизации текстовых задач, таких как классификация и обобщение текстов
  • Прорывы в технологиях, такие как CUDA (для обучения нейронных сетей на графических процессорах) и доступ к большим наборам данных (например, Common Crawl), позволили создать более мощные модели.
  • Важным этапом стали сети с LSTM (Long short-term memory), появившиеся в середине 2000х годов, которые улучшили обработку контекста, но их ограничения привели к созданию трансформеров. 2. Модели-трансформеры и GPT
  • Трансформеры заменили последовательную обработку текста на параллельную, что сделало их более эффективными для NLP.
  • Генеративные предварительно обученные трансформеры (GPT) стали основой современных моделей.
  • С момента выхода GPT-1 до GPT-4 наблюдается значительное улучшение качества генерации текста: -- GPT-1 создавал грамматически правильный текст без контекста. -- GPT-3 начал учитывать контекст и кодировать языковую информацию. -- GPT-4 достиг 1 триллиона параметров и стал более универсальным. 3. Возможности и ограничения LLM LLM демонстрируют впечатляющие результаты в задачах NLP, таких как перевод, суммирование текста и ответы на вопросы. Однако они остаются ограниченными:
  • Модели могут запоминать обучающие данные вместо обобщения.
  • Их способность решать новые задачи зависит от уровня обобщения: -- Локальное обобщение: работа с похожими примерами. -- Широкое обобщение: решение задач в разных областях. -- Крайнее обобщение: выход за рамки человеческих возможностей (недостижимо для текущих моделей).
  • Проблема оценки интеллекта моделей связана с фокусом на навыках, а не на базовых способностях. 4. Применение и практические примеры Джоди продемонстрировала использование LLM для извлечения информации из баз данных с помощью подхода RAG (поисковая расширенная генерация):
  • Разделение документов на части, создание вложений и сохранение их в векторной базе данных.
  • Преобразование запросов во вложения для поиска релевантных данных.
  • Создание приложений для ответов на вопросы с помощью инструментов вроде LangChain. Пример: поиск информации в документации PyCharm с использованием модели ChatGPT. Про RAG отдельно интересно почиать статью "Emerging Patterns in Building GenAI Products", про которую я рассказывал раньше 5. Оценка производительности и выбор модели Эффективность моделей зависит от предметной области и варианта использования. Для сложных задач может потребоваться настройка модели или создание специализированных наборов данных, а таблицы лидеров, такие как Huggingface, помогают сравнивать производительность моделей. 6. Ограничения и перспективы Несмотря на успехи, LLM не достигли уровня искусственного общего интеллекта (AGI). Они требуют тщательной настройки, выбора задачи и оценки производительности. Джоди подчеркнула важность реалистичного подхода к ожиданиям от LLM, сравнив текущие проблемы с теми, что существуют в разработке ПО и машинном обучении десятилетиями.

Таким образом, выступление Джоди Берчилл акцентировало внимание на необходимости трезвой оценки возможностей LLM, их ограничений и практического применения.

#AI #ML #Engineering #Software #Architecture #SystemDesign #DistributedSystems