Silicon sampling (Рубрика RnD)
Сегодня я общался с коллегой, что занимается у нас платформой для проведения качественных и количественных исследований (||привет, Андрей||). В ходе общения я вспомнил про этот интересный и быстроразвивающийся подход к их проведению, где LLM получает социодемографическую «биографию» (backstory) персоны и отвечает на вопросы опроса от её имени. Это позволяет воспроизводить мнения тысяч демографических групп без рекрутинга реальных участников. Дальше мне стало интересно, а какие вообще существуют ключевые исследования в этой теме и так я получил подборку ниже
- Argyle et al., 2023 - "Out of One, Many" - это классическая основополагающая работа, которая вводит понятие "алгоритмической точности" (algorithmic fidelity). GPT-3 использует backstories из ANES и Pew. (потом еще вышла в Political Analysis от Cambridge)
- Aher, Arriaga, Kalai (ICML 2023) - "Using Large Language Models to Simulate Multiple Humans and Replicate Human Subject Studies" — метод репликации классических социологических экспериментов (Milgram, Ultimatum Game и др.) на популяции LLM-персон без единого живого участника.
- Santurkar et al. (2023) - "Whose Opinions Do Language Models Reflect?" - создали датасет OpinionQA из 500 спорных вопросов, сравнили 9 LLM с 60 демографическими группами США. Вывод: несоответствие сравнимо с пропастью между демократами и республиканцами по климату.
- Hu & Collier (2024) - "Quantifying the Persona Effect" - персона объясняет менее 10% дисперсии, но даёт статистически значимый прирост. Найдена линейная зависимость: чем сильнее корреляция переменных персоны с мнением, тем точнее симуляция.
- Tejaswani Dash et al (2025) - "Polypersona: Persona-Grounded LLM for Synthetic Survey Responses" - open-source фреймворк с датасетом из 3 568 ответов по 433 уникальным персонам, предназначен для instruction-tuning
- Taday Morocho et al. (2026) - "Assessing the Reliability" - протестировали 70 000+ пар на данных World Values Survey. Persona prompting не даёт стабильного улучшения и в ряде случаев ухудшает результат.
Подход выглядит как вундер-вафля, но есть и некоторые проблемки - Ordering bias (модели систематически предпочитают первый вариант ответа
- Underrepresented groups - 65+, вдовцы, меньшинства воспроизводятся хуже всего
- Корреляционная слепота - fine-tuned модели точнее по маргиналям, но обе техники не восстанавливают латентную структуру корреляций реальной популяции В whitepaper Lin (2024) в "Six Fallacies in Substituting Large Language Models for Human Participants" систематически перечисляются типичные ошибки в интерпретации таких исследований.
А вообще, если вы делаете платформу для количественных и качественных исследований, то есть смысл добавить туда "silicon sampling" как один из подходов для проведения исследований:)
#AI #Engineering #RnD #Science #Research