К основному содержимому
#Math

Доверительное a/b тестирование (Trustworthy Online Controlled Experiments)

#Math #Statistics #PopularScience #Science #ML #Data #Software #PlatformEngineering

Уже после начала отпуска я дочитал книгу по a/b экспериментам, которые являются необходимым инструментом для bigtech компаний для того, чтобы оценить эффективность тех или иных идей по оптимизации веб-сайтов, приложений, ml-моделей.

Это дейстительно крутая книга, которую написали совместно три автора:

  • Ron Kohavi - Technical Fellow and corporate VP of Microsoft's Analysis and Experimentation (previously director of data mining and personalization at Amazon)
  • Diane Tang - Google Fellow, with expertise in large-scale data analysis and infrastructure, online controlled experiments, and ads systems
  • Ya Xu - head of Data Science and Experimentation at LinkedIn

Эта книга на русском вышла в издательстве ДМК Пресс и ее даже можно читать, сверяясь периодически с первоисточником. Книга состоит пяти частей:

  1. Введение для всех - объяснение мотивации проведения экспериментов, как выглядит полный цикл проведения экспериментов, как оценить надежность полученных данных и как прокачать культуру экспериментирования и прийти к платформе
  2. Избранные темы для всех - пример известных экспериментов по оценке влияния скорости вебсайтов на бизнес показатели (full дизайн эксперимента и разбор его результатов), какие организационные показатели бывают, как выбрать OEC (overall evaluation criteria) для оценки эффектов экспериментов, как проведенные эксперименты формируют институциональную память и как их можно использовать для метаанализа, как проводить этичные эксперименты
  3. Дополнительные и альтернативные методы контролируемых экспериментов - что делать, если честный a/b тест не провести (экспертная оценка, исследование UX, фокус-группы, обзоры, ...), как дизайнить наблюдательные исследования для исследования причинно-следственных связей
  4. Платформы для экспериментов - очень важный раздел для тех, кто решил делать свою платформу. Здесь идет речь про эксперименты на стороне клиента (например, в мобильном приложении), про инструментарий для экспериментов, как выбрать еденицу рандомизации (страница/экран, сеанс пользователя, пользователь, компания, ...), как найти компромисс между скоростью/качеством/риском при дальнейшем развитии экспериментальной платформы, как анализировать масштабные эксперименты
  5. Развернутое описание анализа экспериментов - тут наступает время статистики и авторы рассказывают про t-тест, p-значение и доверительные интервалы, ошибки первого и второго родов. Рекомендую почитать книгу "Understanding Statistics and Experimental Design. How to Not Lie With Statistics", про которую я писал раньше. Тут же идет речь про оценку дисперсии и повышение чувствительности экспериментов, как и зачем проводить a/a тестирование, какие существуют ограничительные показатели при проведении экспериментов, навроде SRM (sample ratio mismatch), как может происходить утечка и интерференция между вариантами (например, при экспериментах в соцсетях или на e-com платформах), как мерить долгосрочные эффекты.

В общем, книга топовая и я рекомендую ее к прочтению тем, кто глубоко погружен в тему a/b экспериментов ... или тем, кому просто нравится статистика:)

#Math #Statistics #PopularScience #Science #ML #Data #Software #PlatformEngineering