К основному содержимому
#RnD

База про Causal AI: сначала граф, потом эффект (Рубрика RnD)

#RnD #AI #Data #MachineLearning #CausalInference #Research #DORA

Посмотрел короткий доклад Вадима Порватова из Сбера «Проблемы и перспективы Causal AI» с Data Fest 2026. Это хороший пятнадцатиминутный маршрут по теме, которую часто сводят к фразе «корреляция не означает причинность». Главный тезис здесь практичнее: прежде чем оценивать эффект действия, нужно восстановить хотя бы правдоподобную структуру причин.

Вадим начинает с трёх уровней аналитики

  • Описательная отвечает на вопрос, что произошло
  • Предсказательная дает ответ о том, что произойдёт
  • Каузальная подсказывает, а что нужно изменить, чтобы получить нужный результат

Золотой стандарт для последней - рандомизированный эксперимент или a/b тест. Кстати, по a/b тестам рекомендую книгу "Доверительное a/b тестирование (Trustworthy Online Controlled Experiments)", о которой я уже рассказывал. Но такие тесты могут быть дорогими, долгими, неэтичными или физически невозможными. Тогда приходится работать с наблюдаемыми данными и явно записывать допущения.

Дальше доклад пробегает почти всю карту causal discovery:

  • От Фишера с рандомизированными экспериментами к potential outcomes Рубина и structural causal models Джудеи Перла;
  • Два этапа causal inference: сначала identification - какой причинный граф допустим, затем estimation - каков эффект вмешательства;
  • Два классических семейства поиска структуры: constraint-based и score-based; на входе таблица данных плюс экспертные ограничения на наличие и направление связей;
  • Допущения об ацикличности, Markov property и faithfulness, а главное - causal sufficiency: все ли общие причины измерены. Именно скрытый confounder способен превратить сильную корреляцию в ложную историю про эффект;
  • Алгоритмы PC/SGS и семейство FCI. FCI не просто ориентирует рёбра, а отмечает места, где связь может объясняться скрытой переменной; FCI-stable, RFCI и FCI+ улучшают устойчивость, скорость или работу с разреженными графами. Более новые методы пытаются уже восстанавливать структуру latent variables.

Отдельный холодный душ - LLM. По приведённой Вадимом работе, модели без специальной настройки плохо решают causal discovery, а fine-tuning даёт хрупкий выигрыш: небольшой сдвиг данных ломает результат. Для сценарного моделирования LLM нужен внешний causal grounding, а не уверенный текст о том, «что на что влияет».

В финале Вадим показывает CAIMAN - разрабатываемую в Сбере библиотеку с оптимизированными вариантами PC/FCI, bootstrap-оценкой неопределённости и будущим переносом вычислений на GPU. По словам автора, код планируется опубликовать; публичного репозитория на момент проверки я не нашёл.

P.S.

Вообще, я в эту тему погрузился когда-то, когда разбирался с современной моделью DORA - её ежегодные исследования тоже начинаются с опросов, то есть с наблюдательных, а не экспериментальных данных.

  • В ранней методологии DORA использовала теоретические гипотезы, латентные конструкты, факторный анализ и PLS-SEM (про это говорит документ 2021 года)
  • В отчёте 2024 года подход сформулирован ещё ближе к докладу: исследователи задают DAG, решают, какие факторы учитывать, а затем байесовски оценивают направление, величину и неопределённость эффектов.

Но статистика не превращает ответы респондентов в причинность по щелчку. Вывод остаётся условным относительно выбранного графа, качества вопросов и учтённых confounders. И тут мы видим прямую связку с докладом: самая важная часть causal inference происходит до расчёта коэффициентов - когда мы решаем, какие переменные существуют и почему между ними вообще должна быть стрелка.

#AI #Data #MachineLearning #CausalInference #Research #DORA