С 14 по 27 марта идет весенняя распродажа в издательстве Питер, когда на все бумажные книги скидка 50% по купону — Книга
И хоть мне не нравятся переводы этого издательства, но некоторые книги у них получаются неплохо, например, книга "Теоретический минимум по Big Data" от ребят со сложными именами Анналин Ын и Кеннет Су. Книжка просто огонь для тех, кто хочет узнать про базовые методы обработки больших данных, но не хочет вспоминать математику за границами средней школы:)
Авторы вначале рассматривают некоторый базис:
- подготовка данных (формат данных, типы и выбор переменных, конструирование признаков и неполные данные)
- выбор алгоритма (обучение без учителя, обучение с учителем, обучение с подкреплением)
- настройка параметров (как быть с переобучением и недообучением)
- оценка результатов (метрики и валидация) и дальше подробнее методы в формате описание метода, пример использования, ограничения метода и выходы.
В книге рассмотрены методы:
- кластеризация методом k-средних на примере профилей коинозрителей
- метод главных компонент на примере изучения пищевой ценности
- ассоциативные правила на примере поиска покупательских шаблонов
- анализ социальных сетей на примере схемы отношений:)
- регрессионный анализ на примере оценки цены дома
- метод k-ближайших соседей на примере экспертизы вина 🙂
- метод опорных векторов на примере обнаружения сердечно-сосудистых заболеваний
- дерево решений на примере прогноза спасения с Титаника
- случайные леса на примере предсказания криминальной активности
- нейронные сети на примере распознавания цифр
- a/b тесты и многорукие бандиты на примере открутки рекламы
В общем, книжка очень хороша для начального знакомства со всеми этими методами. Рекомендую.
#Software #BigData #ForBeginners