Курс "Специалист по искусственному интеллекту". Урок 7. Выбросы, кодирование категорий, визуализация

97 подписчиков

12+
12+

1 просмотр

месяц назад

ПожаловатьсяНарушение авторских прав

Курс "Специалист по искусственному интеллекту". Урок 7. Выбросы, кодирование категорий, визуализация

97 подписчиков

12+
12+

1 просмотр

месяц назад

ПожаловатьсяНарушение авторских прав
12+
12+

1 просмотр

месяц назад

Седьмой урок курса «Специалист по искусственному интеллекту». Подробно разбираем математический метод очистки выбросов IQR, особенности кодирования категорий (Label Encoding vs One-Hot Encoding), боремся с «проклятием размерности» и проводим продвинутую визуализацию (jointplot, pairplot) в Seaborn. В этой лекции мы подробно обсудим: – Понятие выбросов (Outliers) и их влияние на качество обучения (почему выбросы критически вредят весам линейных моделей). – Эффект Билла Гейтса в баре: разницу между средним арифметическим и медианой в статистике. – Как визуализировать выбросы с помощью графиков Box Plot («ящик с усами»). – Математический метод IQR (межквартильного размаха): расчет границ нормального распределения. – Реализацию итеративного алгоритма очистки выбросов стоимости жилья по категориям комнат. – Категориальные признаки: почему машины понимают только числа и как оцифровать текст. – Метод Label Encoding (Порядковое кодирование): когда его уместно использовать и почему он создает ложную иерархию на номинальных данных. – Метод One-Hot Encoding (дамми-кодирование) и его преимущества. – Понятие «проклятия размерности» (Curse of Dimensionality) как главного недостатка OHE-кодирования. – Практическую реализацию дамми-кодирования в Pandas при помощи метода pd.get_dummies(). – Зачем отбрасывать первый признак (параметр drop_first=True) и как это борется с избыточностью информации (мультиколлинеарностью). – Финальную очистку и экспорт подготовленного датасета в файл rent_dataset.csv. – Продвинутую визуализацию взаимосвязей признаков и совместных распределений с помощью sns.jointplot. – Панорамный анализ структуры данных и корреляций через sns.pairplot (использование параметра hue). – Сводный обзор типичных «болезней» данных (пропуски, асимметрия, несбалансированность классов) и методы их лечения. Практическая работа выполняется в интерактивной облачной среде Google Colab. Сайт автора курса: https://leolukin.ru Таймкоды / таймметки 00:00 — Понятие выбросов (Outliers) и их влияние на анализ данных 01:21 — Причины возникновения выбросов: аномалии vs ошибки ввода 03:20 — Какие проблемы создают выбросы: искажение средних и стандартного отклонения 04:02 — Эффект Билла Гейтса в баре: разница между средним и медианой 05:22 — Как выбросы притягивают линию регрессии в методе наименьших квадратов (MSE) 06:40 — Когда выбросы полезны: задачи обнаружения аномалий и мошенничества 08:08 — Методы обнаружения выбросов: ящик с усами (Box Plot) и диаграмма рассеяния 11:28 — Как устроен ящик с усами: медиана, квартили (Q1, Q3) и межквартильный размах (IQR) 11:58 — Стратегии борьбы с выбросами: удаление, замена границами или логарифмирование 12:12 — Почему в устойчивых моделях (деревья решений) выбросы можно оставлять 21:00 — Визуализация выбросов стоимости жилья на графиках Seaborn (sns.boxplot) 22:42 — Сегментация выбросов по категориям (количеству комнат) 33:40 — Итеративный процесс: алгоритм фильтрации выбросов по методу IQR в цикле 36:38 — Почему после первого раунда очистки могут снова появляться «мягкие» выбросы 38:56 — Категориальные признаки: почему машины понимают только числа 40:06 — Метод 1: Порядковое кодирование (Label Encoding) — когда его уместно использовать 41:22 — Проблема ложной иерархии при использовании Label Encoding на номинальных данных 47:07 — Метод 2: Дамми-кодирование (One-Hot Encoding, OHE) и его преимущества 48:48 — «Проклятие размерности» (Curse of Dimensionality) как главный недостаток OHE 51:52 — Реализация OHE в Pandas с помощью pd.get_dummies() 53:32 — Зачем отбрасывать первый признак (drop_first=True) и как это борется с избыточностью 01:01.02 — Финальная очистка и экспорт подготовленного датасета в файл rent_dataset.csv 01:05.00 — Продвинутая визуализация взаимосвязей признаков с помощью sns.jointplot 01:06.00 — Панорамный анализ структуры данных и корреляций через sns.pairplot 01:12.40 — Сводный обзор типичных «болезней» данных (пропуски, асимметрия, мало строк)

, чтобы оставлять комментарии