Курс "Специалист по искусственному интеллекту". Урок 12. Логистическая регрессия.
Курс "Специалист по искусственному интеллекту". Урок 12. Логистическая регрессия.
Двенадцатый урок курса «Специалист по искусственному интеллекту». Подробно разбираем теорию логистической регрессии. Выясняем, почему это алгоритм классификации, как работает сигмоида, почему MSE неприменима в классификации, как устроен Log Loss и почему функция predict_proba() — это ключевое преимущество метода. В этой лекции мы подробно обсудим: – Парадокс названия: почему логистическая регрессия относится к классификации, а не к регрессии. – Проблему жестких порогов линейного перцептрона и почему важно оценивать именно вероятность принадлежности к классу. – Принцип уверенности модели: как вероятности помогают принимать гибкие бизнес-решения на практике. – Математическую структуру алгоритма: линейную комбинацию признаков и функцию активации Сигмоиду (Sigmoid). – Как сигмоида сжимает бесконечный диапазон значений линейной комбинации в интервал [0, 1]. – Почему нельзя использовать среднеквадратичную ошибку (MSE) для классификации: разбор проблемы невыпуклости (non-convexity) и застревания оптимизаторов в локальных минимумах. – Логарифмическую функцию потерь Log Loss (бинарную кросс-энтропию): формулу и интуитивное понимание бесконечного штрафа за уверенно ошибочные прогнозы. – Функцию стоимости (Cost Function) для всего набора данных. – Особенности реализации LogisticRegression в Scikit-Learn: алгоритмы оптимизации — «солверы» (solvers) под капотом. – Техники борьбы с переобучением: L1 (Lasso) и L2 (Ridge) регуляризацию. – Обзор ключевых гиперпараметров: обратную силу регуляризации C, типы солверов (lbfgs, liblinear, saga) и балансировку классов (class_weight). – Обучение логистической регрессии на датасете «Ирисы Фишера» и проверку стабильности оценок через кросс-валидацию. – Ключевую прикладную фичу — метод predict_proba(): как использовать вероятности для настройки гибких порогов срабатывания (на примере умной фильтрации спама). Практическая работа выполняется в интерактивной облачной среде Google Colab. Сайт автора курса: https://leolukin.ru Таймкоды / таймметки 00:00 — Логистическая регрессия: почему название сбивает с толку (классификация, а не регрессия) 00:37 — Сравнение с Перцептроном: проблема жесткой пороговой классификации 01:19 — Главное преимущество логистической регрессии: расчет вероятностей принадлежности к классам 02:15 — Уверенность классификации: почему порог 50/50 важен для прикладных задач 02:47 — Дифференцируемость функции активации как основа стабильной оптимизации 03:31 — Математическая структура: линейное уравнение и функция активации Сигмоида (Sigmoid) 05:07 — Как сигмоида преобразует непрерывные значения в диапазон [0, 1] 06:25 — Процесс обучения модели: оптимизация весов (w) и смещения (b) 07:27 — Почему нельзя использовать среднеквадратичную ошибку (MSE) для классификации: невыпуклость функции потерь 07:38 — Введение в логарифмическую функцию потерь Log Loss (бинарную кросс-энтропию) 08:18 — Интуиция за Log Loss: жесткое штрафование за уверенно неверные предсказания 08:47 — Формула Log Loss для одного объекта и функция стоимости (Cost Function) для всего набора 09:54 — Практическая реализация LogisticRegression в Scikit-Learn: особенности работы под капотом 10:10 — Обзор продвинутых алгоритмов оптимизации — «солверов» (solvers) в sklearn 11:00 — L1 (Lasso) и L2 (Ridge) регуляризация в логистической регрессии для борьбы с переобучением 11:58 — Ключевые гиперпараметры: обратная сила регуляризации C, солверы (solver) и веса классов (class_weight) 12:42 — Практический код: обучение логистической регрессии на датасете «Ирисы» (70/30) 13:00 — Оценка качества модели и стабильности оценок с помощью кросс-валидации K-Fold 14:24 — Основная фича логистической регрессии — функция predict_proba() 15:00 — Анализ вероятностей для нового объекта и практический кейс применения в спам-фильтрах