В КУРСЕ?

Разбираемся в теме

Теория машинного обучения: как модель обобщает данные

Машинное обучение удобно понимать как задачу поиска закономерности, которая должна работать не только на уже известных примерах. Модель получает данные, подбирает параметры и пытается уменьшить ошибку по выбранному критерию. Но низкая ошибка на обучающей выборке ещё ничего не гарантирует: алгоритм может запомнить детали, которые не повторятся в будущем. Поэтому центральная идея теории машинного обучения — обобщение, то есть способность сохранять качество на новых данных из той же задачи.

Данные задают пространство задачи

Признаки описывают объект, а целевая переменная — то, что модель должна предсказать. В задаче классификации целью может быть категория, в регрессии — числовое значение. Качество исходных признаков и разметки ограничивает качество модели сильнее, чем выбор модного алгоритма. Если данные систематически не представляют важную часть реальности, модель не может самостоятельно восстановить отсутствующую информацию. Поэтому перед обучением проверяют источники, пропуски, выбросы и соответствие выборки реальной задаче.

Функция потерь превращает ошибку в число

Алгоритму нужен количественный критерий, по которому параметры становятся лучше или хуже. Для разных задач используют разные функции потерь. Она не обязательно совпадает с итоговой бизнес-метрикой, поэтому выбор критерия важен. Например, модель может хорошо оптимизировать среднюю ошибку, но плохо работать на редких критичных случаях. Теория помогает разделить оптимизацию математической цели и оценку того, соответствует ли эта цель реальному назначению системы.

Переобучение — это плохое обобщение

Слишком гибкая модель способна подстроиться под шум обучающих данных. Тогда метрика на обучении продолжает улучшаться, а на независимой выборке — ухудшается. Для обнаружения переобучения данные разделяют на обучающую, валидационную и тестовую части или используют перекрёстную проверку. Регуляризация, ограничение сложности и большее разнообразие данных помогают уменьшить проблему, но универсального лекарства нет.

Смещение и дисперсия описывают разные ошибки

Очень простая модель может не уловить важную закономерность — это связано с высоким смещением. Слишком чувствительная модель меняется от небольшого изменения обучающей выборки — это проявление высокой дисперсии. На практике разработчик ищет компромисс между этими крайностями. Именно поэтому «более сложная модель» не всегда означает «более умная». Качество определяется тем, насколько хорошо выбранная сложность соответствует данным и задаче.

Попробуйте на практике

Проведите мысленный эксперимент с моделью, которая предсказывает цену условного товара.

  1. Запишите пять возможных признаков и объясните, какие из них доступны до момента предсказания.
  2. Разделите двадцать условных примеров на обучение и проверку.
  3. Придумайте слишком простое правило и слишком сложное правило, которое запоминает отдельные случаи.
  4. Сравните, как оба правила поведут себя на новых примерах.
  5. Сформулируйте, какая метрика лучше отражает реальную ошибку задачи.

Как проверить результат. Упражнение выполнено, если вы можете объяснить разницу между качеством на обучающих данных и способностью модели работать на новых примерах.

Частые вопросы

Модель с нулевой ошибкой на обучении всегда хорошая?

Нет. Она может просто запомнить обучающие данные и плохо обобщать новые случаи.

Почему нельзя использовать тестовую выборку при настройке?

Тогда она перестаёт быть независимой проверкой и постепенно влияет на решения разработчика.

Более сложный алгоритм всегда лучше?

Нет. Избыточная сложность повышает риск переобучения и может не давать преимущества на новых данных.

Самостоятельный разбор темы. Содержание конкретной обучающей программы здесь не представлено.

Зарегистрируйтесь, чтобы уточнить возможность доступа к этому материалу

Зарегистрироваться
← К списку материалов