Сначала формулируют задачу и целевую переменную
Классификация отвечает на вопрос, к какому классу относится объект, регрессия предсказывает числовое значение, а кластеризация ищет группы без готовых меток. До выбора модели нужно понимать, что считается правильным ответом и как он используется. Если бизнес-задача сформулирована как «найти хороших клиентов», это ещё не машинное обучение. Нужно определить наблюдаемый критерий, например вероятность повторной покупки в заданный период.
Признаки представляют объект числами
Модель работает с признаками: возрастом, количеством действий, значениями датчиков, пикселями или другими числовыми представлениями. Хороший признак должен быть доступен в момент реального предсказания. Если в обучении случайно использовать информацию, которая появляется только после события, возникает утечка данных и модель показывает нереалистично высокое качество. Подготовка признаков нередко важнее выбора сложного алгоритма.
Обучение и проверка должны быть разделены
Если оценивать модель на тех же примерах, по которым она подбирала параметры, легко получить слишком оптимистичный результат. Поэтому данные разделяют на обучающую и проверочную части, а иногда выделяют отдельную тестовую выборку. Временные данные требуют особой осторожности: нельзя обучаться на будущем и проверять на прошлом. Схема разделения должна имитировать реальное использование модели.
Переобучение показывает разницу между запоминанием и обобщением
Слишком сложная модель способна хорошо запомнить тренировочные данные, включая случайный шум. Тогда качество на обучении высокое, а на новых примерах падает. Для контроля используют валидацию, регуляризацию, ограничение сложности и больше разнообразных данных. Метрику выбирают по задаче: обычная accuracy бесполезна, если один редкий класс особенно важен и ошибка на нём имеет высокую цену.
Попробуйте на практике
Спроектируйте простую задачу машинного обучения на бумаге.
- Выберите предсказываемое событие и запишите точную целевую переменную.
- Назовите пять признаков, доступных до момента предсказания.
- Разделите условные данные на обучение и проверку.
- Выберите тип модели: классификация или регрессия.
- Опишите два типа ошибок и укажите, какой из них опаснее.
Как проверить результат. Схема готова, если цель измерима, признаки доступны в реальном использовании, а качество проверяется на данных, которые модель не видела.
Частые вопросы
Нужно ли начинать с нейронных сетей?
Нет. Простые модели часто дают сильную базовую линию и помогают понять данные и метрики.
Чем признак отличается от целевой переменной?
Признаки подаются модели на вход, а целевая переменная является ответом, который она учится предсказывать.
Высокая точность на обучении означает хорошую модель?
Нет. Важнее качество на независимых данных и соответствие метрики реальной задаче.
Самостоятельный разбор темы. Содержание конкретной обучающей программы здесь не представлено.