Сначала сравните модель с простым правилом
Представим сто вымышленных фотографий печатных образцов. На пяти есть дефект, остальные девяносто пять нормальные. Система, которая всегда отвечает, что дефекта нет, получает девяносто пять правильных ответов из ста. Общая доля верных классификаций составляет девяносто пять процентов. При этом она пропускает все дефекты. Такой пример показывает, почему один показатель не раскрывает качество на редком классе. Полезно начать с простого исходного правила и понять, что новая модель делает лучше него. Высокая цифра без такого сравнения может описывать преимущественно состав набора данных, а не способность распознавать нужный признак.
Разложите ошибки по смыслу
Теперь другая условная модель отправила на проверку десять изображений. Среди них четыре действительно дефектные, а шесть нормальные. Один дефект она пропустила. Значит, из пяти существующих дефектов найдено четыре: полнота обнаружения равна восьмидесяти процентам. Из десяти сигналов правильными оказались четыре: доля истинных дефектов среди отмеченных равна сорока процентам. Всего правильных ответов девяносто три: четыре найденных дефекта и восемьдесят девять верно распознанных нормальных изображений. Общая доля ниже, чем у бесполезного постоянного ответа, но теперь часть нужных случаев обнаруживается. Это не делает вторую модель автоматически подходящей. Нужно оценить, допустимы ли шесть лишних проверок и один пропущенный дефект для конкретного процесса.
Показатель должен соответствовать реальному использованию
Выбор метрик зависит от последствий ошибок. Пропуск нужного случая и лишний сигнал создают разные издержки, которые нельзя заменить одной красивой средней цифрой. Важно также знать, сколько примеров было в проверке и насколько они соответствуют будущим условиям. Небольшой набор не даёт основания обещать устойчивую работу на любых изображениях. Полезно отдельно рассматривать заметные группы: например, фотографии при разном освещении или с разными типами дефектов. Для учебного разбора достаточно вымышленных чисел. Для рабочего решения понадобятся проверенные разметки, подходящие данные и согласованный порядок ручного рассмотрения спорных результатов. Название модели и впечатляющая демонстрация не отменяют этих вопросов.
Попробуйте на практике
Сравните два условных способа отбора изображений на проверку, не используя реальные производственные данные.
- Нарисуйте набор из ста условных случаев: пять дефектных и девяносто пять нормальных. Для первого правила отметьте, что все случаи объявлены нормальными.
- Для второй модели запишите четыре найденных дефекта, один пропущенный дефект и шесть ложных сигналов. Вычислите число верно распознанных нормальных случаев.
- Рассчитайте общую долю правильных ответов, долю найденных дефектов среди всех дефектов и долю настоящих дефектов среди всех сигналов.
- Сформулируйте два вопроса к владельцу процесса: насколько допустим пропуск и сколько дополнительных ручных проверок возможно выполнить. Не выбирайте победителя только по одной цифре.
Как проверить результат. Первое правило даёт девяносто пять процентов правильных ответов и не находит ни одного дефекта. Вторая модель даёт девяносто три процента правильных ответов, восемьдесят процентов полноты обнаружения и сорок процентов правильных сигналов. Эти показатели отвечают на разные вопросы.
Частые вопросы
Высокая общая точность всегда бесполезна?
Нет. Общая доля верных ответов может быть полезным показателем, но её смысл зависит от состава данных и задачи. При редком важном классе особенно важно дополнить её разбором пропусков и ложных сигналов.
Можно ли выбрать модель без обсуждения цены ошибок?
Можно сравнить числа, но принять обоснованное рабочее решение будет трудно. Одинаковая ошибка имеет разные последствия в разных процессах. Сначала определите допустимые ограничения и способ проверки спорных результатов.
Самостоятельный разбор темы. Содержание конкретной обучающей программы здесь не представлено.