Хорошо объясняет прошлое — хорошо предсказывает новое?
Различать объяснение и прогноз · Понимать переобучение и утечку данных
В этом занятии
- Различать объяснение и прогноз
- Понимать переобучение и утечку данных
- Оценивать добавочную пользу и базовый уровень
Пригодится: Рекомендуем сначала изучить «Различия в работе: требования роли и качество прогноза».
Разберёмся перед практикой+
Хорошо объясняет прошлое — хорошо предсказывает новое?
Объяснение и прогноз связаны, но ставят разные задачи. Объяснительная модель стремится понять отношения и механизмы, а прогностическая — точно оценить новый результат на доступной информации. Простая причинная гипотеза может плохо предсказывать отдельного человека из-за множества других факторов. Гибкая модель может хорошо предсказывать, не раскрывая причинного механизма. Поэтому качество одного вида не следует автоматически приписывать другому.
Переобучение возникает, когда модель приспосабливается не только к устойчивой структуре, но и к случайным особенностям данных разработки. Чем больше вариантов настройки и сложнее модель, тем легче получить впечатляющее описание прошлого. Проверка на новых данных показывает, какая часть качества переносится. Нельзя многократно подбирать параметры по тестовой выборке и продолжать считать её независимой: она постепенно становится частью разработки.
Разделение данных должно соответствовать будущему применению. Если у одного участника много записей, случайное распределение строк между обучением и тестом может оставить того же человека в обеих частях. Тогда модель использует его устойчивые особенности и даёт слишком оптимистичную оценку прогноза для совершенно новых людей. Аналогичная проблема возникает с временными данными, когда будущая информация случайно попадает в прогноз прошлого.
Утечка данных может быть явной или незаметной. Например, признак «число подсказок после ошибки» недоступен до решения, которое модель якобы предсказывает. Предобработка, выбор переменных и настройка порогов также должны выполняться без использования оценочных исходов. Иначе итоговая точность измеряет не реальную способность предвидеть новый случай, а частичное знание ответа. Хорошее название алгоритма не исправляет этот дизайн.
Базовая модель необходима для понимания пользы. Если лишь десятая часть участников нуждается в разборе, правило «никому не предлагать» будет верно в 90% случаев по общей точности, но пропустит все нужные случаи. Поэтому выбирают показатели под цель: доли разных ошибок, точность вероятностей, нагрузку и полезность решения. Одно высокое число без сравнения с простым правилом может вводить в заблуждение.
Добавочная полезность отвечает на вопрос, насколько новый набор сведений улучшает прогноз относительно уже доступного. Важно проверять её на независимых данных и выражать в подходящих единицах. Рост объяснённой дисперсии с 0,12 до 0,15 — три процентных пункта, а не «модель стала объяснять на 15% больше каждого человека». Даже реальный прирост нужно сопоставить с затратами и рисками получения дополнительных сведений.
Калибровка и различение описывают разные свойства вероятностного прогноза. Модель может хорошо ранжировать случаи, но систематически завышать вероятности. Хорошая калибровка означает соответствие частот заявленным вероятностям в подходящих группах случаев, но не гарантирует высокой способности различать конкретных людей. Для решения важно знать оба свойства и их перенос на новые условия, не превращая вероятность в неизбежность.
Практическая проверка включает заранее определённые исходы, разделение разработки и оценки, простые альтернативы, анализ ошибок и мониторинг изменившихся условий. После внедрения среда может измениться, а само решение модели — повлиять на последующие данные. Поэтому прогноз не является разовой магической находкой. Он требует ограниченного применения, возможности пересмотра и ясного объяснения, что именно известно о его качестве.
В условной выборке 100 случаев поддержки полезны 10, остальные 90 обходятся без неё. Правило «не предлагать никому» имеет общую точность 90%, но нулевой охват полезных случаев. Новая модель на тех же данных показывает 95%, однако разработчик многократно выбирал признаки по этой таблице. Для оценки нужны независимые случаи и показатели пропусков, лишних предложений и нагрузки. Иначе сравнение двух процентов не отвечает на практический вопрос.
- Вычисляем качество простого базового правила и замечаем, какие ошибки скрывает общая точность.
- Проверяем независимость оценочных данных и доступность признаков в момент реального решения.
- Сравниваем модели по релевантным исходам, включая добавочную пользу, а не только по одному проценту.
Попробуй самостоятельно
Запиши рассуждения в черновик или сделай построение на бумаге. Эти задания для самостоятельной работы: автоматической проверки и XP за них пока нет.
- Придумай признак, который выглядит полезным для прогноза результата задания, но возникает только после него. Объясни утечку и предложи допустимую информацию, доступную заранее.
- Составь план разделения данных для новых пользователей и для будущих попыток тех же пользователей. Объясни, почему одинаковое случайное деление строк не отвечает обоим вопросам.
Источники и дальнейшее чтение
Материал изложен своими словами. Здесь можно проверить научные основания и подробнее изучить тему; часть источников — на английском.
Читай и разбирай пример в своём темпе. К практике можно перейти, когда будешь готов.