Прогноз и применение: полезная связь ещё не решение
Оценивать проверку на новых данных · Различать добавочную точность и причинность
В этом занятии
- Оценивать проверку на новых данных
- Различать добавочную точность и причинность
- Учитывать ошибки и последствия применения
Пригодится: Рекомендуем сначала изучить «Личностный показатель: от наблюдений к баллу».
Разберёмся перед практикой+
Прогноз и применение: полезная связь ещё не решение
Связь личностного показателя с исходом может быть полезной, даже если она не идеальна. Но переход от исследования к решению требует нескольких шагов: определить критерий, проверить точность на новых данных, оценить добавочную пользу и последствия ошибок. «Статистически связано» не означает «достаточно для отбора», а «предсказывает» не означает «является причиной». Каждое утверждение должно иметь собственное основание.
Проверка на тех же данных, по которым выбирали модель, часто завышает впечатление точности. Алгоритм может подстроиться под случайные особенности выборки. Отложенная проверка или корректная перекрёстная проверка помогают оценить перенос на новые наблюдения. В данных с повторными измерениями важно разделять по людям: если записи одного человека попали и в обучение, и в проверку, модель может использовать узнаваемость участника вместо переносимой закономерности.
Добавочная валидность спрашивает, что личностный показатель даёт сверх уже доступной информации. Если прогноз выполнения роли уже использует опыт и рабочую пробу, нужно сравнить его с прогнозом, дополненным чертой. Даже улучшение средней точности может быть слишком небольшим для цены сбора данных или риска ошибочного решения. Поэтому статистический результат и практическая оправданность не являются одним критерием.
Точность зависит от выбранной меры и распределения исходов. В синтетической задаче 90 из 100 случаев относятся к одной категории; модель, всегда выбирающая её, получает 90 процентов совпадений и не обнаруживает ни одного случая другой категории. Общий процент скрывает структуру ошибок. Нужно сообщать, какие случаи пропускаются, какие ошибочно выделяются и почему это важно для конкретного применения.
Доказательства также должны переноситься по аудитории, языку и времени. Модель, обученная на добровольцах цифровой платформы, может отражать особенности этой платформы и её пользователей. Изменение интерфейса меняет цифровые следы без изменения личности. Поэтому высокотехнологичный способ получения прогноза не отменяет обычных требований к конструкту, выборке и проверке. Большое число записей не гарантирует репрезентативность.
Научная осторожность здесь не сводится к отказу от количественных методов. Она делает решение проверяемым: сопоставляет базовый и расширенный прогноз, показывает ошибки и даёт человеку возможность понять основание вывода. В курсе мы не строим систему реального отбора. Вымышленные таблицы помогают увидеть, какую информацию скрывает одно число и где заканчивается эмпирическая связь и начинается отдельное решение о допустимости применения.
В синтетической выборке из 100 макетов 90 соответствуют правилу, 10 требуют доработки. Алгоритм всегда отвечает «соответствует». Он получает 90 правильных ответов, но не находит ни одного макета для доработки. Рекламный отчёт показывает только 90 процентов точности.
- Общая доля правильных ответов действительно равна 90/100 = 90 процентов.
- Среди 10 макетов для доработки найдено 0: способность обнаруживать эту категорию в примере равна нулю.
- Сравниваем с простой базовой стратегией: алгоритм её и реализует, поэтому число не показывает полезного различения.
- Для применения нужны структура ошибок, цена пропуска и проверка на новых данных с заранее заданным критерием.
Открываем учебную модель…
Попробуй самостоятельно
Запиши рассуждения в черновик или сделай построение на бумаге. Эти задания для самостоятельной работы: автоматической проверки и XP за них пока нет.
- Составьте синтетическую таблицу из двадцати случаев с двумя категориями и неравными частотами. Сравните постоянный прогноз с моделью, которая обнаруживает часть редких случаев, но иногда ошибается на частых. Объясните, почему выбор зависит от последствий ошибок.
- Спроектируйте проверку добавочной пользы условного личностного показателя к рабочей пробе в вымышленном проекте. Назовите базовую модель, новые данные, единицу разделения и критерий практического улучшения. Не используйте реальные данные участников.
Источники и дальнейшее чтение
Материал изложен своими словами. Здесь можно проверить научные основания и подробнее изучить тему; часть источников — на английском.
- Bleidorn & Hopwood (2019). Using Machine Learning to Advance Personality Assessment and Theory ↗
- Youyou, Kosinski & Stillwell (2015). Computer-Based Personality Judgments Are More Accurate Than Those Made by Humans ↗
- Soto (2019). How Replicable Are Links Between Personality Traits and Consequential Life Outcomes? ↗
- AERA, APA & NCME. Standards for Educational and Psychological Testing (2014) ↗
Читай и разбирай пример в своём темпе. К практике можно перейти, когда будешь готов.