Размер эффекта и неопределённость: что важнее звёздочки
Различать величину, точность и статистическое решение · Не сравнивать эффекты только по значимости
В этом занятии
- Различать величину, точность и статистическое решение
- Не сравнивать эффекты только по значимости
- Связывать вывод с практической целью
Пригодится: Рекомендуем сначала изучить «Разные средние и похожие люди: читать перекрытие».
Разберёмся перед практикой+
Размер эффекта и неопределённость: что важнее звёздочки
Статистический отчёт часто привлекает внимание словом «значимо», но оно не сообщает величину различия, его практическую важность или вероятность истинности гипотезы. Нужно разделять оценку эффекта, неопределённость и правило статистического решения. Большая выборка способна сделать небольшой эффект различимым, а малая — оставить широкий диапазон совместимых величин. Эти ситуации требуют разного содержательного объяснения, а не одной отметки успеха или провала.
Оценка эффекта выражает направление и величину отношения: разницу средних, изменение доли или другой показатель. Желательно сначала понимать исходные единицы. Разница в один балл может быть большой на короткой чувствительной шкале и почти бесполезной на длинной сумме с заметной ошибкой. Стандартизация помогает сопоставлению, но не отменяет вопроса о содержании, цене изменения и качестве измерения.
Интервал неопределённости показывает диапазон оценок, совместимых с данными при принятой процедуре и допущениях. Частотный доверительный интервал имеет определённое свойство покрытия при мысленных повторениях метода; его нельзя без уточнения превращать в вероятность уже фиксированного параметра. Для вводного чтения главное — не считать центральное число бесконечно точным и смотреть, какие практически важные варианты ещё допускает диапазон.
P-значение характеризует совместимость данных с определённой нулевой моделью через вероятность столь же или более крайних результатов при её допущениях. Оно не является вероятностью того, что нулевая гипотеза верна, и не измеряет размер эффекта. Нарушение дизайна, зависимые наблюдения или подбор анализа после просмотра данных могут делать привычную интерпретацию неуместной. Хороший отчёт поэтому показывает метод, а не только число.
Различие между «значимым» и «незначимым» эффектом само по себе не доказывает различия эффектов. Например, две группы могут иметь близкие оценки, но разные размеры выборки и точность. Чтобы утверждать, что вмешательство действует неодинаково, нужно прямо анализировать разницу эффектов или взаимодействие. Сравнение двух отдельных пороговых решений заменяет этот вопрос другим и легко создаёт ложную историю о подгруппах.
Отсутствие убедительного обнаружения не равнозначно доказательству отсутствия практически важного эффекта. Если интервал широк, данные могут допускать и пользу, и вред. Для вывода об эквивалентности нужны заранее обоснованные границы практически несущественного различия и соответствующий анализ. Такие границы выбирают по содержанию и последствиям, а не после получения удобного результата.
Практическое решение учитывает затраты, доступность, возможные ошибки и обратимость. Малый эффект простого улучшения интерфейса может быть полезен для многих пользователей, а большой эффект дорогой процедуры — не оправдывать нагрузку в конкретном контексте. Это не отменяет научной оценки; это добавляет уровень решения. Следует отдельно сообщать, что показали данные и почему выбранный вариант разумен с учётом цели.
Прозрачность анализа поддерживает накопление знаний. Предварительный план, описание всех основных исходов, доступный метод расчёта и независимое повторение позволяют оценивать результат без охоты за одной звёздочкой. В учебных примерах мы используем условные интервалы и числа, не выдавая их за реальные эффекты. Их задача — научить читать неопределённость и формулировать следующий вопрос, когда таблица не поддерживает слишком сильное заключение.
В условной проверке эффект инструкции в группе А оценён как +3 балла с широким интервалом, а в Б — как +2 с узким. Только Б проходит выбранный порог значимости. Нельзя заключить, что инструкция действует только в Б: центральная оценка А даже больше, но менее точна. Нужен прямой анализ разницы эффектов и её неопределённости, а для практического решения — заранее понятная величина полезного изменения.
- Читаем величины эффектов отдельно от пороговых отметок.
- Сопоставляем точность и не заменяем проверку взаимодействия двумя отдельными решениями.
- Определяем, какие величины практически важны и что ещё допускают данные.
Попробуй самостоятельно
Запиши рассуждения в черновик или сделай построение на бумаге. Эти задания для самостоятельной работы: автоматической проверки и XP за них пока нет.
- Придумай две условные оценки одинаковой величины с разной неопределённостью. Напиши для каждой осторожный, но содержательный вывод, не используя фразу «ничего не доказано» без пояснения.
- Для вымышленного улучшения учебного интерфейса предложи границу практически важного изменения и объясни её через время, ошибки или доступность. Укажи, почему границу следует выбрать до анализа.
Источники и дальнейшее чтение
Материал изложен своими словами. Здесь можно проверить научные основания и подробнее изучить тему; часть источников — на английском.
- Gelman, Stern (2006) — The Difference Between Significant and Not Significant is not Itself Statistically Significant ↗
- Lakens (2013) — Calculating and reporting effect sizes to facilitate cumulative science ↗
- Wasserstein, Lazar (2016) — The ASA’s Statement on p-Values: Context, Process, and Purpose ↗
- Lakens (2022) — Sample Size Justification ↗
Читай и разбирай пример в своём темпе. К практике можно перейти, когда будешь готов.