Психометрика: что означает полученный баллПсихология / Объяснять классическую модель измерения Пробное занятие
Дифференциальная психология · шаг 9 из 40

Надёжность и ошибка: балл не бывает бесконечно точным

Объяснять классическую модель измерения · Различать источники надёжности

Около 24 минут 6 задач Подсказки рядом

В этом занятии

  • Объяснять классическую модель измерения
  • Различать источники надёжности
  • Учитывать неопределённость индивидуального результата

Пригодится: Рекомендуем сначала изучить «Связь, причина и отбор: читать схему исследования».

Твой путь начинается с личного кабинета

Взрослый создаёт аккаунт для себя и отдельные кабинеты для детей. У каждого — свой прогресс и 5 пробных дней обучения без ограничения минут.

Войти или начать бесплатно
Учебное время начнёт считаться после нажатия
Понять — интереснее, чем запомнить.
Разберёмся перед практикой+

Надёжность и ошибка: балл не бывает бесконечно точным

Измерение психологического признака всегда зависит от процедуры. На результат влияют набор заданий, момент наблюдения, инструкция, способ ответа и особенности оценивания. Некоторые влияния относятся к интересующему свойству, другие добавляют случайные колебания или систематическое смещение. Надёжность описывает согласованность измерения в определённом смысле, но не устанавливает автоматически, что измерено именно нужное свойство. Стабильно неправильные часы хорошо повторяют свою ошибку.

В классической теории тестов наблюдаемый балл условно представляют как сумму истинного балла и ошибки: X = T + E. Слово «истинный» здесь имеет специальный смысл — ожидаемый результат при мысленном повторении соответствующей процедуры. Это не скрытая вечная сущность человека. В модели обычно принимают определённые свойства ошибки, включая нулевое среднее и отсутствие связи с истинным баллом; применимость допущений нужно обсуждать отдельно.

При этих условиях надёжность можно представить как долю дисперсии истинных баллов в дисперсии наблюдаемых. Если люди почти не различаются по изучаемому признаку, одинаковая величина ошибки может занимать большую долю наблюдаемой вариативности. Поэтому коэффициент не является неизменным свойством названия теста: он относится к определённой группе, процедуре и интерпретации. Перенос оценки надёжности на другую выборку нуждается в обосновании.

Разные процедуры проверяют разные виды согласованности. Повторное измерение оценивает устойчивость во времени, но смешивается с действительными изменениями и эффектом знакомства. Сопоставимые формы проверяют зависимость от набора заданий. Согласие оценщиков важно, когда результат кодируют люди. Внутренняя согласованность описывает отношения между пунктами в одном предъявлении. Высокое значение одного показателя не заменяет остальные вопросы о качестве измерения.

Коэффициент альфа часто принимают за универсальный знак качества, хотя он зависит от структуры пунктов, их числа и дополнительных предположений. Много похожих вопросов может дать высокую согласованность при узком содержании. Альфа сама по себе не доказывает одномерности, отсутствия смещения или пригодности для важного индивидуального решения. Выбор коэффициента должен следовать измерительной модели; другие оценки, включая омегу, тоже требуют подходящей структуры и аккуратной интерпретации.

Стандартная ошибка измерения переводит вопрос о надёжности в единицы шкалы. В простой классической формуле SEM = SD × √(1 − r), где SD — стандартное отклонение наблюдаемых баллов, r — оценка надёжности. Эта формула опирается на модель и не гарантирует одинаковой точности на всех уровнях признака. В учебных задачах все величины заданы; реальные индивидуальные интервалы требуют дополнительных оснований и не вычисляются для пользователя.

Если различие двух результатов мало относительно ошибки, жёсткое ранжирование может создавать ложную точность. Но и перекрытие интервалов не является универсальным тестом отсутствия различий: нужны правильная модель сравнения и учёт зависимостей. Полезно сообщать диапазон неопределённости, смысл шкалы и последствия решения. Особенно осторожно следует применять пороги, когда близкие наблюдаемые значения приводят к резко разным возможностям для человека.

Улучшать измерение можно разными способами: уточнять инструкцию, подбирать репрезентативные задания, обучать оценщиков, уменьшать технические помехи и получать несколько подходящих наблюдений. Простое удлинение процедуры не всегда лучше: оно может усиливать утомление и сужать содержание повторяющимися вопросами. Задача состоит не в максимальном коэффициенте любой ценой, а в достаточной точности для ясно определённой цели при разумной нагрузке.

X = T + E: наблюдение и ошибка525660646860При SD = 10 и r = 0,84 стандартная ошибкаизмерения равна 4 баллам.
Шкала показывает 60 ± 4 как иллюстрацию единицы стандартной ошибки, а не готовый доверительный интервал и не индивидуальный диагноз.

Рисунок к заданию

Шкала показывает 60 ± 4 как иллюстрацию единицы стандартной ошибки, а не готовый доверительный интервал и не индивидуальный диагноз.

Широкий рисунок можно прокручивать пальцем или стрелками клавиатуры. Escape — закрыть.

НА ПРИМЕРЕ

В вымышленной шкале стандартное отклонение равно 10, оценка надёжности — 0,84. По заданной классической формуле SEM = 10 × √0,16 = 4 балла. Разницу результатов 61 и 62 нельзя представлять как идеально точное различие свойств. Организатору стоит учитывать модель ошибки и цель решения. При этом данный расчёт не является готовым доверительным интервалом или нормой: это иллюстрация того, как точность выражают в единицах шкалы.

  1. Проверяем, что коэффициент относится к нужной процедуре и группе, а не заимствован только по названию.
  2. Подставляем величины в явно заданную формулу и получаем масштаб ошибки в баллах.
  3. Отделяем расчёт от решения: одного SEM недостаточно для индивидуальной классификации и утверждения о причине различия.

Открываем учебную модель…

Попробуй самостоятельно

Запиши рассуждения в черновик или сделай построение на бумаге. Эти задания для самостоятельной работы: автоматической проверки и XP за них пока нет.

  1. Придумай две процедуры с одинаковой повторяемостью: одна измеряет нужный результат, другая устойчиво подменяет его скоростью чтения. Объясни, почему надёжность не различит их полезность сама по себе.
  2. Для проверки вымышленного навыка предложи по одному улучшению инструкции, содержания заданий и оценивания. Укажи, какой источник ошибки уменьшает каждое, и какой новый риск может появиться.

Источники и дальнейшее чтение

Материал изложен своими словами. Здесь можно проверить научные основания и подробнее изучить тему; часть источников — на английском.

Читай и разбирай пример в своём темпе. К практике можно перейти, когда будешь готов.