top of page

Психологічна енкциклопедія

Стандартна похибка вимірювання (SEM): як оцінити невизначеність індивідуального тестового бала

6 днів тому
Читати 15 хв

Оновлено: 6 днів тому

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Стандартна похибка вимірювання (standard error of measurement, SEM) показує, наскільки неточним може бути окремий тестовий бал через випадкову похибку вимірювання. Вона переводить абстрактну розмову про «надійність тесту» в одиниці самої шкали: бали, стандартні бали, секунди, пункти опитувальника або іншу одиницю, у якій подано результат.


Якщо людина отримала 70 балів, це не означає, що її виміряний рівень відомий з абсолютною точністю до одного бала. За однакової вимірюваної властивості повторний результат може трохи змінитися через випадкові джерела варіації. NCME визначає стандартну похибку вимірювання як стандартне відхилення індивідуальних спостережуваних балів за гіпотетичних повторних вимірювань або паралельних форм за однакових умов. Саме тому SEM є насамперед показником невизначеності індивідуального результату, а не ще одним коефіцієнтом «якості тесту».


У сучасних стандартах тестування точність результату розглядають як частину ширшої системи доказів щодо надійності, похибок вимірювання, валідності та справедливості. Standards for Educational and Psychological Testing прямо вимагають подавати SEM у тих одиницях, у яких повідомляють тестовий бал, а коли похибка змінюється вздовж шкали — розглядати умовні стандартні похибки на різних рівнях бала.


В українській професійній термінології вживається форма «стандартна похибка вимірювання»; її, зокрема, використовує Всеукраїнська психодіагностична асоціація. Англомовна абревіатура SEM створює типову пастку: нею також часто позначають standard error of the mean — стандартну похибку середнього. Це різні статистичні величини з різними формулами і різними запитаннями.


Що саме вимірює SEM


У класичній теорії тестів спостережуваний бал X описують як суму істинного бала T і похибки E: X = T + E. «Істинний бал» у цій моделі — це не буквальна, недосяжна «справжня кількість тривоги» чи «справжній інтелект». Це теоретичне очікуване значення балів людини за нескінченної серії еквівалентних вимірювань у визначеному наборі умов.


SEM характеризує розкид випадкової компоненти похибки навколо цього очікуваного рівня. Тому менша SEM означає вужчу невизначеність окремого бала, а більша SEM — ширшу. Класичний огляд Лео Гарвілла описує SEM як стандартне відхилення похибок, пов’язаних із тестовими балами певної групи, і показує, як SEM застосовують для інтервалів навколо отриманих результатів. Оригінальний навчальний модуль NCME про SEM залишається корисним для розуміння цієї логіки.


SEM не вимірює всі можливі недоліки тесту. Систематичний зсув, невалідний зміст, культурна невідповідність, помилковий ключ оцінювання або стабільно упереджена процедура можуть давати хибні результати, не обов’язково збільшуючи випадкову SEM. Тому мала SEM не доводить валідність і не гарантує справедливість інтерпретації.


Формула SEM у класичній теорії тестів


Найвідоміша формула для загальної стандартної похибки вимірювання має вигляд:


SEM = SD × √(1 − r)


де SD — стандартне відхилення спостережуваних тестових балів у відповідній вибірці, а r — оцінка надійності, релевантна до того джерела похибки, яке ми хочемо врахувати. З формули видно: за однакового SD вища надійність дає меншу SEM.


Формула здається простою, але її зміст залежить від того, що саме стоїть на місці r. Ретестова надійність, міжоцінювальна надійність, надійність паралельних форм та внутрішня узгодженість не є взаємозамінними оцінками одного й того самого джерела похибки. Якщо потрібна невизначеність повторного вимірювання в часі, коефіцієнт внутрішньої узгодженості може не відобразити важливу варіацію між сесіями.


Сучасні методологічні рамки для досліджень надійності й похибки наголошують, що дизайн повинен відповідати джерелам варіації, які мають значення для конкретного використання результату. Це один із центральних принципів COSMIN Risk of Bias tool для reliability та measurement error.


Приклад розрахунку: бал 70, SD = 10, надійність = 0,84


Припустімо, шкала має стандартне відхилення SD = 10, а релевантна оцінка надійності дорівнює r = 0,84. Тоді:


SEM = 10 × √(1 − 0,84) = 10 × √0,16 = 10 × 0,4 = 4 бали.


Якщо людина отримала 70 балів, одиничний результат слід читати з приблизною невизначеністю порядку кількох балів, а не як абсолютно точну координату. У цій моделі один SEM дорівнює 4 балам.


Якщо за тих самих SD = 10 надійність була б 0,91, SEM становила б 3 бали. Якщо надійність — 0,64, SEM дорівнювала б 6 балам. Це показує зв’язок між надійність і точність, але не дозволяє порівнювати SEM механічно між будь-якими вибірками: сама SD теж залежить від розкиду людей у вибірці.


Як із SEM отримують інтервал невизначеності


SEM часто використовують для побудови інтервалу навколо спостережуваного бала. За стандартного наближення з приблизно нормально розподіленою випадковою похибкою інтервал можна записати як:


спостережуваний бал ± z × SEM.


Для приблизного 68-відсоткового інтервалу z ≈ 1. Для приблизного 95-відсоткового інтервалу z ≈ 1,96. У прикладі з балом 70 і SEM = 4 маємо приблизно 70 ± 4, тобто 66–74, для інтервалу на рівні близько 68%, і 70 ± 7,84, тобто приблизно 62,2–77,8, для інтервалу на рівні близько 95%.


Таке обчислення є модельним наближенням, а не універсальною гарантією. Його коректність залежить від способу оцінювання SEM, форми розподілу похибок, припущення про сталість або умовність похибки та того, чи справді модель відповідає даним. Harvill окремо застерігав від надмірного тлумачення наближених інтервалів балів.


Часте формулювання «є 95% ймовірність, що істинний бал конкретної людини лежить у цьому інтервалі» змішує різні статистичні інтерпретації. У класичній частотній логіці рівень довіри стосується процедури побудови інтервалів у повтореннях. Для практичного читача головний зміст простіший: сам спостережуваний бал має вимірювальну невизначеність, і коректна інтерпретація повинна показувати її, а не приховувати.


Чому один SEM для всієї шкали не завжди достатній


Традиційна CTT-формула часто дає один SEM для всіх людей. Це зручно, але означає припущення, що точність приблизно однакова в різних частинах шкали. У багатьох тестах це припущення слабке: біля середини шкали вимірювання може бути точнішим, а на крайніх рівнях — менш точним, або навпаки.


Саме тому сучасні стандарти рекомендують, коли це можливо й доречно, повідомляти умовна SEM — умовну стандартну похибку вимірювання на різних рівнях бала, особливо поблизу порогових значень, де невелика похибка може змінити класифікаційне рішення. Це закріплено в Standards for Educational and Psychological Testing.


Методологічне дослідження Lek і Van De Schoot порівнює один загальний, умовний та персон-специфічний SEM. Воно показує, що вибір між ними залежить від припущень і компромісу між зміщенням та варіативністю оцінки. Для практики це означає: число SEM у технічному паспорті тесту треба читати разом із методом, за яким його отримано.


SEM і надійність: пов’язані, але не тотожні


Надійність зазвичай є відносною характеристикою: вона показує, наскільки спостережувані відмінності між людьми відображають відмінності, а не похибку в межах заданої моделі. SEM є абсолютною характеристикою: вона виражає величину похибки в одиницях шкали.


Через це високий коефіцієнт надійність не завжди означає малу абсолютну похибку, а порівняння надійність між вибірками може вводити в оману. У дуже різнорідній вибірці міжособова дисперсія збільшується, і коефіцієнт надійності може виглядати вищим, навіть якщо абсолютний розкид повторних результатів майже не змінився. SEM допомагає повернути інтерпретацію до одиниць самого результату.


Надійність також не дорівнює валідності. Тест може стабільно давати подібні результати й водночас вимірювати не те, що заявлено, або підтримувати не ті висновки, для яких його використовують. APA у рекомендаціях щодо психологічного оцінювання наголошує, що надійність є необхідною, але недостатньою умовою валідних висновків.


Який коефіцієнт надійності підставляти у формулу


У формулу SEM не варто автоматично підставляти найвідоміший або найбільший коефіцієнт. Спочатку треба визначити, яка реплікація відповідає реальному рішенню. Якщо людина проходитиме той самий тест повторно через тиждень, значущою є варіація між моментами. Якщо бал залежить від оцінювача, важлива міжоцінювальна варіація. Якщо можуть використовуватися різні форми, значущою є еквівалентність форм.


Cronbach’s alpha оцінює певний аспект внутрішньої узгодженості за конкретною моделлю. Він не є універсальним коефіцієнтом усіх джерел похибки і сам по собі не дає права трактувати SEM як невизначеність повторного бала в часі. Так само високий тест-ретест coefficient не відповідає автоматично на питання про узгодженість різних оцінювачів.


Практичне правило таке: назва коефіцієнт надійності має відповідати джерелу варіації, яке потрібно вважати похибкою для конкретного використання тесту. Якщо цього зв’язку немає, математично правильна формула може отримати неправильний зміст.


SEM у дослідженнях повторних вимірювань і підхід COSMIN


У клінічних та вимірювання результатів дослідженнях SEM часто оцінюють не через одну загальну формулу SD × √(1 − r), а безпосередньо з компонентів дисперсії повторних вимірювань. У такому дизайні намагаються створити умови, за яких сам конструкт між двома сесіями не змінився, а відмінності між балами відображають похибку вимірювання.


COSMIN рекомендує чітко описувати джерела варіації, модель надійність та модель SEM. У статті Mokkink та співавторів 2023 року надійність і похибка вимірювання розглядаються як пов’язані, але різні властивості: надійність стосується здатності розрізняти людей попри похибку, а похибка вимірювання — абсолютної величини варіації, яка не приписується реальній зміні.


У повторних вимірюваннях SEM може бути отримана, наприклад, як квадратний корінь із відповідної залишкової/дисперсії похибки у дисперсійній або ICC-моделі. Точна формула залежить від дизайну. Тому запис «SEM = 3» без опису популяції, інтервалу між вимірюваннями, умов, оцінювачів і статистичної моделі є неповним.


SEM і зміна між двома вимірюваннями


Одна SEM описує невизначеність одного бала. Коли порівнюють два бали однієї людини, похибка різниці включає невизначеність обох вимірювань. Якщо SEM однакова для обох сесій, а похибки незалежні, стандартна похибка різниці дорівнює приблизно √2 × SEM.


Це лежить в основі поширеної формули мінімально виявлюваної зміни на рівні 95%: MDC95, яку в COSMIN-контексті часто називають SDC95, ≈ 1,96 × √2 × SEM.


У нашому прикладі SEM = 4. Тоді SDC/MDC95 ≈ 1,96 × 1,414 × 4 ≈ 11,1 бала. Різниця у 3 або 5 балів між двома вимірюваннями може бути цілком сумісною з очікуваною похибкою. Різниця понад приблизно 11 балів за цих конкретних припущень перевищує поріг, який модель відносить до випадкової похибки з обраним рівнем певності.


Актуальні матеріали COSMIN прямо розрізняють SEM для одного бала та SDC/MDC для зміни. COSMIN Reporting Guideline 2.0 рекомендує вказувати конкретну формулу SEM, SDC/MDC або limits of agreement, а не просто називати показник.


MDC не означає клінічно або особисто важливу зміну


Перевищення порога похибка вимірювання відповідає на запитання «чи є зміна більшою, ніж очікувана випадкова похибка?». Воно не відповідає на інше запитання: «чи має ця зміна значення для людини, клінічного рішення або її повсякденного функціонування?».


MDC/SDC і MIC/MID належать до різних рівнів інтерпретації. MDC/SDC походить із статистики похибки. MIC або MID намагається визначити мінімальну важливу зміну, зазвичай із зовнішнім anchor, який відображає значущість для пацієнта або іншого релевантного критерію. Terwee та співавтори показували, чому похибка вимірювання і мінімальну важливу зміну треба оцінювати окремо та зіставляти.


Так само індекс надійної зміни RCI використовує похибку для оцінювання того, чи перевищує індивідуальна зміна очікувані флуктуації. RCI не доводить клінічну значущість, не ставить діагноз і не замінює оцінювання контексту.


SEM і standard error of the mean — дві різні «SEM»


В англомовних текстах одна й та сама абревіатура SEM часто використовується для standard error of measurement і standard error of the mean. У психометрії це особливо небезпечно, бо обидві величини називають «standard error», але вони відповідають на різні запитання.


Standard error of measurement: наскільки невизначеним є індивідуальний тестовий бал через похибка вимірювання? Типова CTT-формула: SD × √(1 − надійність).


Standard error of the mean: наскільки невизначено оцінено середнє значення популяції за вибірковим середнім? Для незалежної простої вибірки базове наближення: SD / √n.


Зі збільшенням n стандартна похибка середнього зазвичай зменшується. Стандартна похибка вимірювання окремого тестового бала не зникає лише тому, що дослідник набрав велику вибірку. Велика вибірка може дати точнішу оцінку самої SEM, але не перетворює конкретний тестовий бал на вимірювання без похибки.


SEM, SD, reliability і validity: чотири різні речі


Стандартне відхилення SD описує розкид спостережуваних балів між людьми у вибірці. SEM описує величину похибка вимірювання окремого бала. Reliability описує частку або співвідношення варіації, що приписується відмінностям між об’єктами вимірювання, залежно від моделі. Validity стосується того, наскільки докази й теорія підтримують запропоноване тлумачення балів для конкретного використання.


Звідси випливає важливе обмеження: мала SEM не робить тест валідним. Можна дуже точно вимірювати не той конструкт. Можна отримати стабільний бал у культурно невідповідній версії шкали. Можна точно відтворювати систематичний упередження. Якість психологічного вимірювання вимагає узгодження точність, докази валідності, справедливість, norms, intended population та заплановане застосування.


Що відбувається біля cutoff або порогового бала


Порогове значення часто створює ілюзію різкої межі: 9 балів — одна категорія, 10 — інша. SEM показує, чому така межа не робить вимірювання дискретним. Якщо cutoff дорівнює 10, а людина має 10 при SEM = 2, її результат не відомий із точністю до одного пункту.


Саме поблизу cutoff умовна SEM особливо важлива. Standards for Educational and Psychological Testing рекомендують повідомляти похибку в околі порогів, коли ці пороги використовують для відбору або класифікації.


У психологічному скринінгу cutoff не є універсальною межею «розлад є / розладу немає». Інтерпретація залежить від population, prevalence/base rate, мети скринінгу, чутливість, специфічність, прогностичні значення, мови й валідності адаптації, а також від ширшого клінічного оцінювання. SEM додає інформацію про точність score, але не перетворює результат скринінгу на діагноз.


Що SEM не може сказати про діагноз


SEM не є діагностичним показником. Вона не визначає наявність психічного розладу, не оцінює чутливість або специфічність і не повідомляє probability of діагноз. Вона відповідає на локальніше запитання про точність бала за певної моделі вимірювання.


Навіть дуже мала SEM не виправдовує діагноз на підставі одного тесту. Психологічний бал може бути показник симптомів, показник риси, індикатор ризику, screening score, показник моніторингу або частиною комплексного assessment. Статус результату визначається заплановане застосування інструменту, доказами валідності і клінічним контекстом.


Ширше місце тестових балів у професійному процесі пояснює наша стаття «Психологічна оцінка й оцінювання: що це, як проходить і чим відрізняється від тестування».


SEM і перетворені бали: T-score, z-score, стандартні шкали


Якщо шкалу перетворюють лінійно, SEM перетворюється тим самим масштабним коефіцієнтом. Якщо Y = a + bX, тоді SEM_Y = |b| × SEM_X. Додавання константи не змінює ширину похибки; множення шкали змінює її пропорційно.


Наприклад, якщо z-score має SEM = 0,30 і його переводять у T-score за формулою T = 50 + 10z, то SEM на T-шкалі дорівнює 3 T-бали.


Percentile працює інакше. Перцентиль є нелінійним відображенням позиції в нормативному розподілі, тому однакова похибка у сирих або стандартних балах може перетворюватися на різну ширину у перцентилях у різних частинах розподілу. Percentile також не означає percent correct.


Умовна похибка в IRT: precision змінюється вздовж латентної шкали


У теорії відповіді на завдання (IRT) точність зазвичай моделюють як функцію рівня латентної ознаки θ. Тест може давати багато інформації в одному діапазоні θ і мало — в іншому. Тому замість одного глобального SEM отримують функцію стандартної похибки.


Для поширених IRT-оцінювань зв’язок між інформацією тесту I(θ) та стандартною похибкою має форму SE(θ) ≈ 1 / √I(θ): більше інформації означає меншу невизначеність. Огляд Reise про IRT пояснює зв’язок інформацією тесту та conditional standard error, а стандарти тестування вказують на IRT information functions як один зі способів оцінювати похибку на різних рівнях score.


Це важливо для комп’ютеризованого адаптивного тестування, коротких шкал і рішень біля конкретного діапазону. Загальний коефіцієнт надійності може виглядати прийнятним, але саме в зоні клінічного або освітнього cutoff точність може бути слабшою.


Популяція, мова і культурна адаптація: SEM не переноситься автоматично


SEM є властивістю результатів у конкретній вимірювальній конфігурації, а не вічною константою назви тесту. Вона залежить від форми інструменту, population, варіативності вибірки, процедури, способу scoring, джерел похибки й моделі надійність.


Тому SEM, отриману для англомовної версії тесту в одній країні, не слід автоматично переносити на український переклад. Переклад не дорівнює валідованій культурній адаптації. Потрібні дані щодо intended population та версії, яку реально використовують.


Так само інваріантність вимірювання і відсутність упередження не випливають із однакової або схожої SEM у групах. У Standards for Educational and Psychological Testing передбачено окрему увагу до можливих відмінностей умовна SEM та інформацією тесту між підгрупами. Якщо точність істотно відрізняється, це треба досліджувати й повідомляти.


Чому широка або вузька вибірка змінює картину


Класична формула SEM містить SD, а надійність теж залежить від співвідношення міжособової та дисперсії похибки. Тому одна й та сама методика може показувати різні коефіцієнти надійності і SEM у різних вибірках.


У вузькій за ознакою групі міжособова варіація може бути малою, що знижує коефіцієнт надійність навіть за подібної абсолютної похибки. У дуже різнорідній групі надійність може зрости завдяки більшому розкиду істинних відмінностей. Це ще одна причина не використовувати універсальні ярлики на кшталт «r > 0,80 — хороший тест» без заплановане застосування, population і наслідків рішення.


Що перевіряти в технічному паспорті тесту


Коли в керівництві або статті наведено SEM, насамперед перевірте: для якої версії й мови інструменту її оцінено; на якій population і вибірці; у яких одиницях подано результат; який вид надійність або модель дисперсії використано; які джерела варіації входили до похибки; чи йдеться про один загальна SEM або умовна SEM; чи є окремі оцінки поблизу cutoff; чи наведено невизначеність самої оцінки SEM; і чи відповідає цей дизайн вашому реальному використанню тесту.


Для повторних вимірювань важливі інтервал між сесіями, стабільність конструкта, однаковість умов, можливі ефекти пам’яті й тренування, зміни оцінювача або пристрою. Mokkink та співавтори 2023 детально показують, як кожне з цих джерел варіації змінює зміст надійність та похибка вимірювання.


Якщо технічний опис повідомляє лише alpha й називає його «точністю тесту», цього недостатньо, щоб автоматично отримати валідну оцінку невизначеність для будь-якої індивідуальної інтерпретації.


Типові помилки інтерпретації SEM


Перша помилка — плутати standard error of measurement зі standard error of the mean. Перша величина стосується точність індивідуального score, друга — точність оцінки середнього.


Друга помилка — вважати SEM постійною властивістю тесту. Вона залежить від population, шкали балів, способу оцінювання надійність і джерел варіації.


Третя помилка — підставляти Cronbach’s alpha в формулу без питання про схема повторного вимірювання. Внутрішня узгодженість, тест-ретест stability та міжоцінювальна agreement вимірюють різні аспекти.


Четверта помилка — трактувати один SEM як поріг «реальної зміни» між двома вимірюваннями. Для різниці двох scores потрібно враховувати error обох вимірювань; саме звідси виникають SDC/MDC або інші моделі невизначеності різниці балів.


П’ята помилка — прирівнювати MDC до MIC/MID. Detectable change описує перевищення похибка вимірювання; important change описує значущість зміни.


Шоста помилка — вважати, що вузький confidence band доводить validity. Precision і validity відповідають на різні питання.


Сьома помилка — використовувати SEM як доказ діагнозу або як універсальну поправку до cutoff. SEM не замінює чутливість, специфічність, прогностичні значення, клінічне оцінювання і докази валідності.


SEM і довжина тесту


Збільшення кількості якісних, релевантних і достатньо узгоджених завдань часто може підвищувати надійність та зменшувати SEM, але механічне додавання items цього не гарантує. Нові завдання можуть змінити construct coverage, dimensionality, burden і джерела похибки.


Класична формула Спірмена–Брауна описує, як за певних припущень змінюється надійність при зміні довжини тесту. Вона корисна для планування, але не доводить, що реальна нова форма після додавання завдань матиме саме прогнозовану точність. Нову версію потрібно перевіряти емпірично.


SEM у дослідженнях і звітах: мінімум, який варто повідомляти


У науковому звіті число SEM має бути відтворюваним. Потрібно назвати score, population, sample size, measurement occasions, interval, rater/device conditions, надійність або модель дисперсії, формулу SEM, одиниці результату та спосіб отримання confidence interval чи SDC/MDC, якщо їх використовують.


Якщо reporting зводиться до фрази «SEM була прийнятною», читач не бачить ані масштабу, ані критерію прийнятності. Для absolute похибка вимірювання число потрібно тлумачити в одиницях шкали й зіставляти з контексту рішення. У health outcome research COSMIN додатково пропонує зіставляти SDC/limits of agreement з MIC, коли MIC достовірно визначена.


Результат також бажано подавати з невизначеність самої оцінки, особливо в невеликій вибірці. SEM, надійність і variance components оцінюються з даних, тому самі не є відомими без похибки.


Практичний алгоритм для інтерпретації індивідуального бала


Спочатку визначте, що саме означає score і для якої population валідована його інтерпретація. Потім знайдіть докази надійності й точності, що відповідає вашому заплановане застосування. Далі перевірте SEM у тих самих одиницях, у яких повідомляється score, і з’ясуйте, чи вона глобальна або conditional.


Після цього інтерпретуйте score як оцінку з невизначеністю, а не як точну точку. Якщо порівнюєте два вимірювання, використовуйте показник невизначеність різниці — SDC/MDC, RCI або іншу модель, що відповідає дизайну. Якщо питання стосується значущості зміни для людини, потрібні MIC/MID або інші anchor-based дані, а не лише SEM.


Для клінічних висновків останнім кроком є інтеграція score з іншою інформацією. Окремий психометричний результат може підтримувати assessment, screening або monitoring, але його невизначеність не скасовується наявністю cutoff і не перетворює score на самодостатній діагноз.


Часті запитання


Чи є SEM те саме, що похибка конкретної людини?


Ні. SEM — це оцінка стандартного розкиду похибок вимірювання за заданої моделі, а не відома фактична помилка конкретного score. Для конкретної людини ми не знаємо, на скільки саме її отриманий бал відхилився від модельного істинний бал.


Чим менша SEM, тим кращий тест?


Менша SEM означає вищу точність у конкретній шкалі й population, але «кращий тест» вимагає більшого: докази валідності, відповідності меті, справедливість, норм, культурної адаптації, прийнятності та належного використання. Дуже precise measurement може бути невалідним для потрібного висновку.


Чи можна обчислити SEM лише з Cronbach’s alpha?


Математично можна підставити alpha в класичну формулу, якщо є SD. Але зміст отриманої SEM буде пов’язаний із тією моделлю error, яку представляє alpha. Це не робить її автоматично оцінкою тест-ретест, міжоцінювальна або паралельних форм невизначеність.


Якою має бути «хороша» SEM?


Універсального числового cutoff немає, бо SEM має одиниці конкретної шкали. Значення 3 бали може бути дуже малим на шкалі 0–300 і великим на шкалі 0–10. Її оцінюють відносно контексту рішення, типових відмінностей між балами, cutoff, SDC/MDC, MIC і наслідків помилки.


Чому SEM іноді різна для низьких і високих балів?


Тому що measurement точність може змінюватися вздовж шкали. У CTT це описують умовна SEM, а в IRT — функцію стандартної похибки, пов’язана з інформацією тесту. Одна глобальна SEM усереднює цю неоднорідність.


Чи достатньо ±1 SEM для 95% інтервалу?


Ні. За нормального наближення ±1 SEM відповідає приблизно 68-відсотковому інтервалу, а для приблизно 95% використовують близько ±1,96 SEM. Коректність такого інтервалу залежить від моделі й припущень.


Як пов’язані SEM і MDC?


SEM характеризує невизначеність одного score. MDC/SDC характеризує поріг зміни між двома scores, що перевищує очікувану похибка вимірювання за заданим рівнем певності. Для двох незалежних похибок з однаковою SEM часто використовують MDC95 ≈ 1,96 × √2 × SEM.


Чи означає зміна понад MDC, що людині стало клінічно краще?


Ні. Це означає, що зміна перевищила модельний поріг похибка вимірювання. Для важливості зміни потрібен окремий критерій, наприклад MIC/MID, і клінічний контекст.


Чи можна переносити SEM з іншої мовної версії тесту?


Не автоматично. Translation не дорівнює валідована культурна адаптація. Precision треба перевіряти для конкретної версії, population та заплановане застосування. Якщо умови, структура scale або надійність evidence відрізняються, чужа SEM може не описувати українську версію.


Чи може SEM бути нульовою?


Теоретично нульова SEM означала б відсутність випадкової похибка вимірювання в заданій моделі, тобто надійність = 1 за класичною формулою. Для реальних психологічних вимірювань така досконала точність практично не є реалістичним припущенням.


Пов’язані статті


Психологічна оцінка й оцінювання: що це, як проходить і чим відрізняється від тестування — про місце тестових балів у ширшому процесі професійного оцінювання.


Формула Спірмена–Брауна: надійність тесту, метод розщеплення та застосування — про прогнозовану зміну надійність при зміні довжини тесту та її припущення.



Джерела


American Educational Research Association, American Psychological Association, & National Council on Measurement in Education. (2014). Standards for Educational and Psychological Testing.


Harvill, L. M. (1991). Standard Error of Measurement. Educational Measurement: Issues and Practice, 10(2), 33–41.


Lek, K. M., & Van De Schoot, R. (2018). A Comparison of the Single, Conditional and Person-Specific Standard Error of Measurement: What do They Measure and When to Use Them?. Frontiers in Applied Mathematics and Statistics, 4, 40.


Mokkink, L. B., Boers, M., van der Vleuten, C. P. M., Bouter, L. M., Alonso, J., Patrick, D. L., de Vet, H. C. W., & Terwee, C. B. (2020). COSMIN Risk of Bias tool to assess the quality of studies on reliability or measurement error of outcome measurement instruments: a Delphi study. BMC Medical Research Methodology, 20, 293.


Mokkink, L. B., Eekhout, I., Boers, M., van der Vleuten, C. P. M., & de Vet, H. C. W. (2023). Studies on Reliability and Measurement Error of Measurements in Medicine – From Design to Statistics Explained for Medical Researchers. Patient Related Outcome Measures, 14, 193–212.


National Council on Measurement in Education. Glossary. Terms: standard error of measurement, conditional standard error of measurement, error of measurement, precision.


Reise, S. P. (2014). Item Response Theory. In The Wiley Blackwell Encyclopedia of Health, Illness, Behavior, and Society.


Terwee, C. B., Roorda, L. D., Knol, D. L., De Boer, M. R., & De Vet, H. C. W. (2009). Linking measurement error to minimal important change of patient-reported outcomes. Journal of Clinical Epidemiology, 62(10), 1062–1067.


Всеукраїнська психодіагностична асоціація. Стандартна похибка вимірювання. Глосарій.

 
 
bottom of page