top of page

Психологічна енкциклопедія

Теорія генералізованості (G-theory): як одночасно оцінюють кілька джерел похибки вимірювання

6 днів тому
Читати 17 хв

Український психологічний ХАБ · Опубліковано: 23 вересня 2026 року · Редакційна політика


Теорія генералізованості (Generalizability Theory, G-theory) — це психометрична теорія, яка дає змогу розкласти варіативність спостережуваних балів на кілька джерел і з’ясувати, наскільки висновок про людину, групу або інший об’єкт вимірювання переноситься на інші допустимі завдання, оцінювачів, моменти часу, форми, ситуації чи інші умови. На відміну від класичної теорії тестів, де похибка часто постає як один агрегований компонент, G-theory розглядає множинні фасети вимірювання та їхні взаємодії. Саме так її описує сучасний навчальний модуль National Council on Measurement in Education: теорія генералізованості розкладає похибку на кілька відмінних компонентів і пов’язує оцінювання надійності з тим, на які повторення процедури ми хочемо поширити висновок.


Це принципова зміна запитання. Замість «яка надійність цього тесту?» G-theory питає: «для якого саме висновку, за яких умов, щодо яких джерел варіативності й за якої кількості завдань, оцінювачів або вимірювальних нагод цей бал є достатньо узагальнюваним?» Така логіка безпосередньо узгоджується зі Standards for Educational and Psychological Testing: доказ надійності/точності має відповідати передбаченому використанню бала, а діапазон допустимих повторень процедури має бути явно визначений.


Коротко: що дає теорія генералізованості


  • дозволяє одночасно оцінити кілька джерел варіативності, наприклад осіб, завдання, оцінювачів і моменти вимірювання;

  • розділяє головні ефекти та взаємодії між джерелами варіативності, а не згортає все в один безіменний «шум»;

  • відрізняє G-дослідження, яке оцінює компоненти дисперсії, від D-дослідження, яке використовує ці компоненти для конкретного рішення або дизайну;

  • розрізняє відносні рішення, де важливе ранжування людей, і абсолютні рішення, де важливий сам рівень бала щодо критерію;

  • дає змогу моделювати, що станеться з точністю, якщо збільшити або зменшити кількість завдань, оцінювачів, сесій чи інших умов;

  • показує, що один коефіцієнт надійності не описує всі можливі джерела похибки й не є універсальною властивістю тесту.


Термінологія українською


У цій статті використано закріплену в архітектурі Українського психологічного ХАБу назву «теорія генералізованості». В українськомовному професійному просторі трапляється також назва «теорія узагальнюваності»; саме так термін подано, зокрема, в матеріалах Українського психометричного товариства. Обидві назви стосуються англійського Generalizability Theory. Скорочення G-theory широко використовується в міжнародній психометричній літературі.


Звідки виникла G-theory


Історично G-theory виросла з критики надто вузького трактування надійності. У 1963 році Лі Кронбах, Нагесварі Раджаратнам і Голдін Глезер опублікували статтю Theory of Generalizability: A Liberalization of Reliability Theory, у якій запропонували розглядати надійність як адекватність узагальнення від конкретного спостереження до ширшого універсуму можливих спостережень. Подальшу систему теорії було розгорнуто у праці Кронбаха, Глезер, Нанди й Раджаратнам 1972 року та фундаментальній монографії Robert L. Brennan, Generalizability Theory.


Сенс цієї історичної лінії важливий і сьогодні. Класична формула X = T + E корисна як базова модель, але літера E не пояснює, звідки саме походить невизначеність. Якщо психологічне оцінювання містить 20 завдань, трьох оцінювачів і два моменти часу, то помилка може бути пов’язана з вибором завдань, відмінностями між оцінювачами, часовою нестабільністю, взаємодією конкретної людини з конкретними завданнями, а також із поєднанням цих чинників. G-theory робить цю структуру видимою.


Чому одного коефіцієнта надійності часто недостатньо


Різні коефіцієнти надійності відповідають на різні запитання. Надійність психологічного тесту зосереджується на узгодженості показників усередині певної структури завдань; test-retest — на стабільності в часі; міжоцінювальна надійність — на узгодженості оцінювачів; надійність паралельних форм — на еквівалентності версій. Стандарти AERA/APA/NCME прямо застерігають, що коефіцієнти, які охоплюють різні види варіативності, не можна автоматично вважати взаємозамінними.


У G-theory ці окремі питання можна помістити в одну вимірювальну архітектуру. Наприклад, якщо результат залежить одночасно від завдань, оцінювачів і моментів часу, ми можемо оцінити внесок кожного джерела та їхніх взаємодій. Практичний огляд Vispoel, Morris і Kilinc показує, як ця логіка застосовується для проєктування, оцінювання й удосконалення психологічних вимірювань.


Об’єкт вимірювання, фасети та умови


Об’єкт вимірювання


Об’єкт вимірювання — це те, щодо чого ми хочемо робити висновок. У психологічному тестуванні ним найчастіше є людина, але ним може бути клас, команда, клінічний випадок, текст, поведінковий епізод, відеозапис, організація або інша одиниця, яку оцінюють. Варіативність між об’єктами за цільовою характеристикою є бажаним сигналом: саме її вимірювання має розрізняти.


Фасета


Фасета — це систематичний вимір умов спостереження, через який результат може змінюватися. Типові фасети: завдання, пункти шкали, оцінювачі, інтерв’юери, моменти або сесії вимірювання, форми тесту, станції практичного іспиту, стимули, лабораторні серії, контексти чи методи збору даних. Конкретний пункт, конкретний оцінювач або конкретна сесія є умовою фасети.


Важливе уточнення: слово «фасета» не означає автоматично «похибка». У G-дослідженні спочатку оцінюють компоненти варіативності. Те, які з них у конкретному D-дослідженні будуть віднесені до похибки, залежить від цільового висновку. Цю різницю добре демонструє приклад у літературі з G-theory: у D-дослідженні вирішують, які компоненти є релевантною похибкою для конкретного рішення.


Універсум допустимих спостережень і універсум узагальнення


Ключове поняття G-theory — універсум умов, до яких ми прагнемо узагальнювати. NCME прямо включає до базових понять «universe of admissible observations» та «universe of generalization». Ідея така: конкретний бал отримано на конкретній вибірці завдань, у конкретний день і, можливо, конкретним оцінювачем, але інтерпретація часто стосується ширшого класу умов.


Якщо ми стверджуємо, що людина має певний рівень навички незалежно від того, які з допустимих завдань їй трапилися, завдання мають бути частиною універсуму узагальнення. Якщо ми стверджуємо, що результат не повинен залежати від того, хто з кваліфікованих оцінювачів виставляє бал, оцінювачі теж входять до цього універсуму. Якщо висновок стосується стабільної характеристики впродовж певного проміжку часу, важливо визначити, які моменти вимірювання вважаються допустимими повтореннями.


Саме тому Standard 2.1 у Standards for Educational and Psychological Testing вимагає чітко вказувати діапазон повторень, на якому оцінюють надійність/точність, і обґрунтовувати цей вибір. Без цього фраза «надійність = 0,85» залишається неповною.


Випадкові та фіксовані фасети


Фасета є випадковою в тому сенсі, що її спостережені умови розглядають як вибірку з ширшого набору умов, на які планують узагальнення. Наприклад, 15 завдань можуть бути вибіркою з великого домену допустимих завдань. Тоді нас цікавить не лише саме ці 15 пунктів, а те, наскільки висновок зберігатиметься для інших допустимих пунктів.


Фіксована фасета означає, що висновок обмежено визначеними умовами або рівнями, а не поширюють на невизначено ширший набір. У D-дослідженні рішення про те, чи розглядати фасету як фіксовану або випадкову, змінює те, які компоненти входять до цільової дисперсії та похибки. Тому статус фасети задається змістом інференції, а не лише механікою статистичної програми.


У навчальному модулі NCME окремо розглядається вплив фіксованої фасети в D-дослідженні. Практичний висновок: не можна оголосити фасету «фіксованою» лише тому, що так виходить кращий коефіцієнт. Її статус має відповідати тому, до чого реально планується узагальнювати результати.


Перехресні та вкладені дизайни


У перехресному (crossed) дизайні кожен рівень однієї фасети поєднується з кожним рівнем іншої. Наприклад, якщо кожного учасника оцінюють усі три оцінювачі за всіма 10 завданнями, особи, оцінювачі й завдання повністю перехрещені. Такий дизайн дозволяє окремо оцінювати більше взаємодій.


У вкладеному (nested) дизайні умови однієї фасети належать лише певним умовам іншої. Наприклад, якщо кожного учасника оцінює власна пара оцінювачів, оцінювачі вкладені в осіб. Деякі компоненти тоді стають конфундованими й не можуть бути розділені так само чисто, як у повністю перехресному дизайні.


Різниця між crossed і nested дизайнами є одним із базових елементів сучасного навчання G-theory в NCME. Вона має плануватися до збору даних: після завершення дослідження неможливо статистично відновити компоненти, які дизайн не дав можливості розрізнити.


Як G-theory розкладає дисперсію


Розглянемо повністю перехресний дизайн p × i × r, де p — особа, i — завдання, r — оцінювач. Спостережуваний бал можна концептуально подати як: Ypir = μ + p + i + r + pi + pr + ir + pir,e. Тут μ — загальне середнє, p — відмінності між особами, i — систематичні відмінності між завданнями, r — систематичні відмінності між оцінювачами, pi, pr та ir — двосторонні взаємодії, а pir,e — трьохстороння взаємодія, конфундована з залишковою похибкою, якщо немає додаткових повторів.


Для кожного компонента оцінюється дисперсія. Велика дисперсія осіб може означати, що люди справді суттєво відрізняються за вимірюваною характеристикою. Велика дисперсія завдань означає, що деякі завдання систематично легші, складніші або породжують вищі бали. Велика дисперсія оцінювачів означає, що частина оцінювачів систематично суворіша або поблажливіша. Велика взаємодія особа × завдання означає, що відносний успіх людини залежить від конкретного завдання; особа × оцінювач — що різні оцінювачі по-різному ранжують конкретних людей.


Саме компоненти дисперсії є робочим ядром G-theory. Brennan систематизує теорію через одно- та багатофасетні G- і D-дизайни, а сучасні застосування показують, що цей підхід природно масштабується від опитувальників до спостережень, оцінювання виконання й психофізіологічних вимірювань.


G-дослідження: карта джерел варіативності


G-study, або дослідження генералізованості, має на меті оцінити компоненти дисперсії в запланованому дизайні. На цьому етапі дослідник визначає об’єкт вимірювання, релевантні фасети, структуру перехрещення чи вкладення, універсум допустимих умов і збирає дані так, щоб потрібні джерела варіативності можна було відокремити.


У сучасному модулі NCME до завдань G-study віднесено визначення дизайну, інтерпретацію компонентів дисперсії, головних ефектів, взаємодій і конфундування. Це важливо, бо G-study не зводиться до отримання одного коефіцієнта. Його головний продукт — карта того, звідки береться варіативність.


Наприклад, якщо в оцінюванні клінічного інтерв’ю 55% дисперсії припадає на відмінності між людьми, 2% — на середню суворість оцінювачів, 8% — на середню різницю між питаннями, 12% — на взаємодію особа × оцінювач, 15% — на особа × питання, а решта — на інші взаємодії та залишок, висновок має бути змістовним: проблема може полягати не у «поганій надійності взагалі», а, наприклад, у тому, що окремі люди оцінюються різними оцінювачами неоднаково.


Цифри в цьому прикладі умовні. У реальному дослідженні їх не можна переносити на інший тест, популяцію чи дизайн. Компоненти дисперсії — емпіричні характеристики конкретної процедури та конкретно визначеного універсуму узагальнення.


D-дослідження: що станеться, якщо змінити дизайн


D-study, або decision study, використовує оцінені в G-study компоненти дисперсії для конкретної майбутньої процедури вимірювання. Воно відповідає на практичні запитання: що буде, якщо замість одного оцінювача використати двох? Якщо збільшити кількість завдань із 10 до 20? Якщо усереднювати три сесії замість однієї? Чи дасть додатковий оцінювач більше виграшу, ніж додаткові завдання?


У практичному огляді психологічного оцінювання G-theory використовується саме для проєктування та оптимізації вимірювальних процедур. У клініко-психологічному прикладі Lakes і Hoyt аналіз із фасетами оцінювачів, завдань і нагод демонструє, як D-study допомагає планувати майбутній дизайн, а не лише ретроспективно описувати коефіцієнт.


Коли бал є середнім за кількома умовами фасети, внесок відповідної випадкової компоненти похибки зазвичай зменшується зі збільшенням числа незалежних або належно змодельованих умов. Тому D-study може показати, чи ефективніше додати завдання, оцінювачів або сесій. Це інструмент проєктування точності, а не механічне правило «чим більше, тим краще»: додаткові вимірювання мають витрати, а найбільший виграш дає збільшення саме того джерела, яке істотно впливає на похибку.


G-study і D-study не обов’язково означають два окремі набори даних. У прикладних роботах це часто дві аналітичні фази: спочатку оцінюють компоненти дисперсії, потім на їхній основі розраховують параметри для заданих сценаріїв використання.


Відносні та абсолютні рішення


Відносне рішення


Відносне рішення стосується ранжування: хто має вищий бал, хто нижчий, як зберігається відносне положення осіб. Якщо всі оцінювачі одночасно додають приблизно однакову кількість балів усім людям, середня суворість оцінювача може змінити абсолютний рівень балів, але майже не змінити порядок людей. Для відносних висновків така систематична компонента може не входити до відносної похибки.


Коефіцієнт генералізованості для відносних рішень часто позначають Eρ². У спрощеній формі: Eρ² = σ²(p) / [σ²(p) + σ²(δ)], де σ²(p) — дисперсія універсумних балів об’єктів, а σ²(δ) — відносна похибка для заданого D-дизайну.


Абсолютне рішення


Абсолютне рішення стосується самого рівня бала: чи перевищено поріг, чи відповідає результат стандарту, наскільки далеко бал від заданого критерію. Тут систематична суворість оцінювача або систематична складність набору завдань уже може змінити висновок. Тому до абсолютної похибки входить більше компонентів.


Індекс абсолютної залежності, або dependability coefficient, часто позначають Φ: Φ = σ²(p) / [σ²(p) + σ²(Δ)], де σ²(Δ) — абсолютна похибка. Через ширше визначення похибки Φ для того самого дизайну зазвичай не перевищує відповідний відносний коефіцієнт, хоча конкретне співвідношення залежить від компонентів дисперсії.


У NCME відносні й абсолютні похибки та два reliability-like коефіцієнти виділені як окремі базові поняття G-theory. Це означає, що перед інтерпретацією коефіцієнта треба знати, яке рішення моделювалося.


Приклад: психологічна оцінка з пунктами, оцінювачами й часом


Уявімо шкалу поведінкової саморегуляції. Кожну дитину оцінюють за 12 пунктами два незалежні спостерігачі в три різні дні. Об’єкт вимірювання — дитина. Фасети — пункти, оцінювачі й моменти часу. Якщо дизайн повністю перехресний, для кожної дитини є оцінки кожного пункту кожним оцінювачем у кожен день.


G-study може показати, наприклад, що головний ефект оцінювача малий, але взаємодія дитина × оцінювач велика. Це означає: оцінювачі не просто систематично суворіші або м’якші; вони відрізняються саме в тому, як оцінюють окремих дітей. Заміна одного оцінювача іншим тоді здатна змінити відносне положення конкретної дитини.


Якщо велика компонента дитина × день, частина поведінкової варіативності може бути ситуаційною або часовою. Це вже змістовне питання: чи ми хочемо вимірювати стабільну рису, середній рівень поведінки за період або стан у конкретний день? G-theory не вирішує це теоретичне питання за дослідника, але показує, де саме воно проявляється в даних.


У D-study можна порівняти сценарії: 12 пунктів × 2 оцінювачі × 1 день; 12 × 1 × 3; 20 × 1 × 2 тощо. Оптимальний дизайн залежить від того, які компоненти дисперсії найбільші, яке рішення потрібно прийняти та скільки ресурсів доступно.


G-theory і стандартна похибка вимірювання


Коефіцієнт надійності й стандартна похибка вимірювання (SEM) відповідають на різні, хоча пов’язані запитання. Коефіцієнт описує частку релевантної дисперсії між об’єктами відносно загальної дисперсії з урахуванням визначеної похибки. SEM переводить невизначеність у одиниці шкали.


У G-theory можна отримувати стандартні похибки, пов’язані з відносним або абсолютним визначенням похибки, для конкретного D-дизайну. Це особливо корисно, коли треба оцінити невизначеність індивідуального результату після усереднення кількох завдань, оцінювачів або сесій. Але SEM у G-theory, як і в інших психометричних моделях, не є standard error of the mean. Вони мають різні об’єкти й різний зміст.


Так само похибка вимірювання не є синонімом «реальної зміни». Різниця між двома балами може складатися з реальної зміни, похибки та умовної варіативності. Щоб говорити про виявлювану зміну, потрібна окрема модель зміни й відповідний показник, а не лише високий G-коефіцієнт.


G-theory, ICC, test-retest і внутрішня узгодженість


G-theory і ICC


Внутрішньокласовий коефіцієнт кореляції ICC — це сімейство коефіцієнтів для кількісних вимірювань із конкретними моделями оцінювачів або повторів. Історично та математично ICC і G-theory мають спорідненість: обидва працюють із компонентами дисперсії, а ранні формулювання generalizability прямо пов’язували коефіцієнт із intraclass correlation. Проте ICC не є автоматичним синонімом G-theory. Типовий ICC аналізує обмеженішу структуру, тоді як G-theory дозволяє одночасно задавати кілька фасет, їхні взаємодії, універсум узагальнення та окремі D-сценарії.


G-theory і test-retest


Test-retest надійність запитує, наскільки результати відтворюються в часі за визначеного інтервалу. У G-theory «час» або «нагода» може бути однією з фасет поруч із завданнями та оцінювачами. Це дає змогу побачити не лише загальну часову стабільність, а й, наприклад, взаємодію особа × час: чи одні люди змінюються між сесіями більше за інших.


G-theory і внутрішня узгодженість


Надійність психологічного тесту описує структуру відповідей у межах набору пунктів і не замінює оцінку інших джерел варіативності. Високий Cronbach’s alpha не показує, чи стабільний результат між днями, оцінювачами або контекстами. G-theory може включити пункти як одну з фасет, але її мета ширша: визначити, на які умови можна обґрунтовано поширювати висновок.


Це відповідає Standard 2.6: показники, що адресують різні типи варіативності, не слід трактувати як взаємозамінні, якщо їхні визначення похибки не еквівалентні.


G-theory і валідність


Надійність або генералізованість не дорівнює валідності. Дуже стабільний і добре генералізований бал може систематично вимірювати не той конструкт, який заявлено, пропускати важливу частину конструкта або містити стабільне зміщення. G-theory відповідає передусім на питання про точність та переносимість вимірювання через визначені умови, а не доводить правильність змістової інтерпретації.


У Standards for Educational and Psychological Testing валідність і reliability/precision розглядаються як різні, взаємопов’язані основи оцінювання. Отже, високі Eρ² або Φ можуть підтримувати певний аспект технічної якості, але не перетворюють тест на «валідний взагалі».


Так само G-theory не встановлює клінічний діагноз. Якщо психометричний інструмент використовується для скринінгу, високий коефіцієнт генералізованості не замінює доказів діагностичної валідності, чутливості, специфічності, позитивної та негативної прогностичної цінності, базової поширеності стану, клінічного контексту й повноцінного професійного оцінювання.


Справедливість, культурна адаптація і групові відмінності


G-theory може допомогти побачити, чи змінюється точність вимірювання між умовами, оцінювачами або підгрупами, але сама по собі не доводить справедливість тесту. Якщо до дизайну введено групу або мову як фактор і виявлено взаємодію група × пункт чи група × оцінювач, це сигнал для подальшого дослідження причин, а не автоматичний доказ bias або дискримінації.


Для тверджень про еквівалентність вимірювання між групами потрібні методи, що відповідають цьому запитанню: measurement invariance, DIF, аналіз змісту, процедури адаптації, перевірка норм і валідності для цільової популяції. Відсутність великої компоненти дисперсії в G-study не гарантує відсутності систематичного зміщення, яке може бути стабільним і тому погано проявлятися як випадкова похибка.


У клінічному та outcome-вимірюванні корисно також пам’ятати про рамку COSMIN, де якість інструмента оцінюють через окремі властивості вимірювання, а вибір методу залежить від конкретної властивості та цільового використання. G-theory може бути частиною доказів щодо надійності/похибки, але не замінює повний пакет доказів.


Наявність перекладу українською не є доказом валідованої української адаптації. G-theory не скасовує потреби в мовній і культурній адаптації, перевірці конструкта, відповідних нормах та дослідженні функціонування пунктів у цільовій популяції.


Сучасні застосування


У 2026 році Rocha, Holbrook, Hajcak і Keil показали застосування G-theory до психофізіологічних вимірювань, де джерелами варіативності можуть бути випробування, завдання й сесії. Їхній огляд підкреслює головну перевагу підходу: традиційні одночислові показники часто не відображають багатофасетну структуру даних.


У клінічній дитячій і підлітковій психології Lakes і Hoyt демонстрували дво- та трифасетні аналізи з оцінювачами, пунктами й нагодами, щоб зрозуміти, як ці джерела впливають на надійність балів і як проєктувати майбутні дослідження.


У психологічному оцінюванні Vispoel та співавтори використовують G-theory як практичний міст між аналізом надійності та дизайном процедури. Теорія особливо цінна там, де результат формується кількома умовами одночасно: експертні рейтинги, структуровані інтерв’ю, поведінкове кодування, performance-based assessment, повторні біоповедінкові вимірювання, багатосесійні експерименти й багатокомпонентні шкали.


Чому не існує універсального «достатнього» G-коефіцієнта


У прикладній літературі часто трапляються орієнтири на кшталт 0,70 або 0,80. Їх не слід перетворювати на універсальні природні межі якості. Прийнятний рівень точності залежить від наслідків рішення, популяції, дизайну, призначення бала, можливості підтвердження іншими даними та того, чи рішення є зворотним.


Це особливо чітко сформульовано у Standards for Educational and Psychological Testing: вища точність потрібна для використань із серйознішими наслідками, тоді як нижчий рівень може бути прийнятним для зворотних рішень або тих, що підтверджуються іншими джерелами. Стандарти також наголошують, що не існує одного індексу, який передає всю релевантну інформацію про reliability/precision.


Тому висновок «G = 0,82, отже тест надійний» є неповним. Потрібно вказати дизайн, фасети, розмір кожної фасети, популяцію, тип рішення, спосіб оцінювання компонентів дисперсії, довірчу невизначеність або стандартні помилки там, де вони доступні, і межі узагальнення.


Як читати результати G-study


  • Спочатку знайдіть об’єкт вимірювання. Якщо це люди, дисперсія p зазвичай відображає міжособові відмінності в універсумних балах.

  • Перевірте перелік фасет: пункти, оцінювачі, нагоди, завдання, станції, методи або інші умови.

  • З’ясуйте, чи дизайн перехресний, вкладений або змішаний. Від цього залежить, які компоненти реально ідентифікуються.

  • Подивіться на головні ефекти фасет. Великий ефект оцінювача означає систематичну різницю суворості; великий ефект завдання — систематичну різницю між завданнями.

  • Подивіться на взаємодії з об’єктом вимірювання. Саме вони часто є критичними для відносної надійності, бо можуть змінювати ранжування людей.

  • Не називайте кожну нефокусну компоненту «помилкою» до того, як визначено D-study і тип рішення.

  • Перевірте залишковий компонент. У багатьох дизайнах він поєднує найвищу взаємодію та невідокремлену випадкову похибку.

  • Оцініть, чи вибірка осіб і умов достатньо репрезентує той універсум, до якого автори роблять висновок.


Як читати D-study


  • Перевірте, яке рішення моделюють: відносне чи абсолютне.

  • Подивіться, скільки умов кожної фасети закладено у сценарій: наприклад, 20 завдань, 2 оцінювачі, 3 сесії.

  • Порівнюйте сценарії не лише за коефіцієнтом, а й за ресурсною вартістю та клінічною або дослідницькою доцільністю.

  • Переконайтеся, що сценарій D-study залишається в межах реалістичного універсуму, який підтримує G-study.

  • Якщо автори змінюють статус фасети на fixed, перевірте змістове обґрунтування цього рішення.

  • Не переносіть оптимальний дизайн з однієї популяції або процедури на іншу без нових даних.


Типові помилки інтерпретації


1. «G-theory просто дає кращий alpha»


G-theory не є заміною одного коефіцієнта іншим. Її головна перевага — модель множинних джерел варіативності та зв’язок надійності з чітко визначеним універсумом і рішенням.


2. «Усе, крім дисперсії осіб, є помилкою»


Для абсолютних і відносних рішень склад похибки різний. Систематичний ефект завдань або оцінювачів може бути нейтральним для ранжування й критичним для абсолютного порогу.


3. «Якщо коефіцієнт високий, тест валідний»


Висока генералізованість підтримує точність певної інтерпретації за певних умов, але не доводить, що вимірюється заявлений конструкт, що норми коректні або що рішення клінічно корисне.


4. «D-study доводить, що майбутній дизайн точно матиме такий самий коефіцієнт»


D-study є проєкцією на основі компонентів, оцінених у конкретних даних. Якщо майбутня популяція, завдання, оцінювачі, умови або дисперсії відрізняються, реальна точність також може відрізнятися.


5. «Великий ефект групи автоматично означає bias»


Групова відмінність або взаємодія потребує змістового і психометричного дослідження. Bias, DIF, measurement invariance і fairness — пов’язані, але не тотожні питання.


6. «Негативна оцінка компоненти дисперсії означає негативну реальну дисперсію»


Справжня дисперсія не може бути від’ємною, але вибіркові методи оцінювання іноді породжують негативні оцінки компонентів, особливо за малих вибірок або слабко ідентифікованих дизайнів. Рішення про обмеження нулем, альтернативний метод оцінювання або перегляд моделі має бути явно описане, а не приховане.


7. «Більше фасет завжди краще»


Кожна додаткова фасета вимагає дизайну, який дозволяє оцінити її внесок. Надто складний дизайн із малою кількістю спостережень може давати нестабільні компоненти дисперсії й погано ідентифіковані взаємодії. Теоретично важлива структура має бути збалансована з реальними даними.


Обмеження G-theory


G-theory потужна настільки, наскільки обґрунтовано задано дизайн. Якщо важливе джерело варіативності не вимірювали або воно конфундоване з іншим, теорія не може магічно відокремити його після збору даних. Наприклад, якщо кожного учасника завжди оцінює лише один унікальний оцінювач, ефект оцінювача може бути нерозрізним із частиною міжособових відмінностей.


Компоненти дисперсії залежать від популяції та умов. У більш однорідній вибірці дисперсія об’єктів може бути малою, і коефіцієнт зменшиться навіть за подібної абсолютної похибки. Тому коефіцієнти між різними вибірками не можна порівнювати без урахування відмінностей у розподілі цільової характеристики.


Класичні ANOVA-оцінки компонентів добре працюють у простих збалансованих дизайнах, але складні, незбалансовані, ієрархічні та пропущені дані часто потребують моделей випадкових ефектів, REML, ML або інших сучасних підходів. Вибір способу оцінювання має бути описаний, а припущення — перевірені настільки, наскільки це дозволяє модель.


G-theory також не виправляє систематичну помилку конструкта. Якщо всі оцінювачі навчені однаково хибно, якщо тест систематично недопредставляє конструкт або якщо шкала має культурно невідповідний зміст, показники можуть бути дуже стабільними. Стабільність помилки не робить її валідним вимірюванням.


Практичний алгоритм для дослідника


  • Сформулюйте, що саме є об’єктом вимірювання і який висновок має підтримувати бал.

  • Визначте допустимі повторення процедури: які завдання, оцінювачі, нагоди, форми та контексти мають вважатися взаємозамінними або такими, на які поширюється висновок.

  • Виберіть фасети, що можуть створювати релевантну варіативність, і вирішіть, які з них мають бути випадковими або фіксованими для майбутнього D-study.

  • Спроєктуйте crossed, nested або mixed структуру так, щоб ключові компоненти були ідентифіковані.

  • Проведіть G-study та оцініть компоненти дисперсії, їхню невизначеність і конфундування.

  • Визначте, чи майбутнє рішення відносне, абсолютне або потребує обох поглядів.

  • Проведіть D-study для реалістичних сценаріїв кількості завдань, оцінювачів, сесій та інших умов.

  • Оберіть дизайн за балансом точності, ресурсів, етики й практичної доцільності, а не за максимальним коефіцієнтом будь-якою ціною.

  • Документуйте популяцію, процедуру, джерела похибки, модель і межі узагальнення так, щоб інший дослідник міг зрозуміти, що саме означає отриманий коефіцієнт.


Коли G-theory особливо корисна


G-theory найбільш інформативна, коли результат формується кількома повторюваними умовами і дослідник справді хоче узагальнювати через них. Типові ситуації: кілька оцінювачів; кілька завдань або станцій; повторні сесії; складні поведінкові спостереження; експертне кодування; рейтинги в різних контекстах; багатосерійні психофізіологічні дані; оцінювання виконання, де об’єкт, завдання й оцінювач взаємодіють.


Якщо є лише одне просте джерело повторення й чітко визначений коефіцієнт, складний G-дизайн може бути зайвим. Метод має відповідати запитанню, а не навпаки. G-theory цінна не своєю складністю, а здатністю зробити явним те, що простіший коефіцієнт приховує.


Що G-theory означає для практичного психологічного тестування


Для практичного користувача головний урок G-theory полягає не в обов’язковому самостійному обчисленні компонентів дисперсії. Він у правильній інтерпретації технічної документації. Коли тест повідомляє «надійність», варто питати: яка саме? За яким джерелом повторення? На які умови поширюється висновок? Чи досліджували оцінювачів, час, альтернативні форми або лише внутрішню узгодженість?


Для індивідуального рішення важливо знати не лише відносну стабільність ранжування, а й абсолютну невизначеність бала. Якщо результат використовується біля cutoff, навіть невелика зміна умов може змінити категоризацію. Жодний cutoff не має трактуватися як універсальна межа «розлад є / розладу немає» без ширшого клінічного оцінювання й доказів, релевантних саме цьому використанню.


Для дослідника G-theory нагадує: вимірювання є частиною дизайну дослідження. Якщо основний outcome залежить від оцінювачів, завдань і часу, ці джерела варіативності впливають не лише на «психометрику», а й на оцінки ефектів, статистичну потужність і відтворюваність висновків.


Науковий статус теорії генералізованості


G-theory є усталеною психометричною теорією з більш ніж шістдесятирічною історією, фундаментальною монографічною традицією та сучасними застосуваннями. Її базові поняття входять у професійне навчання NCME, а Standards for Educational and Psychological Testing прямо використовують категорію reliability/generalizability coefficients і вимагають пов’язувати показники точності з визначенням похибки та передбаченим використанням бала.


Сучасна роль G-theory не обмежується освітнім тестуванням. Нові роботи застосовують її до психологічних рейтингів, клінічних спостережень і психофізіології. Огляд 2026 року показує її актуальність саме в тих даних, де прості показники надійності не здатні розкласти багаторівневі джерела варіативності.


FAQ


Що таке теорія генералізованості простими словами?


Це спосіб з’ясувати, скільки різних джерел впливають на тестовий або оцінювальний бал і наскільки результат залишатиметься придатним, якщо змінити допустимі завдання, оцінювачів, моменти часу чи інші умови. Замість одного загального «error» G-theory будує карту компонентів варіативності.


Чим G-theory відрізняється від класичної теорії тестів?


CTT зазвичай представляє спостережуваний бал як істинний бал плюс сукупну похибку. G-theory розширює цю логіку, розкладаючи варіативність на кілька фасет та їхні взаємодії, а потім формує визначення похибки відповідно до конкретного рішення.


Що таке G-study?


G-study оцінює компоненти дисперсії для об’єкта вимірювання, фасет та їхніх взаємодій. Його завдання — описати структуру варіативності в заданому універсумі умов.


Що таке D-study?


D-study використовує компоненти з G-study для прогнозування точності конкретної процедури: наприклад, для 10 чи 20 завдань, одного чи трьох оцінювачів, однієї чи кількох сесій. Він пов’язує психометричну модель із рішенням і ресурсами.


Чим G-коефіцієнт відрізняється від Φ?


Eρ² зазвичай описує точність відносних рішень — збереження відносного положення об’єктів. Φ описує абсолютні рішення, де важливий рівень бала щодо критерію; до абсолютної похибки входять додаткові систематичні компоненти фасет.


Чи означає G = 0,80, що тест достатньо надійний?


Сам по собі поріг 0,80 не є універсальним правилом. Достатність залежить від призначення бала, наслідків помилки, популяції, типу рішення, моделі та доступності підтверджувальної інформації. Коефіцієнт треба читати разом із дизайном і визначенням похибки.


Чи може G-theory визначити оптимальну кількість оцінювачів або завдань?


D-study може оцінити очікувану точність для різної кількості умов і допомогти знайти ефективний дизайн. Це проєкція на основі поточних компонентів дисперсії, тому її треба перевіряти при суттєвій зміні популяції або процедури.


Чи доводить G-theory відсутність bias?


Ні. Вона може показати, де виникає варіативність або взаємодії, але fairness, DIF, measurement invariance, культурна адаптація й систематичне зміщення потребують окремих доказів і методів.


Чи може G-theory замінити валідизацію тесту?


Ні. Вона є потужною рамкою для надійності, точності й джерел похибки. Валідність стосується доказів, що підтримують конкретну інтерпретацію й використання балів, і потребує ширшого комплексу аргументів.


Пов’язані статті








Джерела





Cronbach, L. J., Gleser, G. C., Nanda, H., & Rajaratnam, N. (1972). The Dependability of Behavioral Measurements: Theory of Generalizability for Scores and Profiles. Wiley.





 
 
bottom of page