top of page

Психологічна енкциклопедія

Розмір вибірки: від чого залежить потрібна кількість учасників і чому «чим більше, тим краще» не є повною відповіддю

23 вер.
Читати 17 хв

Автор: Український психологічний ХАБ · Опубліковано: 23 вересня 2026 · Редакційна політика


Розмір вибірки (також обсяг вибірки; англ. sample size) — це кількість незалежних одиниць спостереження, на яких ґрунтується певний статистичний висновок. У психологічному дослідженні такими одиницями часто є люди, але ними можуть бути пари, сім’ї, класи, команди, клініки або інші кластери. Тому запитання «скільки учасників потрібно?» має сенс лише після уточнення, що саме досліджують, яким дизайном, яким методом аналізу і яку невизначеність готові прийняти. Lakens (2022) розглядає обґрунтування розміру вибірки саме як частину логіки дослідження: потрібна кількість даних випливає з того, яку інформацію має дати дослідження.


Для одного й того самого тематичного питання можуть бути потрібні радикально різні n. Порівняння двох груп із великим очікуваним ефектом, оцінювання дуже малої різниці, кореляційний аналіз, факторна модель, перевірка інваріантності, дослідження надійності або популяційне опитування мають різні вимоги. Тому універсальні правила на кшталт «достатньо 30», «потрібно 100» або «по 10 людей на кожен пункт тесту» не є загальними законами статистики.


У сучасній методології розмір вибірки планують щонайменше за двома великими логіками: через здатність виявити ефект заданої величини та через бажану точність оцінки. Огляд Maxwell, Kelley і Rausch (2008) підкреслює, що планування лише за статистичною потужністю не вичерпує задачу: інколи дослідницька мета краще формулюється як отримання достатньо вузького довірчого інтервалу навколо параметра.


Українська фахова термінологія використовує обидва словосполучення — «розмір вибірки» й «обсяг вибірки». У вітчизняній психологічній літературі зв’язок обсягу вибірки зі статистичною потужністю, рівнем α та очікуваним розміром ефекту описують, зокрема, Олефір і Боснюк (2021). На цій сторінці основним терміном є «розмір вибірки», а «обсяг вибірки» використовується як синонім.


Коротка відповідь: скільки учасників потрібно


Єдиного числа немає. Потрібний розмір вибірки визначається дослідницькою метою, статистичною моделлю, найменшим ефектом або точністю, які мають значення, допустимими помилками, варіативністю даних, якістю вимірювання, залежністю спостережень, часткою вибування, кількістю ключових аналізів та структурою популяції.


Якщо мета — перевірити гіпотезу, доцільним є апріорний аналіз потужності: до збору даних задають модель, α, бажану потужність і ефект, який дослідження має бути здатним виявити. Якщо мета — оцінити параметр, наприклад середню різницю або кореляцію, часто змістовніше планувати n за бажаною шириною довірчого інтервалу. Для складних моделей — CFA, SEM, IRT, багаторівневих моделей — нерідко потрібне моделювання або Monte Carlo, бо проста формула не охоплює всіх умов.


Отже, коректна відповідь має форму не «нам потрібно 200 людей», а «за такого дизайну, такої мінімально важливої величини ефекту, такого α, такої потужності, такої очікуваної варіативності та такого рівня вибування нам потрібно щонайменше n учасників для головного аналізу».


Що саме означає n: учасники, спостереження й одиниця аналізу


Позначення n зазвичай використовують для розміру вибірки, але кількість рядків у наборі даних і кількість незалежних учасників — не одне й те саме. Якщо 100 людей відповіли на 50 запитань, це не створює n = 5000 незалежних людей. Якщо 60 учасників пройшли тест чотири рази, маємо 240 вимірювань, але залежність повторних вимірювань потрібно врахувати в моделі.


Так само 600 школярів із 10 класів не еквівалентні 600 незалежно відібраним школярам, якщо учні всередині класу схожі між собою. У кластерних дизайнах ефективний обсяг інформації менший за просту кількість людей. CONSORT для кластерних рандомізованих досліджень прямо вимагає враховувати внутрішньокластерну кореляцію та кількість кластерів під час планування.


Тому першим кроком є визначення одиниці аналізу. Нею може бути людина, пара «учасник—партнер», клас, лікарня, повторне спостереження, item-відповідь або інша статистична одиниця. Метод розрахунку n має відповідати цій структурі, інакше велике число в таблиці створює лише ілюзію великої незалежної вибірки.


Від чого залежить потрібний розмір вибірки


1. Від дослідницького питання і цільового параметра


Спочатку потрібно визначити, що саме має оцінити дослідження. Середня різниця між двома групами, кореляція, коефіцієнт регресії, частка випадків, чутливість скринінгу, ICC, факторне навантаження, параметр IRT або різниця між підгрупами — це різні estimands і різні статистичні задачі. Розмір вибірки не існує окремо від параметра, для якого потрібна достатня інформація.


Якщо в дослідженні є кілька первинних питань, n слід обґрунтовувати щодо тих аналізів, від яких залежать головні висновки. Lakens (2022) наголошує, що обґрунтування повинно бути пов’язане з інференційною метою, а не з ритуальним застосуванням одного стандартного числа.


2. Від найменшого ефекту, який справді важливо виявити


Чим менший ефект потрібно надійно розрізнити від статистичного шуму, тим більшою за інших рівних умов має бути вибірка. Саме тому фраза «очікуємо середній ефект» слабша за чітке предметне обґрунтування: який найменший ефект був би теоретично, практично або клінічно значущим для цього питання? У методологічній літературі це часто називають smallest effect size of interest, SESOI.


Планування на завищеному ефекті дає занадто малий n. Особливо ризиковано брати ефект із одного малого пілотного дослідження як точне майбутнє значення. Пілотні оцінки самі мають велику вибіркову невизначеність. Краще використовувати сукупність попередніх досліджень, теоретичну мінімально важливу різницю, метааналітичні оцінки та аналіз чутливості для кількох правдоподібних сценаріїв.


3. Від рівня α і бажаної статистичної потужності


Для класичного тестування гіпотез потужність — це ймовірність за заданої альтернативи отримати результат, який відхиляє нульову гіпотезу за наперед визначеним правилом. Вона залежить від n, величини ефекту, варіативності, дизайну та рівня α. Зменшення α за інших рівних умов потребує більшого n для збереження тієї самої потужності. Greenland та співавтори (2016) підкреслюють, що потужність є характеристикою наперед визначеного дизайну щодо конкретної альтернативи, а не універсальною властивістю дослідження.


Поширена ціль 80% не є законом природи. Для одних задач прийнятною може бути інша ціль, а для критичних рішень дослідник може вимагати 90% або більше. Головне — пояснити, чому обрані α, потужність і цільовий ефект адекватні саме дослідницькому питанню.


Статистична потужність не дорівнює ймовірності того, що гіпотеза істинна, і не показує важливість ефекту. Так само p-value після дослідження не замінює обґрунтування n. Це окремі елементи дизайну й інтерпретації.


4. Від бажаної точності та ширини довірчого інтервалу


Якщо основна мета — оцінювання, дослідник може поставити інше питання: наскільки вузьким має бути інтервал невизначеності навколо параметра? Зі збільшенням n стандартна похибка багатьох простих оцінок зменшується приблизно пропорційно 1/√n. Отже, щоб удвічі зменшити стандартну похибку, у простому випадку потрібно приблизно вчетверо збільшити n.


Саме тому планування за точністю часто дає більш змістовний критерій, ніж формула «щоб p стало менше .05». Maxwell, Kelley і Rausch (2008) описують accuracy in parameter estimation як окрему логіку sample size planning, а не як побічний продукт тесту значущості.


Детальніше про те, що показує інтервальна невизначеність, дивіться у статті «Довірчий інтервал: що означає 95% CI і як він показує невизначеність оцінки». Важливо: статистична стандартна похибка оцінки і психометрична стандартна похибка вимірювання — різні поняття.


5. Від варіативності, якості вимірювання і шуму


За однакової істинної різниці сильніший шум у даних ускладнює її виявлення і розширює невизначеність. Це стосується як природної варіативності ознаки, так і вимірювальної похибки. Ненадійний інструмент може послаблювати спостережувані зв’язки або збільшувати невизначеність, але просте збільшення n не перетворює погано визначений конструкт на добре виміряний.


У дослідженнях надійності й похибки вимірювання вимоги до n залежать ще й від кількості повторних вимірювань, очікуваного ICC, моделі agreement/consistency та систематичних відмінностей між вимірюваннями. Симуляційна робота Mokkink та співавторів (2023) показує, що принцип «one size fits all» для таких досліджень не працює. Про саму вимірювальну невизначеність дивіться «Похибка вимірювання в психології».


6. Від дизайну: незалежні групи, повторні вимірювання, кластери


Парний або repeated-measures дизайн може бути статистично ефективнішим за незалежні групи, якщо повторні показники достатньо корелюють і модель коректно враховує залежність. Але кількість повторів сама по собі не компенсує малу кількість незалежних людей для всіх типів висновків.


У кластерних дослідженнях учасники в межах одного кластера частково дублюють інформацію один одного. Для простого випадку часто використовують design effect: 1 + (m − 1) × ICC, де m — середній розмір кластера, а ICC — внутрішньокластерна кореляція. CONSORT cluster extension показує, чому кількість кластерів та ICC мають входити до розрахунку, а не згадуватися вже після набору.


Нерівні розміри груп, стратифікація, коверіати, перехресні дизайни, вкладені дані, часові ряди та інші структури змінюють інформаційну ефективність. Тому n, потрібний для простого незалежного t-тесту, не слід переносити на складніший дизайн без нового обґрунтування.


7. Від складності статистичної моделі


Для регресії, факторного аналізу, CFA, SEM, IRT і багаторівневих моделей вимога до n залежить від того, скільки параметрів оцінюється, наскільки сильні зв’язки, якою є структура пропусків, розподіл змінних, кількість категорій відповіді та інші властивості моделі. Просте співвідношення «учасники на змінну» або «учасники на item» втрачає цю інформацію.


Класична робота MacCallum та співавторів (1999) показала для факторного аналізу, що необхідний n залежить, зокрема, від communalities і ступеня overdetermination факторів; автори прямо критикують уявлення про інваріантне мінімальне співвідношення n до кількості змінних. Для SEM Wolf та співавтори (2013) у симуляціях отримали дуже широкий діапазон потрібних вибірок залежно від параметрів моделі, що ілюструє слабкість одного «магічного» порога.


Для складних латентних моделей сильний підхід — Monte Carlo: задають правдоподібні параметри, генерують багато вибірок різного n, оцінюють модель і перевіряють power, bias, coverage, convergence та інші критерії. Muthén і Muthén (2002) демонструють цю логіку для CFA та growth models і прямо зазначають, що універсального правила для всіх ситуацій немає.


8. Від вибування, пропущених даних і непридатних спостережень


Розрахований аналізом n зазвичай означає кількість одиниць, які мають увійти до цільового аналізу, а не просто кількість підписаних інформованих згод. Якщо очікується вибування, технічні втрати, невалідні записи або відсутність ключового follow-up, ціль набору збільшують так, щоб після втрат залишився потрібний аналізований n.


Наприклад, якщо аналіз потребує 240 завершених спостережень, а правдоподібно очікується 20% втрат, механічне додавання 20% дає 288, але правильна проста інфляція становить 240 / 0,80 = 300. Реальна поправка має спиратися на характер пропусків і дизайн, а не на довільне число.


Для клінічних і лонгітюдних досліджень припущення про вибування варто фіксувати до набору та перевіряти в sensitivity scenarios. Великий початковий n не виправляє систематичне вибування, якщо ймовірність втрати пов’язана з результатом.


9. Від множинних первинних аналізів, підгруп та взаємодій


Якщо дослідження хоче робити окремі надійні висновки для кількох підгруп, тестувати взаємодії або має кілька співпервинних кінцевих точок, потрібний n може істотно зрости. Причина проста: інформація для одного загального ефекту розподіляється між складнішими контрастами, а контроль помилки першого роду може вимагати суворішого порогу.


Не слід планувати n для загального ефекту, а потім оголошувати достатньо потужними десятки постфактум підгрупових аналізів. Якщо підгрупа є частиною головного питання, її треба включити в планування вибірки.


Основні способи обґрунтувати розмір вибірки


Апріорний аналіз статистичної потужності


Цей підхід відповідає на запитання: який n потрібний, щоб за обраного α і заданої моделі мати певну ймовірність виявити ефект щонайменше заданої величини? Він доречний, коли ключове рішення дійсно пов’язане з тестуванням конкретної гіпотези й ефект можна предметно обґрунтувати.


Важливе слово — апріорний. Розрахунок проводять до збору або до перегляду результатів, що можуть вплинути на рішення про зупинку. Після дослідження варто показувати фактичні оцінки, ефекти та інтервали, а не намагатися «пояснити» незначущий результат observed power, обчисленою з того самого p-value. Hoenig і Heisey (2001) та Greenland та співавтори (2016) описують проблеми такої ретроспективної інтерпретації.


Планування за точністю


Тут дослідник задає прийнятну похибку оцінки або максимальну ширину довірчого інтервалу. Наприклад, для оцінки частки може бути важливо отримати 95% CI не ширший за певну кількість процентних пунктів; для середньої різниці — щоб інтервал був достатньо вузьким для розрізнення практично різних сценаріїв. Це безпосередньо пов’язує n із якістю майбутньої оцінки.


Симуляція та Monte Carlo


Симуляція особливо корисна, коли формула надто спрощує дизайн. Дослідник задає очікувані параметри, генерує дані з відомою «правдою», повторює оцінювання багато разів і дивиться, за якого n отримує прийнятні power, bias, coverage, стандартні помилки та частоту коректної збіжності. Для CFA/SEM це часто сильніший підхід, ніж правило «N ≥ 200».


Повна популяція, обмеження ресурсів і sensitivity analysis


Іноді популяція мала й доступна майже повністю, наприклад усі працівники конкретного підрозділу або всі пацієнти рідкісної програми за визначений період. Іноді ж n фактично обмежений бюджетом, часом або доступністю. Lakens (2022) допускає ресурсне обґрунтування як прозору реальність, але воно має супроводжуватися аналізом того, які ефекти або яку точність такий n реально дозволяє отримати.


Фраза «ми набрали стільки, скільки змогли» не дорівнює доказу достатності. Сильніша звітність звучить так: доступний n становив 120; за цього n дизайн мав 80% power лише для ефектів d приблизно такого масштабу, а менші ефекти залишаються слабо ідентифікованими. Це перетворює обмеження на інтерпретований факт.


Психометрія: чому «10 людей на item» не є універсальним правилом


У психометричних дослідженнях спокуса застосовувати прості співвідношення особливо сильна: «5 учасників на item», «10 на item», «мінімум 200». Такі евристики можуть бути історично звичними, але вони не враховують властивостей конкретної факторної моделі, сили навантажень, communalities, кількості факторів, розподілів, пропусків і методу оцінювання.


MacCallum та співавтори (1999) показали, що в факторному аналізі стабільність рішення залежить від якості самої факторної структури, а не тільки від співвідношення N до числа змінних. Wolf та співавтори (2013) так само продемонстрували для CFA/SEM, що потрібні вибірки можуть дуже відрізнятися між моделями.


Для досліджень measurement properties вимога також залежить від властивості, яку оцінюють. COSMIN прямо розділяє дизайн вимірювальних досліджень за content validity, structural validity, internal consistency, cross-cultural validity/measurement invariance, reliability, measurement error, criterion validity, construct validity і responsiveness. Отже, одна числова норма для всіх психометричних аналізів суперечить самій структурі задачі.


Для reliability/measurement error особливо важливими є кількість людей, кількість повторних вимірювань або raters, очікуваний ICC і модель. Mokkink та співавтори (2023) показують через симуляції, що оптимальне співвідношення n та кількості повторів залежить від цих умов і що приріст точності має спадну віддачу.


Окремо потрібно відрізняти дослідження психометричних властивостей від створення норм. Нормативна вибірка має репрезентувати конкретну референтну популяцію, для якої інтерпретуватимуть бали. Велика вибірка з невідповідної популяції може дати дуже точні, але непридатні норми.


Розмір вибірки і репрезентативність — різні властивості


Велике n зменшує випадкову вибіркову варіативність за коректного дизайну, але не гарантує репрезентативність. Якщо спосіб відбору систематично виключає або надмірно представляє певні групи, збільшення кількості людей з того самого зміщеного джерела може зробити оцінку дуже точною навколо неправильного значення.


Meng (2018) формалізував цю проблему як Big Data Paradox: велика кількість даних не компенсує data defect, пов’язаний із механізмом включення до вибірки. Це особливо важливо для онлайн-опитувань, convenience samples, платформних даних і добровільних панелей.


Тому питання «скільки людей?» завжди має пару: «яких саме людей і як їх відібрано?». Для узагальнення на популяцію метод відбору, coverage, nonresponse, стратифікація та ваги можуть бути не менш важливими, ніж n.


Розмір вибірки не є синонімом репрезентативності. Репрезентативність не є синонімом випадкового відбору. А статистична точність не є синонімом відсутності систематичного bias. Це три різні площини якості дослідження.


Чому «чим більше, тим краще» — лише частина відповіді


За інших рівних умов більша вибірка зазвичай дає менші стандартні помилки, вужчі довірчі інтервали й вищу потужність. У цьому сенсі додаткові незалежні якісні спостереження справді несуть інформацію. Але «за інших рівних умов» — ключова умова, яка в реальних дослідженнях часто не виконується.


По-перше, спадна віддача. Якщо стандартна похибка в простій задачі зменшується приблизно як 1/√n, подвоєння n не подвоює точність. Щоб зменшити випадкову невизначеність удвічі, часто потрібне приблизно чотириразове збільшення n. Тому ресурси іноді ефективніше вкладати в кращий дизайн або точніше вимірювання.


По-друге, велике n робить статистичні тести чутливими до дуже малих відхилень. Це не проблема статистики як такої, але проблема інтерпретації: надзвичайно малий ефект може бути статистично відмінним від нуля і водночас не мати практичного чи клінічного значення. Тому разом із p-value потрібні величина ефекту, інтервал невизначеності й предметний поріг важливості.


По-третє, n не ремонтує систематичний bias, неправильну операціоналізацію, confounding, порушену незалежність, неякісний переклад інструмента або невідповідну популяцію. Велике n може лише зробити випадкову частину похибки меншою, залишаючи систематичну проблему на місці.


По-четверте, надмірний набір може мати ресурсну й етичну ціну, особливо коли участь обтяжлива або ризикована. Обґрунтований дизайн прагне не максимального n за будь-яку ціну, а достатньої інформації для визначеної мети.


Що трапляється, коли вибірка надто мала


Мала вибірка зазвичай дає ширші інтервали, нестабільніші оцінки й нижчу здатність відрізнити невеликий ефект від шуму. Для складних моделей додаються проблеми convergence, improper solutions і сильний вплив окремих спостережень.


Низька потужність не означає, що кожне мале дослідження хибне. Вона означає, що за конкретної істинної альтернативи дизайн рідше даватиме запланований позитивний сигнал. У селективно опублікованому масиві це може сприяти завищеним значущим оцінкам. Аналіз Button та співавторів (2013) на матеріалі нейронауки пов’язував низьку потужність із переоцінюванням ефектів і проблемами відтворюваності; ці емпіричні оцінки стосуються саме нейронаукової літератури, але загальна статистична логіка power є ширшою.


Водночас «незначущий» результат малого дослідження не доводить відсутності ефекту. Він може бути сумісним і з нульовим, і з практично важливим ефектом, якщо інтервал дуже широкий. Саме тому інтервали та оцінки ефекту потрібні для інтерпретації нарівні з тестами.


Чи може вибірка бути «занадто великою»


Статистично саме по собі велике n не є дефектом. Проблема виникає, коли дослідження без потреби витрачає ресурси, піддає зайвих людей навантаженню або інтерпретує будь-який мікроскопічний p-value як доказ важливості. Велика вибірка потребує не меншої, а більшої дисципліни інтерпретації.


Також надвеликий n не захищає від поганого збору даних. Якщо зі зростанням набору погіршується quality control, змінюються процедури, майданчики або склад популяції, формально більша вибірка може принести нові джерела bias. Знову діє принцип: кількість інформації визначається не лише кількістю рядків.


Практичний алгоритм планування розміру вибірки


Крок 1. Сформулюйте головне питання. Який висновок має бути центральним: різниця, зв’язок, прогноз, параметр вимірювальної моделі, точність норми, надійність, діагностична точність?


Крок 2. Визначте одиницю аналізу й дизайн. Скільки незалежних одиниць, скільки повторів, чи є кластери, пари, нерівні групи, вкладені рівні, часові точки?


Крок 3. Визначте статистичний метод для первинного аналізу. Не розраховуйте n для t-тесту, якщо головний аналіз буде interaction у regression, CFA або multilevel model.


Крок 4. Виберіть критерій достатності. Для hypothesis testing — цільова power щодо предметно важливого ефекту. Для estimation — допустима ширина CI або стандартна похибка. Для складної моделі — набір simulation criteria.


Крок 5. Обґрунтуйте nuisance parameters: SD, базову частоту, ICC, кореляцію повторних вимірювань, factor loadings, частоту події або інші величини. Використовуйте попередні дані як діапазон невизначеності, а не як безпомилкову константу.


Крок 6. Проведіть sensitivity analysis. Подивіться, як n змінюється за меншого ефекту, більшої варіативності, нижчої кореляції, вищого ICC або більшого dropout. Один сценарій створює хибну точність плану.


Крок 7. Додайте очікувані втрати, але відрізняйте запланований набір від потрібного аналізованого n. Зафіксуйте, як саме отримано inflation factor.


Крок 8. Перевірте, чи достатній n для кожного справді первинного аналізу, підгрупи або групового порівняння. Не додавайте після збору даних десятки нових головних питань, для яких вибірку не планували.


Крок 9. Зафіксуйте припущення до аналізу. У протоколі або preregistration запишіть формулу, програму чи симуляцію, версію методу, α, power/precision target, ефект, джерело параметрів і dropout.


Крок 10. Після дослідження повідомте фактичний n для кожного ключового аналізу, причини втрат, оцінки ефекту й невизначеність. APA Journal Article Reporting Standards підтримують прозору звітність дизайну й кількісного аналізу замість одного голого числа «N = ...».


Спрощені формули: корисні як орієнтир, але не універсальний калькулятор


Для дуже простого оцінювання середнього за приблизно нормальною схемою можна побачити базову залежність: n ≈ (z × σ / d)², де σ — очікуване стандартне відхилення, d — бажана половина ширини інтервалу, а z відповідає рівню довіри. Формула добре показує квадратичну ціну вищої точності: удвічі менший d потребує приблизно вчетверо більшого n.


Для частки за простого випадкового відбору грубий worst-case орієнтир при p = 0,5, 95% confidence level і margin of error ±5 процентних пунктів дає n близько 385. Але це число не враховує design effect, finite population correction, nonresponse, weighting, selection bias та інші особливості реального опитування.


Для двох незалежних груп із приблизно однаковою дисперсією нормальне наближення показує n на групу ≈ 2(zα/2 + zpower)² / d². За двобічного α = .05, power = .80 і стандартизованого ефекту d = 0,50 це дає приблизно 63 учасники на групу; точний t-розрахунок зазвичай потребує близько 64. Це ілюстрація залежності, а не рекомендація «64 для всіх психологічних досліджень».


Щойно дизайн стає парним, кластерним, багаторівневим, негаусовим, з кількома параметрами або latent variables, прості формули втрачають частину потрібної структури. Тоді використовують спеціалізовані формули, програмні пакети або simulation-based planning.


Чотири приклади, у яких «правильний n» означає різне


Приклад 1. Порівняння двох груп


Дослідник хоче виявити щонайменше d = 0,50 за двобічного α = .05 і power = .80. Простий незалежний t-test приведе приблизно до 64 аналізованих учасників на групу. Якщо очікується 15% втрат, набирати потрібно більше. Якщо ж мінімально важливий ефект d = 0,20, потрібний n зросте в рази.


Приклад 2. Кореляція


Для кореляції r = .30 потрібна одна кількість спостережень, для r = .10 — значно більша. У простому наближенні за α = .05 і power = .80 для r = .30 виходить близько 85 незалежних пар спостережень. Але якщо головне питання — не просто «r ≠ 0», а оцінити r з вузьким CI, n може бути іншим.


Приклад 3. Факторна модель психологічної шкали


Шкала має 24 items, але правило «10 на item = 240» саме по собі нічого не доводить. Потрібний n залежить від кількості факторів, loading magnitudes, communalities, категоріальності items, пропусків, estimator і критерію якості. Тут simulation або модельно-специфічні рекомендації мають сильніше обґрунтування, ніж одна арифметична пропорція.


Приклад 4. Нормативне дослідження


Для створення норм важлива не лише загальна кількість людей, а достатня представленість цільових вікових, мовних, освітніх або інших релевантних груп. Якщо норми потрібні окремо для кількох strata, точність усередині кожної страти може визначати весь план. Тут сторінка про нормативну вибірку є окремим canonical intent.


Типові помилки при визначенні розміру вибірки


Міф «n = 30 достатньо за Центральною граничною теоремою»


Число 30 не є універсальним порогом нормальності, потужності, валідності чи точності. Поведінка статистики залежить від розподілу, estimator, ефекту, дизайну й мети. Іноді n < 30 може бути інформативним; іноді n = 300 буде недостатнім.


Правило «10 учасників на змінну або item»


Це евристика, а не загальний критерій. Для факторного аналізу її обмеженість прямо показують MacCallum та співавтори; для CFA/SEM — simulation literature. Кількість variables важлива, але не ізольовано.


Підставляти очікуваний ефект із одного малого пілоту


Малий pilot може дати сильно завищену або занижену оцінку. Якщо від неї механічно обчислити n, план успадкує її нестабільність. Краще задавати консервативний предметно важливий ефект і перевіряти кілька сценаріїв.


Розраховувати observed power після отримання p-value


Observed post hoc power, побудована з фактичної оцінки ефекту та того самого тесту, не додає незалежної інформації про результат і тісно пов’язана з p-value. Після дослідження інформативніше показати estimate, CI, сумісні величини ефекту та обмеження точності. Це розрізнення детально обговорюють Hoenig і Heisey та Greenland та співавтори.


Ігнорувати вибування


Якщо розрахунок потребує 200 завершених учасників, а реально 20% не доходять до follow-up, набрати рівно 200 означає заздалегідь погодитися на менший аналізований n. Inflation на dropout треба планувати до набору.


Рахувати повторні вимірювання як незалежних людей


100 людей × 5 хвиль не утворюють 500 незалежних учасників. Повторні дані можуть підвищити точність певних параметрів, але їхня залежність є частиною моделі.


Плутати великий n із хорошою вибіркою


Величезна convenience sample не стає репрезентативною лише через масштаб. Meng (2018) показує, чому selection mechanism може домінувати над виграшем від кількості.


Зупиняти збір, щойно p < .05


Неплановане багаторазове підглядання за p-value і припинення набору в момент значущості змінює властивості тесту та може збільшити частоту хибнопозитивних рішень. Якщо потрібен sequential design, правила проміжних аналізів і stopping boundaries задають заздалегідь.


Як описати обґрунтування вибірки в статті, дипломі або протоколі


Добре обґрунтування дозволяє іншому досліднику відтворити логіку. Мінімальний набір: первинний аналіз, цільовий параметр або ефект, α, бажана power або precision target, sidedness, allocation ratio, ключові nuisance parameters, метод/програма, поправка на dropout і фінальний target n.


Приклад формулювання: «Первинним аналізом було двобічне порівняння двох незалежних груп. Розмір вибірки визначали апріорно для α = .05, power = .90 і мінімально важливого стандартизованого ефекту d = .35. Розрахований аналізований n було збільшено з урахуванням очікуваного 15% вибування. Припущення перевіряли sensitivity analysis для d = .25–.45». Конкретні числа мають походити з реального розрахунку, а не з шаблону.


Якщо n обмежений ресурсами, це також слід писати прямо: який максимум доступний, яку точність або які ефекти він дозволяє, і які питання залишаються недовизначеними. Прозоре обмеження методологічно сильніше за вигадане «стандартне правило».


FAQ


Скільки людей потрібно для психологічного дослідження?


Стільки, скільки потрібно для конкретного первинного аналізу за визначених припущень про ефект або точність, α/power, варіативність, дизайн і втрати. Без цих параметрів число не можна обґрунтувати статистично.


Чи достатньо 30 учасників?


Іноді так для певної дуже великої різниці або пілотної задачі, іноді категорично ні. n = 30 не є універсальним порогом достатності. Потрібно рахувати під конкретну мету.


Чи достатньо 100 або 200 для факторного аналізу?


Ці числа можуть бути достатніми для одних моделей і недостатніми для інших. Factor loadings, communalities, кількість факторів, indicators, розподіл і estimator мають значення. Для складних моделей варто використовувати model-specific evidence або simulation.


Чи завжди більша вибірка підвищує валідність дослідження?


Більший n переважно покращує випадкову статистичну точність і power за інших рівних умов. Він не усуває систематичний bias, confounding, неякісне вимірювання або невідповідний sampling frame, тому не гарантує валідність висновку.


Розмір вибірки і репрезентативність — це одне й те саме?


Ні. Розмір — кількість одиниць. Репрезентативність стосується того, наскільки вибірка відображає цільову популяцію щодо релевантних властивостей і механізму відбору. Велика нерепрезентативна вибірка може давати систематично зміщені оцінки.


Як врахувати dropout?


Спочатку визначають потрібний аналізований n, потім ділять його на очікувану частку збережених учасників. Якщо потрібно 240 завершених і очікується 20% втрат, простий розрахунок дає 240 / 0,80 = 300 для набору. У складних missing-data scenarios потрібне додаткове моделювання.


Чи потрібно рахувати power після завершення дослідження?


Observed power, обчислена з фактичного ефекту і p-value, зазвичай не додає корисної незалежної інформації. Після дослідження важливіше подати ефект, довірчий інтервал, фактичний n, втрати та обмеження точності.


Що робити, якщо набрати розрахований n неможливо?


Зафіксувати реальне обмеження, оцінити, які ефекти або яку точність забезпечує доступний n, провести sensitivity analysis і звузити висновки до того, що дані справді підтримують. Не потрібно маскувати ресурсне обмеження випадковою евристикою.


Пов’язані статті


Статистична потужність: що це, як залежить від розміру ефекту, вибірки й рівня значущості — окремий canonical про power, β та те, як effect size, n і α визначають здатність дослідження виявляти задану альтернативу.


Психометрія: що це, що вона вимірює і як оцінюють якість психологічних тестів — про надійність, валідність, похибку, норми та логіку психологічного вимірювання.


Довірчий інтервал: що означає 95% CI і як він показує невизначеність оцінки — про планування й інтерпретацію статистичної точності.


Нормативна вибірка: кого включають до стандартизації тесту і чому репрезентативність має значення — про окрему задачу створення норм і відповідність референтній популяції.


Похибка вимірювання в психології: випадкова, систематична і чому один бал не є абсолютно точним — про вимірювальну невизначеність, яка не зникає від одного лише збільшення n.


Психологічне дослідження: що це, методи, дизайн і як читати результати — ширший контекст дизайну, вибірки й інтерпретації дослідницьких результатів.


Джерела


Appelbaum, M., Cooper, H., Kline, R. B., Mayo-Wilson, E., Nezu, A. M., & Rao, S. M. (2018). Journal article reporting standards for quantitative research in psychology: The APA Publications and Communications Board task force report. American Psychologist, 73(1), 3–25.


Button, K. S., Ioannidis, J. P. A., Mokrysz, C., Nosek, B. A., Flint, J., Robinson, E. S. J., & Munafò, M. R. (2013). Power failure: why small sample size undermines the reliability of neuroscience. Nature Reviews Neuroscience, 14, 365–376.


Campbell, M. K., Piaggio, G., Elbourne, D. R., & Altman, D. G. (2012). CONSORT 2010 statement: extension to cluster randomised trials. BMJ, 345, e5661.


COSMIN. Conducting a study on measurement properties. COnsensus-based Standards for the selection of health Measurement INstruments.


Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N., & Altman, D. G. (2016). Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. European Journal of Epidemiology, 31, 337–350.


Hoenig, J. M., & Heisey, D. M. (2001). The abuse of power: The pervasive fallacy of power calculations for data analysis. The American Statistician, 55(1), 19–24.


Lakens, D. (2022). Sample Size Justification. Collabra: Psychology, 8(1), 33267.


MacCallum, R. C., Widaman, K. F., Zhang, S., & Hong, S. (1999). Sample size in factor analysis. Psychological Methods, 4(1), 84–99.


Maxwell, S. E., Kelley, K., & Rausch, J. R. (2008). Sample size planning for statistical power and accuracy in parameter estimation. Annual Review of Psychology, 59, 537–563.



Mokkink, L. B., de Vet, H., Diemeer, S., & Eekhout, I. (2023). Sample size recommendations for studies on reliability and measurement error: an online application based on simulation studies. Health Services and Outcomes Research Methodology, 23, 241–265.


Muthén, L. K., & Muthén, B. O. (2002). How to use a Monte Carlo study to decide on sample size and determine power. Structural Equation Modeling, 9(4), 599–620.


Олефір, В. О., & Боснюк, В. Ф. (2021). Розрахунок обсягу вибірки як наріжний камінь планування наукового дослідження. Вісник Львівського університету. Серія психологічні науки, 9, 186–195.


Wolf, E. J., Harrington, K. M., Clark, S. L., & Miller, M. W. (2013). Sample Size Requirements for Structural Equation Models: An Evaluation of Power, Bias, and Solution Propriety. Educational and Psychological Measurement, 76(6), 913–934.

 
 
bottom of page