Відкриті дані та код у психологічних дослідженнях: навіщо їх публікують і як захищають учасників
Автор: Український психологічний ХАБ · Опубліковано: 7 жовтня 2026 · Редакційна політика
Відкриті дані та код у психологічних дослідженнях — це дослідницькі дані, документація й аналітичні інструкції, до яких інші дослідники можуть отримати доступ на умовах, визначених авторами, етикою, згодою учасників і правом. Їх публікують, щоб зробити шлях від спостережень до висновків перевірюваним: повторити обчислення, виявити помилки, провести обґрунтований повторний аналіз, використати дані для нових питань і зрозуміти, як саме було отримано опублікований результат. У психології ця практика є частиною відкритої науки, але відкритість не означає безумовну публікацію всього масиву в інтернеті.
Головне правило таке: перевірюваність дослідження зростає завдяки доступності даних, коду й документації, а захист учасників задає межі цієї доступності. Американська психологічна асоціація прямо пов’язує обмін дослідницькими даними з науковим прогресом, відкритістю та підзвітністю, водночас вимагаючи враховувати конфіденційність і правові обмеження. Рекомендації APA щодо обміну даними також передбачають заяву про доступність даних, матеріалів і коду або чітке пояснення етичних чи правових причин, через які їх не можна відкрити.
Тому «відкриті дані» в психології не є синонімом «дані без обмежень». Іноді етично правильна форма відкритості — публічний набір без ризику ідентифікації. Іноді — контрольований доступ після перевірки запиту. Іноді — відкриті метадані, код і синтетичний приклад замість самих чутливих даних. А в окремих випадках публічне поширення індивідуальних даних взагалі суперечить умовам згоди або створює неприйнятний ризик для учасників.
Коротка відповідь: навіщо відкривати дані й код
Відкриті дані дають змогу перевірити, які саме спостереження лежать під результатом, як закодовано змінні, що було виключено, як оброблено пропуски та чи відповідає аналіз описаним даним. Відкритий код показує послідовність перетворень і розрахунків: від очищення та перекодування до статистичної моделі, таблиці або графіка. Документація пояснює структуру набору, значення змінних, версії файлів і логіку робочого процесу. Коли ці три компоненти узгоджені, незалежна команда може значно точніше перевірити аналітичний шлях.
Це безпосередньо пов’язано з відтворюваністю досліджень: можливістю отримати той самий або узгоджений результат, повторно виконавши аналіз на тих самих даних за тим самим аналітичним описом. Відтворюваність тут слід відрізняти від реплікації. Реплікація передбачає новий збір даних або нове дослідження для перевірки твердження; відкриті дані й код насамперед роблять прозорішою перевірку вже виконаного аналізу.
Водночас сама наявність файлу з даними не гарантує відтворюваності. У спостережному дослідженні 25 статей Psychological Science з позначкою відкритих даних лише 9 статей вдалося відтворити без участі авторів; головною проблемою була недостатньо ясна документація аналітичних процедур. Автори підкреслили, що відкритих даних самих по собі недостатньо. Hardwicke та співавтори, 2021. Це не універсальна оцінка всієї психології, а конкретне метадослідження, яке добре ілюструє різницю між «файли опубліковані» та «аналіз реально можна відтворити».
Що саме означає «відкриті дані» в психологічному дослідженні
Дослідницькі дані — це не лише фінальна таблиця, яку програма використала для статистичного аналізу. Залежно від дизайну до них можуть належати відповіді на опитувальники, поведінкові показники, журнали виконання завдань, часові мітки, коди умов, категорії якісного кодування, транскрипти, аудіо або відео, дані сенсорів, службові змінні, а також проміжні версії після очищення чи перетворення.
У публічному пакеті не обов’язково мають бути всі ці рівні. Для досліджень за участю людей «сирі дані» нерідко містять прямі або непрямі ідентифікатори, технічні метадані чи деталі контексту, які не потрібні для перевірки наукового висновку. Тому дослідник визначає мінімальний достатній набір для перевірки й повторного використання, а не механічно завантажує все, що зібрала система.
Важливо також відрізняти відкриті дослідницькі дані від державних відкритих даних. У пошуку українською ці наміри часто змішуються, але це різні контексти. У цій статті йдеться саме про дані наукових психологічних досліджень, а не про набори публічної інформації органів влади.
Що таке відкритий код і чому без нього даних часто замало
Під кодом у сучасному дослідженні маються на увазі скрипти, синтаксис статистичних пакетів, програмні зошити, функції, процедури моделювання, генерації стимулів і візуалізації, а також інші машинно виконувані інструкції, які перетворюють дані на результат. Якщо дослідник вручну виконував кроки в графічному інтерфейсі, еквівалентом коду стає достатньо детальний журнал або відтворюваний протокол дій.
Код цінний тим, що методичний розділ статті неминуче стискає технічні деталі. Фраза «дані очищено і проаналізовано регресійною моделлю» не повідомляє, які значення вважали пропущеними, як створювали складені змінні, які категорії були базовими, як обробляли викиди, у якому порядку застосовували фільтри та які саме параметри моделі використовували. Робочий скрипт фіксує значну частину цих рішень.
Методологічна програма відтворюваної науки розглядає відкритість даних, коду, методів і звітування як взаємопов’язані елементи надійнішого дослідницького процесу. Munafò та співавтори, 2017 описують реформи, спрямовані на підвищення надійності й ефективності науки через поліпшення методів, звітування, поширення результатів і відтворюваності.
Який мінімальний пакет справді робить аналіз перевірюваним
Практично корисний пакет будується навколо запитання: чи зможе інша компетентна людина зрозуміти дані та пройти шлях від доступного набору до ключових результатів без приватних пояснень автора? Для цього зазвичай потрібні не один, а кілька узгоджених компонентів.
1. Аналізований набір даних
Найважливішим є набір, який фактично використовувався для основного аналізу. Якщо сирий файл не можна відкрити через ризик ідентифікації, публічним може бути деідентифікований або агрегований аналізований набір, а перетворення від сирих даних до нього описують настільки докладно, наскільки це безпечно.
2. Словник змінних і кодова книга
Назви на кшталт q17r, cond2 або score_final не пояснюють змісту. Словник має повідомляти, що вимірює змінна, які має допустимі значення, як закодовано категорії, які спеціальні значення позначають пропуски, які одиниці вимірювання застосовано та які похідні змінні створено. Для шкал і тестів необхідно поважати ліцензії та межі психометричного власника: відкритість дослідницького набору не означає автоматичного права публікувати захищений інструмент.
3. Код підготовки та аналізу
Краще розділяти етапи: імпорт, перевірки якості, очищення, формування похідних змінних, основний аналіз, додаткові аналізи, таблиці й графіки. Це зменшує ризик того, що важливий крок залишиться лише в пам’яті автора або у приватній копії файлу.
4. Файл пояснень
Короткий файл пояснень має вказувати, з чого почати, у якому порядку запускати скрипти, які файли є вхідними та вихідними, яке програмне середовище потрібне, де описані змінні та який скрипт відтворює конкретну таблицю чи рисунок у статті. Для повторного використання така навігація часто важливіша за обсяг самого набору.
5. Відомості про програмне середовище
Версії мови програмування, статистичного пакета, бібліотек і залежностей можуть змінити результат або навіть зробити старий код невиконуваним. Тому варто фіксувати версії та, коли це виправдано, файл залежностей або відтворюване середовище. Для складних обчислювальних проєктів це частина наукової документації, а не допоміжна технічна деталь.
6. Походження та версії
Потрібно розуміти, який файл є остаточним, який створено з якого, коли відбулося ключове перетворення і до якої версії статті належить пакет. Версіонування особливо важливе після виправлень: старий результат не повинен тихо змінюватися під тією самою назвою.
FAIR: дані мають бути придатними до знаходження і повторного використання
Принципи FAIR описують чотири властивості належно керованих цифрових дослідницьких об’єктів: Findable, Accessible, Interoperable, Reusable — придатні до знаходження, доступні за визначеною процедурою, сумісні та придатні до повторного використання. Wilkinson та співавтори, 2016 підкреслюють, що ці принципи стосуються не лише таблиць даних, а й алгоритмів, інструментів і робочих процесів.
Найважливіше для психології: FAIR не означає «відкрити всім без входу й перевірки». У вихідній формалізації принцип доступності прямо допускає автентифікацію та авторизацію, коли вони потрібні. Для чутливих або персонально ідентифікованих даних високий рівень FAIR може забезпечуватися відкритими метаданими, постійним ідентифікатором і чітко описаною процедурою контрольованого доступу, навіть якщо самі дані не оприлюднюються.
В українській інфраструктурі відкритої науки цю логіку також використовують. Державна науково-технічна бібліотека України пояснює FAIR як основу повторного використання дослідницьких даних, а DataverseUA НАН України підтримує спеціальні умови використання та обмеження доступу. Це важлива практична ілюстрація: керований доступ є частиною належного управління даними, а не відмовою від відкритої науки.
Відкритість має плануватися до збору даних
Найбезпечніше рішення щодо відкриття даних приймається не наприкінці проєкту, коли стаття вже написана, а під час проєктування дослідження. Тоді дослідник може визначити, які дані справді потрібні, які ідентифікатори збирати не слід, як сформулювати інформування учасників, де зберігатимуться файли, хто матиме доступ і який рівень поширення передбачається після завершення.
Практичний методологічний огляд Michelle Meyer наголошує саме на перспективному плануванні: етичний обмін даними включає формулювання згоди, погодження з етичною комісією, деідентифікацію, оцінку ризику повторної ідентифікації та вибір відповідного репозитарію. Meyer, 2018 окремо розглядає складні випадки, коли старі форми згоди мовчали про майбутній обмін даними або прямо обіцяли, що дані не передаватимуться.
Ця логіка змінює саме формулювання дослідницької згоди. Учасник має розуміти не абстрактне «дані можуть бути використані в науці», а передбачуваний режим: чи планується публічне поширення деідентифікованого набору, чи доступ буде контрольованим, які типи інформації можуть бути передані, якими є межі конфіденційності та чи можливе вторинне використання.
Закон і етика: що в Україні важливо для персональних даних
Для українського контексту базовим правовим джерелом є Закон України «Про захист персональних даних». Стаття 6 вимагає, щоб склад і зміст персональних даних були відповідними, адекватними та ненадмірними стосовно визначеної мети, а подальша обробка в історичних, статистичних чи наукових цілях може здійснюватися за умови належного захисту даних. Закон також визначає, що обробка здійснюється для конкретних і законних цілей за згодою суб’єкта або в інших випадках, передбачених законом.
Для дослідника з цього випливає практичний принцип мінімізації: збирати, зберігати й поширювати лише ті персональні елементи, які потрібні для законної та визначеної мети. Відкрита наука не створює окремого дозволу ігнорувати конфіденційність. Юридична підстава обробки, умови інформування, рішення етичної комісії та конкретні договірні чи інституційні вимоги мають оцінюватися для реального проєкту.
Етичний кодекс APA також встановлює важливу межу: після публікації психологи мають надавати дані компетентним фахівцям для перевірки тверджень через повторний аналіз, якщо конфіденційність учасників може бути захищена і немає правових обмежень. Стандарт 8.14 Кодексу APA не перетворює це на вимогу публічного завантаження будь-яких даних у відкритий інтернет; центральною умовою залишається захист конфіденційності.
Анонімізація, деідентифікація і псевдонімізація: що реально зменшує ризик
Видалити ім’я та електронну адресу недостатньо. Людину можуть видати комбінації непрямих ознак: точний вік, населений пункт, рідкісна професія, дата події, часові мітки, унікальне поєднання діагностичних чи біографічних характеристик, геолокація, вільний текст або послідовність поведінкових подій. Чим менша популяція й рідкісніша комбінація, тим вищий ризик повторної ідентифікації.
Деідентифікація — практичний процес зменшення ідентифікуючої інформації. Псевдонімізація замінює прямі ідентифікатори кодом, але можливість зв’язати код із людиною через окремий ключ зберігається. Повна анонімізація означає значно сильніший результат: особу не можна ідентифікувати доступними засобами. У реальних психологічних наборах, особливо насичених біографічним контекстом, гарантувати такий стан буває складно. Саме тому дослідник має оцінювати ризик для конкретного набору, а не просто називати файл «анонімним».
Meyer, 2018 радить розглядати деідентифікацію разом із ризиком повторної ідентифікації, способом доступу та властивостями сховища. Це принципово сильніший підхід, ніж механічне видалення кількох колонок.
Прямі ідентифікатори
До них належать ім’я, адреса, номер телефону, електронна пошта, номер документа, обліковий ідентифікатор та інші дані, що безпосередньо вказують на людину. Їх зазвичай не включають до публічного дослідницького набору, якщо для цього немає окремої законної, етичної та методологічної підстави.
Непрямі ідентифікатори
Це інформація, яка окремо може здаватися безпечною, але в комбінації звужує коло можливих осіб. Для невеликого університету поєднання «вік 47 років + конкретна посада + рідкісна подія» може фактично назвати учасника. Тому ризик оцінюють на рівні комбінацій.
Вільний текст, аудіо, відео й якісні дані
Транскрипти та життєві історії містять контекст, який важко очистити алгоритмічно без втрати змісту. Голос і обличчя самі є ідентифікуючими. У якісному дослідженні дослівна цитата може бути знайдена через пошук або впізнана учасниками спільноти. Через це етично доречними можуть бути перефразування, вилучення контекстуальних деталей, контрольований доступ до повного матеріалу або відмова від публікації сирих даних.
Це особливо важливо для якісної психології: редакційні правила журналу Qualitative Psychology прямо зауважують, що поширення якісних даних може конфліктувати з конфіденційністю та з рішенням учасників про те, кому вони погоджувалися розкривати свій досвід. Рекомендації APA для Qualitative Psychology показують, чому єдина модель «відкрити всі сирі дані» не підходить для всіх методологій.
Три режими доступу: публічний, контрольований і закритий
Замість бінарної схеми «відкрито/закрито» корисніше обирати рівень доступу відповідно до ризику, згоди й наукової мети.
Публічний доступ
Підходить для даних з низьким ризиком повторної ідентифікації, коли публічне поширення відповідає інформуванню учасників і правовим вимогам. Публічний набір має супроводжуватися метаданими, документацією, умовами використання та стабільним посиланням.
Контрольований доступ
Підходить для цінних, але чутливих даних. Запитувач може подавати обґрунтування, погоджувати умови використання, підтверджувати мету та отримувати доступ лише до потрібної частини. Контрольований доступ дає змогу зберегти можливість наукової перевірки й повторного використання без перетворення набору на загальнодоступний файл.
Дані не поширюються
Це може бути коректним рішенням, якщо згода не дозволяє передачу, ризик повторної ідентифікації неприйнятний, існують правові або договірні обмеження чи сам тип матеріалу робить безпечне поширення нереалістичним. Тоді прозорість забезпечують описом причин, доступною документацією, кодом, метаданими, агрегованими результатами або синтетичним демонстраційним набором, якщо це не створює хибного враження, ніби синтетичні дані є оригінальними.
Чому «дані доступні за запитом» — не те саме, що реальний доступ
Фраза «дані доступні за запитом» може бути виправданою, коли потрібна перевірка етичних умов або угода про використання. Вона значно слабша, коли не пояснює, хто розглядає запит, за якими критеріями, який строк зберігання даних, які документи потрібні і що саме можна отримати. Через кілька років адреса автора може перестати працювати, а команда — розпастися.
Тому контрольований режим повинен бути процедурою, а не приватною обіцянкою. Найкраща за змістом заява описує місце зберігання, стабільний ідентифікатор або сторінку набору, тип доступних файлів, обмеження, критерії запиту і контакт відповідальної інституції.
Репозитарій: чому вкладення до статті або особистого диска замало
Надійне сховище має забезпечувати стабільну адресу, опис версії, метадані, умови доступу, довготривале збереження і, бажано, постійний ідентифікатор. Особисте хмарне посилання може зникнути після зміни облікового запису; файл на персональному сайті може бути непомітно замінений; репозиторій дає змогу краще фіксувати версію і походження.
APA рекомендує використовувати надійні репозитарії для даних, матеріалів і коду. У своїх рекомендаціях щодо Transparency and Openness Promotion асоціація розрізняє рівні розкриття, вимоги до поширення там, де воно юридично та етично дозволене, і незалежну перевірку виконання стандарту.
Відкритий код також може розкрити конфіденційні дані
Код часто вважають безпечним, бо це «лише команди». Насправді скрипти й програмні зошити можуть містити абсолютні шляхи з іменами користувачів, ключі доступу, токени, адреси серверів, назви захищених каталогів, ідентифікатори учасників, уривки даних у коментарях або збережені результати виконання. Програмний зошит може показувати перші рядки таблиці, а діагностичний графік — рідкісну точку, яку можна пов’язати з людиною.
Перед публікацією коду потрібен окремий аудит: вилучити секрети й облікові дані, замінити приватні шляхи на відносні, перевірити коментарі, очистити збережені виходи, переконатися, що приклади не містять реальних ідентифікаторів, і запустити пакет у чистому середовищі. Код має посилатися на файли так, щоб інша людина могла виконати його без доступу до внутрішньої структури комп’ютера автора.
Як перевірити, що пакет відтворюється
Найсильніша перевірка — виконати аналіз з нуля в окремому середовищі, використовуючи лише ті файли й інструкції, які побачить майбутній читач. Якщо дослідницька група має кількох учасників, перевірку краще доручити людині, яка не готувала остаточний пакет. Вона швидко знаходить приховані залежності: файл, який «усі в лабораторії знають, де лежить», ручне виправлення таблиці або крок, який ніде не записаний.
Метадослідження Hardwicke та співавторів, 2018 після запровадження обов’язкової політики відкритих даних у журналі Cognition спеціально оцінювало не лише наявність файлів, а й їхню придатність до повторного використання та аналітичну відтворюваність. Саме цей рівень перевірки показує, що політика «файл має бути» і реальна можливість повторити аналіз — різні речі.
Що має містити заява про доступність даних і коду
Добра заява про доступність відповідає на конкретні питання, а не просто декларує відкритість. Читач має зрозуміти, які саме об’єкти доступні, де вони розміщені, яка версія відповідає статті, які обмеження діють і чому.
Для відкритого пакета варто вказати: стабільне посилання або постійний ідентифікатор; перелік даних, матеріалів і коду; умови або ліцензію повторного використання; версію; опис документації. Для контрольованого пакета — додатково критерії та процедуру доступу. Для закритих даних — конкретну етичну, правову або договірну причину, а також те, які компоненти все ж можна перевірити.
APA у рекомендаціях щодо обміну даними і в Journal Article Reporting Standards підтримує прозоре повідомлення про доступність даних, матеріалів і коду. JARS є стандартом звітування: він допомагає читачеві побачити потрібну інформацію, але сам по собі не доводить, що дизайн або аналіз були безпомилковими.
Ліцензія і право повторного використання
Файл, який можна завантажити, не обов’язково має зрозумілі умови повторного використання. Для даних, коду й матеріалів можуть діяти різні права та обмеження. Дослідник має перевірити, чи володіє правом поширювати кожний компонент, чи не містить пакет ліцензованого тесту, стимулів, захищених зображень або сторонніх даних, які отримано лише для внутрішнього аналізу.
Умови повторного використання бажано вказувати явно. Для коду це може бути стандартна ліцензія на програмне забезпечення, для даних — ліцензія або угода, сумісна з етичними та правовими умовами. FAIR-принцип повторного використання прямо включає ясну й доступну ліцензію та докладне походження даних.
Дані, код і документація мають узгоджуватися між собою
Типова помилка — опублікувати фінальну таблицю, але залишити скрипт, який очікує інші назви колонок. Або завантажити код після останньої редакції статті, хоча фінальні числа були отримані попередньою версією. Ще один сценарій — таблиці в статті редагували вручну після виконання аналізу, тому їх уже неможливо автоматично отримати з коду.
Надійніший процес будує єдиний ланцюг: вихідні доступні дані → підготовка → аналіз → таблиці й графіки → звіт. Кожний результат має мати зрозуміле походження. Саме походження дозволяє відрізнити контрольоване виправлення від непомітної зміни і спрощує аудит помилок.
Відкриті дані не роблять слабке дослідження сильним
Відкритість підвищує перевірюваність, але не замінює дизайн. Спостережний набір не стає рандомізованим експериментом після публікації. Великий відкритий масив не усуває змішування чинників, похибку вимірювання, селекцію вибірки або невизначеність причинного висновку. Код, що бездоганно повторює помилкову модель, робить помилку прозорою, але не перетворює її на правильний аналіз.
Тому оцінка відкритого пакета має два окремі рівні. Перший: чи можна зрозуміти й повторити виконані кроки? Другий: чи були ці кроки методологічно виправданими для поставленого питання? Відкрита наука допомагає відповісти на перше і полегшує критичну оцінку другого.
Особливі випадки: якісні, лонгітюдні та цифрові дані
Якісні інтерв’ю
Повні транскрипти можуть містити інформацію про третіх осіб, рідкісні події, географічні деталі й стилістичні особливості мовлення. Видалення імен часто не робить матеріал безпечним. Для таких даних відкритий код категорій, опис процедури аналізу, приклади деідентифікованих уривків і контрольований доступ можуть забезпечити більше перевірюваності без непропорційного ризику.
Лонгітюдні дослідження
Чим більше хвиль і змінних, тим унікальнішим стає профіль учасника. Дані, які здавалися низькоризиковими в одній хвилі, у поєднанні з наступними вимірами можуть стати значно більш ідентифікуючими. План відкриття повинен враховувати накопичувальний ризик.
Цифрові сліди і дані платформ
Час, геолокація, назва пристрою, мережеві ідентифікатори, послідовність натискань або дослівні публічні повідомлення можуть дозволити знайти конкретну людину. Технічна доступність інформації в мережі не означає, що її безпечне повторне поширення в дослідницькому наборі автоматично етично виправдане.
Типові помилки при відкритті даних і коду
Перша помилка — вважати, що максимальна відкритість завжди є максимальною етичністю. Для людських даних етично сильний пакет відкриває стільки, скільки можна безпечно й відповідально, і прозоро пояснює решту.
Друга — називати набір анонімним лише тому, що з нього видалили імена. Ризик повторної ідентифікації визначається всім набором і контекстом, а не однією колонкою.
Третя — відкрити дані без словника змінних, коду й пояснення. Такий файл може формально існувати, але бути практично непридатним до перевірки.
Четверта — відкрити код, який працює тільки на комп’ютері автора через приватні шляхи, локальні файли або невказані бібліотеки.
П’ята — публікувати ключі доступу, токени, службові адреси або необроблені виходи програмного зошита разом із кодом.
Шоста — змінювати файли після публікації без версії та журналу змін. Виправлення є нормальною частиною науки; непомітне переписування артефакту руйнує можливість зрозуміти, що саме перевіряв попередній читач.
Сьома — сприймати відмову від відкриття чутливих даних як автоматичний дефект. Якщо обмеження випливає зі згоди, конфіденційності або права і воно прозоро описане, це може бути методологічно й етично правильним рішенням.
Практичний алгоритм для дослідницької групи
До збору даних
Визначте, які дані справді потрібні; складіть план управління даними; розділіть ідентифікатори та аналітичні дані; продумайте очікуваний рівень доступу; узгодьте формулювання інформованої згоди й етичний протокол; оберіть сховище та правила версіонування. На цьому етапі значно дешевше запобігти ризику, ніж намагатися видалити його з уже зібраного масиву.
Під час дослідження
Ведіть словник змінних, зберігайте перетворення в коді, фіксуйте версії, документуйте ручні рішення, не змішуйте прямі ідентифікатори з аналітичним набором без потреби, регулярно перевіряйте права доступу й резервне копіювання.
Перед публікацією
Створіть пакет так, як його побачить зовнішній користувач. Перевірте на ідентифікатори, секрети й сторонні матеріали; запустіть аналіз у чистому середовищі; переконайтеся, що код породжує ключові результати; додайте словник, інструкцію, ліцензію та опис обмежень; зафіксуйте версію.
Після публікації
Зберігайте стабільність посилання, документуйте виправлення, не стирайте без пояснення попередні версії, відповідайте на обґрунтовані запити контрольованого доступу відповідно до заявленої процедури й оновлюйте пакет так, щоб читач міг відрізнити первинну версію від виправленої.
Як читачеві оцінити відкритий пакет
Почніть не з факту наявності значка або посилання, а з перевірки змісту. Чи збігаються назви файлів з описом? Чи є словник? Чи можна зрозуміти одиницю спостереження? Чи пояснені пропуски й виключення? Чи відповідає код версії даних? Чи можна знайти скрипт для основного результату? Чи зазначені версії програм? Чи є умови повторного використання? Чи описано причини обмежень?
Далі перевірте наукову логіку. Навіть повністю відтворюваний результат може мати широку невизначеність, слабкий дизайн або невиправданий причинний висновок. Відкритий пакет робить цю оцінку реалістичною, а не замінює її.
Часті запитання
Чи потрібно публікувати всі сирі дані?
Ні. Публікують той рівень даних, який потрібний для наукової перевірки й повторного використання та сумісний зі згодою, конфіденційністю, правом і ризиком повторної ідентифікації. Для чутливих сирих даних може бути правильним контрольований доступ або непоширення.
Чи можуть дані бути FAIR, але не публічними?
Так. Вихідні FAIR Principles прямо допускають автентифікацію й авторизацію для доступу. Метадані можуть бути відкритими, а чутливі дані — доступними за контрольованою процедурою.
Чи достатньо видалити ім’я та електронну пошту?
Ні. Потрібно оцінювати прямі й непрямі ідентифікатори, рідкісні комбінації, вільний текст, часові та географічні дані, можливість поєднання з іншими джерелами. Безпека є властивістю всього способу поширення, а не однієї операції над таблицею.
Чи корисно відкривати код, якщо дані не можна відкрити?
Так. Код показує логіку перетворень і моделей, дозволяє перевіряти частину аналітичних рішень, використовувати синтетичні або інші доступні дані для тестування та полегшує майбутню перевірку за контрольованого доступу. Водночас без даних не можна повністю повторити числовий результат, тому обмеження треба описувати чесно.
Чи достатньо написати «дані доступні за запитом»?
Лише тоді, коли за цією фразою стоїть реальна процедура. Потрібні зрозумілі критерії, відповідальний суб’єкт, опис доступних матеріалів і стійкий спосіб подати запит. Інакше доступ залежить від випадкової майбутньої доступності конкретного автора.
Чи гарантує відкритий код правильність аналізу?
Ні. Відкритий код дозволяє побачити й перевірити виконаний аналіз. Правильність моделі, припущень, вимірювання й причинної інтерпретації оцінюються окремо.
Що робити, якщо стара згода нічого не говорить про публічний обмін даними?
Не слід автоматично трактувати мовчання як дозвіл на публічне поширення. Потрібно оцінити текст згоди, етичне рішення, правову підставу, ризик повторної ідентифікації та можливість контрольованого доступу. Meyer, 2018 спеціально розглядає ситуації зі старими формами згоди, які мовчали про обмін даними або обіцяли непоширення.
Висновок
Відкриті дані та код перетворюють науковий результат із фінальної цифри на перевірюваний дослідницький маршрут. Їхня цінність виникає тоді, коли дані зрозумілі, код виконується, версії зафіксовані, походження результату простежується, а умови доступу відповідають ризику. Саме тому якість відкритого пакета визначається не кількістю оприлюднених файлів, а тим, наскільки добре він дозволяє перевірити дослідження без порушення прав людей, які надали дані.
У психології ця практика стоїть на перетині відкритої науки, відтворюваності та етики психологічного дослідження. Відкритість посилює знання тоді, коли вона спроєктована разом із методологією і захистом учасників від самого початку.
Пов’язані статті
Відтворюваність досліджень: чи можна отримати той самий результат з тих самих даних, коду і процедур
Джерела
American Psychological Association. Data sharing. Рекомендації щодо обміну дослідницькими даними, інформованої згоди та заяв про доступність даних.
American Psychological Association. Journal Article Reporting Standards (JARS). Стандарти звітування для кількісних, якісних і змішаних психологічних досліджень.
American Psychological Association. Transparency and Openness Promotion. Політика й рівні прозорості для даних, матеріалів, коду та інших дослідницьких артефактів.
