top of page

Психологічна енкциклопедія

LIWC: що це і як психологи аналізують мову за допомогою словників

6 годин тому
Читати 9 хв

Оновлено: 2 години тому

Автор: Український психологічний ХАБ · Опубліковано: 18 вересня 2026 · Редакційна політика


LIWC — це метод комп’ютерного аналізу тексту, який зіставляє слова та інші мовні одиниці з наперед визначеними словниковими категоріями й обчислює, як часто ці категорії з’являються у тексті. Назва розшифровується як Linguistic Inquiry and Word Count — «лінгвістичне дослідження та підрахунок слів». Класичний опис методу наголошує, що LIWC створювався як прозорий спосіб кількісно описувати психологічно значущі особливості мовлення, а не як система, що «читає думки» за окремими словами. Tausczik і Pennebaker (2010).


Сьогодні під назвою LIWC мають на увазі і дослідницьку традицію закритих словників, і програмне середовище LIWC-22. За офіційним описом, LIWC-22 містить понад 100 вбудованих словників для соціальних, психологічних і мовних категорій. Програма читає текст, порівнює його одиниці зі словниковими записами та для більшості категорій повертає частку слів, що потрапили до відповідної категорії. Офіційний опис принципу роботи LIWC-22.


Для психології цінність LIWC полягає у відтворюваності: дослідник може заздалегідь визначити, які категорії аналізуватиме, застосувати однаковий словник до сотень або тисяч текстів і порівнювати групи, умови чи часові точки. Водночас будь-який показник LIWC залишається характеристикою мовного матеріалу в певному контексті. Він не є прямим вимірюванням прихованого психічного стану людини.


Що саме вимірює LIWC


Базова логіка LIWC проста. Якщо в тексті 1000 слів і 50 із них збігаються зі словником позитивних емоцій, відповідний показник становитиме 5%. Такий результат означає частоту лексики певної категорії, а не «5% позитивних емоцій» у людини. Це важливе розрізнення: програма вимірює мовний патерн, а психологічна інтерпретація виникає лише після зіставлення цього патерну з дизайном дослідження, теорією та іншими даними.


Один словниковий запис може належати одразу до кількох категорій. Наприклад, слово може одночасно потрапляти до ширшої емоційної категорії та до вужчої категорії позитивних емоцій. Через це суми окремих показників не мають обов’язково складати 100%. Ієрархічність і перетин категорій прямо описані в документації LIWC-22. How It Works.


У LIWC аналізують не лише слова з очевидним емоційним значенням. До словників входять функціональні слова, займенники, соціальні та когнітивні категорії, часові й просторові орієнтири, теми афекту, мотивації, соціальних зв’язків та інші класи. Саме поєднання змістових і граматично-функціональних маркерів зробило LIWC помітним інструментом у психолінгвістиці та психології мови.


Як працює словниковий аналіз


1. Текст перетворюється на послідовність мовних одиниць


Програма обробляє письмовий текст або транскрипцію мовлення. У сучасному LIWC-22 можна аналізувати окремі текстові документи, файли Word і PDF, а також колонки тексту в таблицях. Це технічний етап: сам формат файлу не визначає психологічного змісту результату. Офіційна інструкція LIWC Analysis.


2. Одиниці зіставляються зі словниками


Кожен словник задає набір слів, словоформ, основ, емотиконів або інших конструкцій, які дослідники віднесли до певної категорії. Закритий словник означає, що категоріальна схема існує до аналізу конкретного корпусу. Це відрізняє LIWC від методів, які спочатку шукають теми чи латентні структури без наперед заданого переліку психологічних категорій.


3. Підрахунок нормується відносно обсягу тексту


Для більшості категорій результат подається як відсоток від загальної кількості слів. Тому два тексти різної довжини можна порівнювати за відносними частотами. Проте нормування не усуває проблему малого обсягу: у дуже короткому повідомленні одна-дві лексеми можуть непропорційно змінити показник. Офіційна документація радить із особливою обережністю інтерпретувати тексти коротші приблизно за 25–50 слів і наголошує, що більші обсяги дають стабільніші оцінки. LIWC How It Works.


4. Частина результатів є складеними індексами


Окрім прямих частот, LIWC-22 має чотири підсумкові індекси: Analytical Thinking, Clout, Authenticity та Emotional Tone. Вони розраховуються з комбінацій змінних і переводяться у шкалу від 1 до 99. Це не відсотки слів і не універсальні психологічні «бали особистості». Алгоритми індексів спираються на попередні емпіричні роботи, а для змістовної оцінки потрібен достатній обсяг інформації в тексті. Документація LIWC про підсумкові показники.


Чому слова можуть бути психологічно інформативними


Мова пов’язана з тим, на що людина спрямовує увагу, як структурує події, кого включає до соціального поля, як описує причинність, невизначеність, емоції та час. Великий огляд досліджень LIWC показав, що мовні категорії можуть бути пов’язані з емоційністю, соціальними відносинами, стилем мислення, фокусом уваги та індивідуальними відмінностями. Водночас самі автори цієї традиції розглядають такі зв’язки як статистичні патерни, а не як однозначний словник «слово → психічний стан». Tausczik & Pennebaker, 2010.


Сучасні огляди психологічного аналізу природної мови підкреслюють ще одну річ: текст набуває значення на кількох рівнях одночасно. Частота лексем важлива, але вона взаємодіє з контекстом, жанром, ситуацією спілкування, адресатом, культурою та завданням, у межах якого текст було створено. Тому результат LIWC краще розглядати як один шар вимірювання, який стає сильнішим у поєднанні з іншими методами. Boyd і Schwartz (2021).


LIWC і психосемантика


LIWC працює з категоріями значення, але не вимірює значення слова в усій його контекстній повноті. Словниковий запис задає дослідницьке правило: певна мовна форма зараховується до певного класу. У цьому сенсі LIWC перетинається з питаннями психосемантики, проте методологічно це різні речі. Психосемантика досліджує структури значення та смислу ширше, тоді як LIWC насамперед кількісно описує появу попередньо визначених мовних категорій.


Це пояснює, чому полісемія створює труднощі. Одна й та сама форма може мати різне значення в різних реченнях. Офіційний опис LIWC наводить англійське слово mad як приклад: воно часто пов’язане з гнівом, але в інших контекстах може мати інше значення. На великих масивах частина таких похибок взаємно компенсується, проте в коротких або спеціалізованих текстах контекст може бути вирішальним. LIWC How It Works.


Сильні сторони LIWC


Перша сильна сторона — відтворюваність. Якщо дослідники використовують ту саму версію словника, ті самі правила підготовки тексту та однакову одиницю аналізу, процедуру можна повторити. Друга — інтерпретованість: на відміну від багатьох високовимірних моделей, дослідник бачить, які категорії було пораховано. Третя — ефективність: словниковий аналіз можна застосувати до великих корпусів без ручного кодування кожного речення.


Четверта перевага — накопичена психометрична традиція. Для LIWC-22 опубліковано окремий посібник із розроблення й психометричних властивостей категорій, включно з описом корпусів, норм і процедур перевірки. Водночас ці дані стосуються конкретних словників і мовних матеріалів, на яких вони будувалися. Boyd, Ashokkumar, Seraj і Pennebaker (2022).


Обмеження LIWC


Головне обмеження випливає з самої переваги закритого словника: метод добре рахує те, що словник уміє розпізнати, але не обов’язково відтворює повний смисл висловлювання. Заперечення, іронія, метафора, цитування, багатозначність, новий сленг і вузькопрофесійні значення можуть змінювати інтерпретацію речення без пропорційної зміни словникових частот.


Точність також залежить від домену. У 2025 році Hunter і Grant вручну перевірили частину LIWC-кодувань на невеликій вибірці дописів із білонаціоналістичного форуму й для окремих категорій отримали низькі значення precision та recall. Цей результат не є універсальною оцінкою LIWC для всіх корпусів, але добре демонструє принцип: на спеціалізованому матеріалі словник треба валідизувати саме для свого домену. Hunter & Grant (2025).


Ще одне джерело похибки — одиниця аналізу. Показник, обчислений для одного речення, повідомлення, повного інтерв’ю або року дописів однієї людини, відповідає на різні дослідницькі питання. Об’єднання текстів може стабілізувати частоти, але водночас стерти часові зміни. Розбиття на надто дрібні фрагменти підвищує випадкову мінливість.


LIWC українською


Станом на вересень 2026 року офіційний репозиторій LIWC прямо перелічує українську серед мов, для яких доступні перекладені версії словників. Водночас сам репозиторій уточнює, що значна частина неангломовних перекладів стосується попередніх поколінь LIWC — передусім 2007 і 2015 років. Отже, словосполучення «український LIWC» завжди потребує уточнення: яка саме версія словника, хто її створив, для яких категорій і на якому корпусі її перевіряли. LIWC Dictionary Repository.


Для української це особливо важливо через морфологію та культурну специфіку лексики. У 2018 році Сергій Засєкін та співавтори дослідили, як українською відтворювати вибрані елементи словника LIWC2015. Автори показали, що буквального перекладу недостатньо: потрібні диференціація, конкретизація, генералізація, експлікація, адаптація та інші перекладацькі рішення з урахуванням семантики й культури. Це дослідження стосується вибраних елементів LIWC2015 і не є доказом автоматичної психометричної еквівалентності всіх категорій для будь-якого українського корпусу. Засєкін та ін. (2018).


Ширша міжмовна методологія підтверджує цей висновок. Kučera і Mehl показують, що перенесення психологічного текстового аналізу між мовами потребує врахування не лише лексичного перекладу, а й граматики, культурних норм і ситуаційного контексту. Валідність англомовної категорії не переходить до іншої мови автоматично. Kučera & Mehl (2022).


Чи можна створити власний словник


Так. LIWC-22 має Dictionary Workbench, у якому можна створювати власні словники, редагувати категорії й оцінювати їх на конкретному корпусі. Це корисно для українських або вузькодоменних досліджень, але сам факт створення словника ще не робить його валідним психологічним інструментом. Потрібно перевіряти охоплення лексики, внутрішню узгодженість, стабільність між корпусами та зв’язок із зовнішніми критеріями. LIWC Dictionary Workbench.


Найсильніша практика — спочатку сформулювати конструкт, потім визначити словникові правила, перевірити, які саме слова найбільше формують показник, і провести ручний аудит випадкової вибірки збігів. Якщо кілька слів створюють більшу частину ефекту, дослідник має знати це до психологічної інтерпретації.


LIWC, машинне навчання та великі мовні моделі


LIWC належить до словникових, або closed-vocabulary, методів. Машинне навчання й сучасні мовні моделі можуть враховувати ширший контекст і нелінійні зв’язки між словами, але натомість часто складніше пояснити, чому модель дала певний результат. У психологічному дослідженні це не вибір між «старим» і «новим» інструментом: метод обирають відповідно до гіпотези, даних, вимог до інтерпретованості та можливості незалежного відтворення. Огляд поля природномовного аналізу описує словникові й обчислювальні підходи як різні рівні одного методологічного простору. Boyd & Schwartz (2021).


LIWC можна застосовувати і до діалогів людини з генеративним AI: окремо аналізувати репліки людини, відповіді моделі або динаміку діалогу. Проте мовний профіль відповіді AI описує властивості тексту. Навіть якщо модель часто використовує слова з категорій емоцій, близькості чи самореференції, це не є доказом того, що система має відповідні почуття, свідомість або суб’єктивний досвід.


Чи можна за LIWC діагностувати людину


Ні. LIWC може виявляти статистичні асоціації між мовними ознаками та психологічними змінними на рівні дослідження, але окремий показник не встановлює клінічний діагноз. Показовий приклад — вживання займенників першої особи однини. Метааналіз 21 вибірки із загальною кількістю 3758 учасників виявив невеликий зв’язок між частішим уживанням таких займенників і депресивністю: r = 0,13. Навіть статистично надійний груповий зв’язок такого розміру не дозволяє визначати депресію за одним мовним маркером в окремої людини. Edwards & Holtzman (2017).


Те саме стосується тривоги, суїцидального ризику, психозу, рис особистості, травматичного досвіду чи «щирості». Для клінічних висновків потрібні валідовані інструменти оцінювання, анамнез, контекст, професійна діагностика та, коли потрібно, медичне обстеження. Мовний аналіз може бути дослідницькою ознакою або частиною багатомодальної системи, але не заміною клінічного рішення.


Чи є LIWC детектором брехні


LIWC використовували в дослідженнях правдивих і неправдивих повідомлень, однак він не є детектором брехні. Відмінності між групами текстів не перетворюються на універсальне правило для конкретного автора. Жанр, мотивація, підготовленість, тема, рідна мова, довжина тексту та спосіб отримання повідомлення можуть змінювати ті самі мовні показники. Для високоризикових рішень — юридичних, кадрових, безпекових чи клінічних — автоматичний словниковий профіль не повинен трактуватися як доказ обману.


Як правильно використовувати LIWC у дослідженні


Сильний дизайн починається не з запуску програми, а з гіпотези. Дослідник спочатку визначає, який психологічний конструкт його цікавить і чому саме певні мовні категорії мають бути з ним пов’язані. Далі обирається версія LIWC і словника, мова та одиниця аналізу. Версію словника слід фіксувати в методах дослідження, тому що категорії між поколіннями LIWC змінювалися.


Наступний крок — підготовка корпусу. Треба заздалегідь вирішити, як поводитися з цитатами, посиланнями, емодзі, транскрипційними позначками, дублями, системними повідомленнями та текстами різної довжини. Для української слід окремо перевірити, чи словник коректно покриває відмінювання, словотвір і лексику конкретного домену.


Після розрахунку показників корисно виконати ручний аудит: переглянути приклади спрацьовувань у категоріях, що мають найбільше значення для висновку. Потім статистичну модель варто перевірити на стійкість до довжини тексту, жанру та інших конфаундерів. Якщо аналіз містить десятки категорій, потрібно враховувати проблему множинних порівнянь і не вибирати постфактум лише ті змінні, що дали бажаний результат.


У звіті потрібно вказувати версію LIWC, конкретний словник і його мову, спосіб сегментації корпусу, критерії виключення текстів, одиницю аналізу та статистичну процедуру. Для власного або перекладеного словника слід описати процес створення й валідації. Психометричний посібник LIWC-22 містить документацію, з якою доцільно зіставляти власну процедуру.


FAQ


LIWC — це програма чи метод


І те, й інше. LIWC — це назва програмної системи та усталеної словникової методології аналізу мови. У науковій статті варто вказувати конкретну версію програмного забезпечення та словника.


Чи аналізує LIWC значення речення


Частково й опосередковано. LIWC фіксує категорії мовних одиниць, але класичний словниковий підхід не відтворює повну композиційну семантику кожного речення. Саме тому контекст, іронія, полісемія та заперечення потребують додаткової перевірки.


Чи можна аналізувати українські тексти


Так, але потрібно точно знати, який український словник використовується і для якої версії LIWC він створений. Офіційний репозиторій містить українську серед доступних перекладених словників, а українські дослідники окремо описували проблеми адаптації LIWC2015. Переклад словника слід розглядати як методологічний проєкт із власною валідацією, а не як механічну заміну англійських слів українськими.


Чи показує LIWC справжні емоції людини


LIWC показує частоту мовних категорій, пов’язаних з емоціями та іншими психологічними процесами. Це може бути інформативним індикатором у дослідженні, але не прямим вимірюванням внутрішнього переживання.


Чи існує мінімальна довжина тексту


Універсального порогу для всіх досліджень немає. Надійність залежить від категорії, жанру та одиниці аналізу. Офіційна документація LIWC радить із підвищеною обережністю ставитися до текстів коротших приблизно за 25–50 слів; для стабільних частот більші корпуси зазвичай кращі.


Чим LIWC відрізняється від sentiment analysis


Sentiment analysis зазвичай зосереджується на валентності або класах на кшталт позитивного, негативного й нейтрального тону. LIWC охоплює значно ширший набір лінгвістичних, соціальних і психологічних категорій, включно з функціональними словами та займенниками. Обидва підходи можуть бути словниковими, але відповідають на різні питання.


Пов’язані статті







References










 
 
bottom of page