Дослідники назвали слова й фрази, за якими можна впізнати тексти ШІ.

Різні моделі штучного інтелекту мають власний мовний «почерк», який дозволяє відрізнити їхні тексти від написаних людьми. Дослідники виявили тисячі слів, фраз і конструкцій, які окремі ШІ-моделі використовують набагато частіше за людей.
Про це повідомляє TechCrunch із посиланням на дослідження маркетингової компанії Graphite, фахівці якої проаналізували особливості письма популярних моделей штучного інтелекту.
Водночас старі ознаки ШІ-текстів поступово втрачають актуальність. Наприклад, надмірне використання довгого тире або слова delve вже не є настільки надійними показниками, як раніше. Розробники намагаються усувати найбільш очевидні мовні шаблони, але натомість у моделей з'являються інші характерні особливості.
Дослідники знайшли тисячі характерних фраз
Graphite називала мовною ознакою фразу, яка у текстах, створених ШІ, зустрічалася щонайменше вдвічі частіше, ніж у людських матеріалах. За цим критерієм дослідникам вдалося знайти близько 13 тисяч характерних фраз.
Для порівняння вони використали 10 тисяч статей, опублікованих до появи ChatGPT. Це дозволило сформувати вибірку текстів, які точно не створювалися за допомогою сучасних генеративних моделей.
Потім ті самі матеріали запропонували переписати різним ШІ-моделям. Перед цим системам надавали короткий переказ оригінальної статті. Такий метод мав зменшити вплив початкового тексту й дозволити дослідникам зосередитися саме на стилі конкретної моделі.
Після цього фахівці порівняли людські тексти з матеріалами, створеними різними моделями, та визначили слова, фрази й конструкції, які використовуються найчастіше.
Які слова характерні для Claude
Дослідження показало, що мовні звички можуть сильно відрізнятися не лише між різними розробниками, а й між версіями моделей однієї компанії.
Наприклад, для Claude Opus 5.5 однією з характерних особливостей стало слово dependable — «надійний». У текстах цієї моделі воно використовувалося у 23 рази частіше, ніж у матеріалах, написаних людьми.
Ще більш помітною виявилася схильність Claude підкреслювати значущість певної інформації. Фраза this matters — «це важливо» — зустрічалася у текстах моделі у 116 разів частіше, ніж у людських текстах. Конструкцію why X matters — «чому X важливе» — модель використовувала у 92 рази частіше.
Водночас новіша версія Claude стала значно рідше застосовувати популярну конструкцію «це не X, а Y». Замість неї модель частіше використовує інші способи протиставлення, зокрема формулювання про те, що певне явище «є більшим, ніж X, — це Y».
Головний директор Graphite з питань ШІ Грег Друк зазначив у коментарі TechCrunch, що мовна поведінка моделей змінюється з часом. За його словами, Claude поступово наближається до частоти використання слів, характерної для людського письма.
Astra також має власний «почерк»
Окремі мовні особливості дослідники виявили у моделі Astra від OpenAI.
За даними Graphite, вона часто описує «ще один вимір» певної проблеми та використовує обережні формулювання на кшталт may provide або can provide, які можна перекласти як «може забезпечити» чи «може принести».
Для Astra також характерні так звані коригувальні конструкції. Наприклад, модель може описувати щось як «не просто X» або протиставляти один підхід іншому за схемою «замість того, щоб покладатися на X».
Такі конструкції у текстах Astra зустрічалися більш ніж у 100 разів частіше, ніж у матеріалах, написаних людьми.
Це вказує на те, що мовний стиль ШІ визначається не лише окремими словами. Моделі можуть мати власні набори способів побудови речень, пояснення думок і формування аргументів.
Довге тире більше не є надійною ознакою
Одним із найвідоміших способів визначити текст, створений ШІ, тривалий час вважалося надмірне використання довгого тире. Однак дослідження Graphite показує, що ця особливість поступово зникає.
Наприклад, Opus 5.5 використовував довгі тире на 99% рідше, ніж попередня версія Opus 5. Astra — на 88% рідше, ніж люди у контрольній вибірці. Gemini 3.1 Pro майже повністю відмовилася від цього розділового знака.
Проте це не означає, що моделі втратили характерний стиль. Навпаки, найбільш помітні особливості поступово замінюються іншими.
«Не можна сказати, що ознак стає менше. Їм вдається прибирати найвідоміші, але з’являються інші. І в кожної версії моделі є власні», — сказав Друк TechCrunch.
Чому ШІ складно позбутися характерного стилю
Попри зусилля розробників зробити відповіді штучного інтелекту більш природними, повністю прибрати характерні мовні особливості моделей виявляється складно.
Anthropic під час презентацій нових версій Claude наголошувала на покращенні природності спілкування, зрозумілості та легкості сприйняття відповідей. OpenAI також заявляла про прагнення зробити нові моделі більш чіткими, зменшити кількість жаргону та незвичних мовних конструкцій.
Однак повністю контролювати мовну поведінку великих моделей непросто. Сучасні системи містять мільярди параметрів, а перевірити всі можливі варіанти їхньої роботи неможливо.
«Це гігантські моделі з мільярдами параметрів. Вони можуть провести лише скінченну кількість тестів, і дещо прослизає», — пояснив Друк.
Отже, навіть коли розробники прибирають найбільш очевидні ознаки ШІ-текстів, на їхньому місці можуть з'являтися нові. Це означає, що визначення авторства тексту лише за окремими словами чи розділовими знаками залишається складним завданням.
Мітки: безпечний інтернет, штучний інтелект, ШІ