ШІ видають характерні слова й фрази: дослідники знайшли 13 тисяч мовних ознак

Різні моделі штучного інтелекту мають власні мовні звички, за якими їхні тексти можна відрізняти від людських і навіть між собою. Дослідники Graphite виявили близько 13 тисяч слів, фраз і конструкцій, які окремі системи використовують помітно частіше за людей.

Для порівняння дослідники сформували контрольну вибірку з 10 тисяч статей, опублікованих ще до появи ChatGPT. Потім ті самі тексти запропонували переписати різним моделям ШІ на основі коротких переказів.

Ознакою вважали фразу, яка зустрічалася у текстах ШІ щонайменше вдвічі частіше, ніж у людських. За таким критерієм і вдалося знайти приблизно 13 тисяч характерних конструкцій.

Окремі моделі демонстрували дуже помітні мовні звички. Наприклад, Claude Opus 5.5 використовував слово dependable у 23 рази частіше за людей.

Ще сильніше виділялися конструкції this matters та why X matters. Перша траплялася у 116 разів частіше, а друга — у 92 рази частіше, ніж у контрольній вибірці людських текстів.

При цьому новіші версії Claude вже рідше використовують конструкцію «це не X, а Y». Натомість з’являються інші способи будувати контраст і пояснювати значення певної теми.

У Astra від OpenAI дослідники побачили інший набір особливостей. Модель часто використовувала формулювання на кшталт «ще один вимір», а також конструкції may provide і can provide.

Особливо характерними для неї стали коригувальні фрази за схемою «не просто X» або «замість того, щоб покладатися на X». За даними Graphite, такі конструкції траплялися більш ніж у 100 разів частіше, ніж у людських текстах.

При цьому одна з найвідоміших старих ознак ШІ — надмірне використання довгого тире — поступово зникає. Opus 5.5 застосовував його на 99% рідше, ніж попередня версія, а Astra — на 88% рідше, ніж люди з контрольної групи.

Gemini 3.1 Pro, за даними дослідників, майже повністю відмовилася від цього розділового знака. Однак це не означає, що моделі перестали мати впізнаваний стиль.

Головний директор Graphite з питань ШІ Грег Друк пояснив, що розробники прибирають найвідоміші ознаки, але на їхньому місці з’являються інші. Кожна нова версія моделі фактично отримує власний набір характерних мовних рис.

Розробники водночас намагаються робити відповіді систем природнішими. Anthropic заявляла про більш зрозумілу й легку мову Claude, а OpenAI — про меншу кількість жаргону та незвичних конструкцій у нових моделях.

Повністю прибрати мовний «почерк» поки не вдається. За словами Друка, сучасні моделі мають мільярди параметрів, а кількість можливих варіантів тексту настільки велика, що перевірити кожен із них неможливо.



🌟 Читайте «Експерт» у своєму смартфоні — додайте нас в Google Discover

Від player

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *