Graphite знайшла 13 000 фраз, які ШІ вживає частіше за людей

Graphite виявила 13 000 фраз, які мовні моделі вживають щонайменше вдвічі частіше за людей. Список допоможе вичитувати тексти, створені за допомогою ШІ, але не визначить авторство окремої статті.

· 4 хв читання · 4 коментарі

Згідно з дослідженням Graphite, про яке 3 жовтня 2026 року повідомив «Хабр», мовні моделі вживають 13 000 фраз щонайменше вдвічі частіше, ніж люди в текстах для порівняння. У кожної моделі виявилися свої характерні звороти, а в різних версіях вони змінюються. Такий список корисний для вичитування тексту, підготовленого за допомогою ШІ, але не є тестом на авторство окремої статті.

Як Graphite порівнювала тексти

Контрольною групою стали 10 000 статей, опублікованих до виходу ChatGPT. Дослідники підготували анотації до цих матеріалів і попросили різні моделі написати на їхній основі нові тексти. Так вони прагнули зменшити вплив вихідних формулювань на результат: моделі отримували тему статті, а не готовий текст для перероблення.

Потім Graphite зіставила тексти, написані людьми, зі згенерованими зразками. Дослідників цікавило, як часто в них трапляються окремі слова й фрази, а також як будуються речення. Цифри показують відмінності між групами текстів у цьому порівнянні. Вони не означають, що будь-який зі знайдених зворотів властивий лише ШІ чи дає змогу встановити походження конкретної публікації.

У дослідженні порівнювали не лише моделі між собою, а й версії однієї моделі. Це важливо для розуміння результату: звичка, помітна в одній версії, може послабшати в наступній, а замість неї з’явиться інша. За оцінкою Graphite, загальна кількість характерних ознак при цьому здебільшого залишається стабільною.

Слова, протиставлення й довге тире

У Claude Opus 5.5 найхарактернішим словом виявилося «надійний»: у зразках моделі воно траплялося у 23 рази частіше, ніж у текстах, написаних людьми. Opus 5.5 почала уникати схеми «це не X, це Y», але зберегла схожий спосіб підсилювати тезу — «більше ніж X, це Y».

Модель також часто підкреслювала важливість сказаного. Формулювання «це важливо» траплялося в її текстах у 116 разів частіше, ніж у прикладах, написаних людьми, а варіант «чому X важливо» — у 92 рази частіше. Ці числа стосуються частоти конкретних фраз у досліджених зразках, а не оцінки того, наскільки корисним вийшов текст.

В Astra від OpenAI дослідники виокремили інший набір конструкцій. Вона частіше вводила уточнення через «не просто X» або протиставляла підходи словами «замість того щоб покладатися на X». За підрахунками Graphite, такі формулювання траплялися в Astra більш ніж у 100 разів частіше, ніж у текстах, написаних людьми, які взяли для порівняння. Модель також схильна говорити про «інший вимір» теми й описувати можливу користь зворотом «може забезпечити», не даючи прямої відповіді.

Частота вживання довгого тире теж різниться між моделями та версіями. У зразках Claude Opus 5.5 цей знак траплявся на 99% рідше, ніж в Opus 5. Astra використовувала його на 88% рідше, ніж люди в контрольній групі, а Gemini 3.1 Pro майже перестала його використовувати. Graphite фіксує ці зміни, але самі цифри не дають змоги встановити, чому вони відбулися.

Головний фахівець Graphite зі штучного інтелекту Грег Друк повідомив про відмінність у розподілі слів: за його оцінкою, моделі Claude з часом наближаються до текстів, написаних людьми, а моделі GPT віддаляються від них. Це спостереження стосується розподілу слів, а не загальної якості відповідей.

Під час випуску Opus 5.5 Anthropic заявляла, що модель спілкується природніше за попередні версії. OpenAI під час випуску Sol і Luna на основі GPT-6 теж говорила про більшу ясність, меншу кількість жаргону й незвичних зворотів. Ці заяви не тотожні результатам частотного порівняння: зрозумілий читачеві текст усе ще може містити повторювані конструкції. Друк сумнівається, що лабораторіям вдасться повністю позбутися таких особливостей: на його думку, можливості перевірки великих моделей обмежені.

Як застосувати результати до контенту сайту

Я б використовував дані Graphite як привід перечитати матеріал, підготовлений за допомогою ШІ, а не як список заборонених слів. Якщо на кількох сторінках повторюються однакові пояснення важливості теми або та сама схема протиставлення, можна перевірити, чи є за ними конкретний зміст для читача. Це застосування результатів у редакційній роботі, а не рекомендація самих дослідників: Graphite порівнювала тексти, але не вивчала якість сайтів і не пропонувала правил публікації.

Моя думка

Я б не намагався визначати автора за довгим тире чи однією впізнаваною фразою. У досліджених зразках частота вживання тире помітно різнилася навіть між версіями моделей. Його відсутність, на мою думку, нічого не доводить.

Під час вичитування мені корисніше шукати повтори й перевіряти, що саме повідомляє кожен абзац. Можна прибрати типовий зворот і залишити ту саму неясну думку. Тому спершу я б розібрався зі змістом, а вже потім редагував формулювання.

Джерела

Звідки новина. Текст — переказ своїми словами, факти — з джерела, думка — автора.

  1. Исследователи изучили языковые привычки Opus 5.5 и других моделей habr.com

Про автора

Максим Р.

студент фронтенд-розробки

Вчуся верстати й збираю невеликі сторінки для портфоліо. Зараз розбираюся з адаптивністю й намагаюся не копіювати рішення, поки не зрозумів, чому воно працює.

Усі публікації автора

SEO 4 хв читання

Google оновив рекомендації щодо ШІ-контенту: що перевірити перед публікацією

Google оновив рекомендації щодо ШІ-контенту: перед публікацією тексти потрібно перевіряти на фактичні помилки й редагувати. Що це означає для редакцій і власників сайтів.

SEO 3 хв читання

Google пояснила частіші спам-оновлення зростанням обсягу контенту

Google пояснила, що частіше випускає спам-оновлення через зростання обсягу контенту та використання ШІ для виявлення спаму. Власникам сайтів радять оцінювати якість окремих сторінок.

SEO 4 хв читання

Google попередив власників сайтів про вигаданих авторів контенту

Google додав попередження про вигаданих авторів до рекомендацій для власників сайтів. Редакціям варто перевірити імена, фотографії та відомості про кваліфікацію авторів.

Написати коментар

Не публікується. Надішлемо посилання, щоб підтвердити коментар.

Без посилань і реклами. Перший коментар публікується після перевірки. Надсилаючи коментар, ви погоджуєтеся з політикою конфіденційності.

  1. Я б обережно ставилася до порівняння, де моделям дають анотації до старих статей, а потім рахують характерні фрази: тут важливо, наскільки ці анотації самі задають структуру й тон майбутнього тексту. Якщо в підказці вже закладено типовий план, модель може відтворювати не стільки власний «почерк», скільки формат завдання. Чи перевіряла Graphite, як змінюється список фраз, якщо ті самі теми задавати моделям без анотацій, лише коротким брифом?

    1. Максим Р. Автор публікації

      у публікації не вказано, чи Graphite повторювала такий тест із коротким брифом без анотацій. тож структура підказки справді могла вплинути на список, і це варто враховувати як обмеження методики

  2. Не зовсім погоджуюся, що список із 13 000 фраз сам по собі добре допоможе вичитувати ШІ-текст: частотність ще не означає, що фразу варто прибирати. Довге тире чи певне протиставлення можуть бути нормальною частиною авторського голосу, а ще результат залежить від жанру й того, які саме тексти порівнювали. Я б використовувала ці маркери лише як привід перечитати абзац, а не як список заборонених зворотів.

    1. Так, сприймати ці 13 000 фраз як стоп-лист було б помилкою: дослідження порівнювало конкретні жанри й моделі, а тире чи протиставлення цілком можуть бути частиною авторського голосу. Для контенту сайту я б використовував такі маркери лише як сигнал перечитати абзац і перевірити, чи він справді корисний читачеві та працює на конверсію.