Graphite нашла 13 000 фраз, которые ИИ использует чаще людей
Graphite выявила 13 000 фраз, которые языковые модели используют как минимум вдвое чаще людей. Список поможет вычитывать ИИ-тексты, но не определит авторство отдельной статьи.
Согласно исследованию Graphite, о котором 3 октября 2026 года сообщил «Хабр», языковые модели используют 13 000 фраз как минимум вдвое чаще, чем люди в текстах для сравнения. У каждой модели обнаружились свои характерные обороты, а у разных версий они меняются. Такой список полезен при вычитке текста, подготовленного с помощью ИИ, но не служит тестом на авторство отдельной статьи.
Как Graphite сравнивала тексты
Контрольной группой стали 10 000 статей, опубликованных до выпуска ChatGPT. Исследователи подготовили аннотации этих материалов и попросили разные модели написать на их основе новые тексты. Так они стремились уменьшить влияние исходных формулировок на результат: модели получали тему статьи, а не готовый текст для переработки.
Затем Graphite сопоставила человеческие и сгенерированные образцы. Исследователей интересовало, насколько часто в них встречаются отдельные слова и фразы, а также как строятся предложения. Цифры показывают различия между группами текстов в этом сравнении. Они не означают, что любой из найденных оборотов принадлежит только ИИ или позволяет установить происхождение конкретной публикации.
В исследовании сравнивали не только модели между собой, но и версии одной модели. Это важно для понимания результата: привычка, заметная в одной версии, может ослабнуть в следующей, а вместо неё появится другая. По оценке Graphite, общее число характерных признаков при этом в основном остаётся стабильным.
Слова, противопоставления и длинное тире
У Claude Opus 5.5 самым характерным словом оказалось «надёжный»: в образцах модели оно встречалось в 23 раза чаще, чем в человеческих текстах. Opus 5.5 стала избегать схемы «это не X, это Y», но сохранила похожий способ усиливать тезис — «больше, чем X, это Y».
Модель также часто подчёркивала значимость сказанного. Формулировка «это важно» встречалась у неё в 116 раз чаще, чем в человеческих примерах, а вариант «почему X важно» — в 92 раза чаще. Эти числа относятся к частоте конкретных фраз в исследованных образцах, а не к оценке того, насколько полезным получился текст.
У Astra от OpenAI исследователи выделили другой набор конструкций. Она чаще вводила уточнение через «не просто X» или противопоставляла подходы словами «вместо того чтобы полагаться на X». По подсчётам Graphite, такие формулировки встречались у Astra более чем в 100 раз чаще, чем в человеческих текстах для сравнения. Модель также склонна говорить о «другом измерении» темы и описывать возможную пользу через оборот «может обеспечить», не давая прямого ответа.
Частота длинного тире тоже различается между моделями и версиями. В образцах Claude Opus 5.5 этот знак встречался на 99% реже, чем у Opus 5. Astra использовала его на 88% реже, чем люди в контрольной группе, а Gemini 3.1 Pro почти перестала его использовать. Graphite фиксирует эти изменения, но по самим цифрам нельзя установить, почему они произошли.
Главный специалист Graphite по искусственному интеллекту Грег Друк сообщил о различии в распределении слов: по его оценке, модели Claude со временем приближаются к человеческим текстам, а модели GPT отдаляются от них. Это наблюдение касается распределения слов, а не общего качества ответов.
Anthropic при выпуске Opus 5.5 заявляла, что модель общается естественнее предыдущих версий. OpenAI при выпуске Sol и Luna на основе GPT-6 тоже говорила о большей ясности, меньшем количестве жаргона и необычных оборотов. Эти заявления не равны результатам частотного сравнения: понятный читателю текст всё ещё может содержать повторяющиеся конструкции. Друк сомневается, что лабораториям удастся полностью избавиться от таких особенностей: по его мнению, возможности проверки больших моделей ограничены.
Как применить результаты к контенту сайта
Я бы использовал данные Graphite как повод перечитать материал, подготовленный с помощью ИИ, а не как список запрещённых слов. Если на нескольких страницах повторяются одинаковые объяснения важности темы или одна и та же схема противопоставления, можно проверить, есть ли за ними конкретный смысл для читателя. Это применение результатов к редакционной работе, а не рекомендация самих исследователей: Graphite сравнивала тексты, но не изучала качество сайтов и не предлагала правил публикации.
Моё мнение
Я бы не пытался определять автора по длинному тире или одной узнаваемой фразе. В исследованных образцах частота тире заметно различалась даже между версиями моделей. Его отсутствие, на мой взгляд, ничего не доказывает.
При вычитке мне полезнее искать повторы и проверять, что именно сообщает каждый абзац. Можно убрать типичный оборот и оставить ту же неясную мысль. Поэтому сначала я бы разобрался со смыслом, а уже потом правил формулировки.
Источники
Откуда новость. Текст — пересказ своими словами, факты — из источника, мнение — автора.
студент фронтенд-разработки
Учусь верстать и собираю небольшие страницы для портфолио. Сейчас разбираюсь с адаптивностью и стараюсь не копировать решение, пока не понял, почему оно работает.
Все публикации автораПохожие статьи
Google обновил рекомендации по ИИ-контенту: что проверить перед публикацией
Google обновил рекомендации по ИИ-контенту: перед публикацией тексты нужно проверять на фактические ошибки и редактировать. Что это значит для редакций и владельцев сайтов.
Google объяснила частые спам-обновления ростом объёма контента
Google объяснила, что чаще выпускает спам-обновления из-за роста объёма контента и использования ИИ для поиска спама. Владельцам сайтов советуют оценивать качество отдельных страниц.
Google предупредил владельцев сайтов о вымышленных авторах контента
Google добавил предупреждение о вымышленных авторах в рекомендации для владельцев сайтов. Редакциям стоит проверить имена, фотографии и сведения о квалификации авторов.
Обсуждение 4
Халина Урсу
А сравнивали ли частоту этих фраз с текстами тех же авторов после выпуска ChatGPT, чтобы отделить стиль модели от изменений в человеческом письме?
Максим Р. Автор публикации
В описании методики такого сравнения нет: контроль — статьи до ChatGPT, а не тексты тех же авторов после его выхода. Поэтому отделить сдвиг в человеческом письме от модельного эффекта по этим данным нельзя.
Росио Гил
Тут ещё важно, что контрольная группа — статьи до ChatGPT, а не тексты тех же авторов в разные периоды. Поэтому интересно, проверяли ли исследователи, как менялись привычные обороты у людей после появления чат-ботов?
Дениз Захидова
Не уверена, что сравнение тех же авторов до и после ChatGPT отделило бы влияние моделей: за это время меняются темы, редакционные правила и привычки письма. Но это полезная дополнительная проверка — особенно если отделить авторов, которые пользуются чат-ботами, от тех, кто ими не пользуется.