Исследовательский центр Pew обнаружил статистические признаки возможного ИИ-авторства примерно у 10% случайно выбранных англоязычных веб-страниц. Среди материалов, опубликованных после запуска ChatGPT в ноябре 2022 года, доля таких страниц превысила треть. При этом исследователи подчёркивают: выявленные закономерности не доказывают, что конкретный текст написал искусственный интеллект.
Для анализа специалисты изучили около 500 000 страниц из архива Common Crawl. В выборку попали англоязычные материалы, опубликованные с января 2021 года по июль 2026 года.
Статистические признаки возможного ИИ-авторства искали с помощью системы Open Pangram. Она анализирует не содержание текста в привычном смысле, а повторяющиеся языковые закономерности: выбор слов, пунктуацию и особенности оформления фраз. Такие признаки могут указывать на машинное происхождение материала, но не позволяют вынести безошибочный вердикт по отдельной странице.
После запуска ChatGPT в ноябре 2022 года доля страниц с подобными признаками заметно выросла. Среди публикаций, появившихся позднее этой даты, такие особенности обнаружили более чем у каждой третьей страницы.
Самый высокий показатель исследователи получили для доменной зоны .com. Статистические признаки возможного машинного авторства нашли примерно у 10% страниц.
Таким образом, материалы в зоне .com заметно чаще демонстрировали языковые особенности, которые Open Pangram связывает с использованием ИИ. Для сайтов общественных организаций, образовательных учреждений и государственных структур показатель оказался ниже.
Однако эти цифры описывают не всех авторов и не каждый опубликованный текст. Речь идёт о случайной выборке англоязычных веб-страниц из Common Crawl, а сами значения показывают распространённость определённых статистических признаков.
Pew отдельно проследил изменения в пунктуации и оформлении английских текстов. С 2023 года длинные тире стали использоваться в онлайн-публикациях вдвое чаще, чем раньше.
Ещё один заметный сдвиг связан с Oxford comma — запятой перед последним элементом английского перечисления. Её использование выросло на 63%. Подобные изменения могут быть связаны с распространением генеративных сервисов, поскольку ИИ-модели часто воспроизводят устойчивые стилистические шаблоны.
При этом длинное тире или Oxford comma сами по себе ничего не доказывают. Эти знаки препинания используют и люди, а отдельная языковая привычка не может служить надёжным доказательством машинного авторства.
Open Pangram предназначена для поиска закономерностей в больших массивах данных. Система может оценить, насколько текст похож на материалы с определёнными признаками ИИ-генерации, но не способна безошибочно установить происхождение конкретной публикации.
На результаты влияют редакторская правка, перевод, шаблоны сайтов и индивидуальный стиль автора. Человек мог отредактировать текст, созданный нейросетью, а авторская публикация, наоборот, может случайно совпасть с языковыми паттернами, которые система считает характерными для ИИ.
Другие исследования дают более высокие оценки. Например, исследование Graphite оценивало долю ИИ-текстов среди новых публикаций почти в половину. Pew при этом разделяет два показателя: распространённость машинного текста и его видимость в интернете.
Материалы, написанные людьми, по-прежнему чаще попадают в результаты Google и ссылки ИИ-сервисов. Это означает, что наличие ИИ-текстов в вебе не равно их доминированию в поисковой выдаче. Сколько таких материалов публикуется и какие из них видят пользователи, — разные вопросы.
Xrust: ИИ оставляет следы на каждой десятой англоязычной странице