XRUST.ru » Технологии » ИИ оставляет следы на каждой десятой англоязычной странице
Технологии / Новости

ИИ оставляет следы на каждой десятой англоязычной странице

Сегодня, 06:00 14 0 0

Исследовательский центр Pew обнаружил статистические признаки возможного ИИ-авторства примерно у 10% случайно выбранных англоязычных веб-страниц. Среди материалов, опубликованных после запуска ChatGPT в ноябре 2022 года, доля таких страниц превысила треть. При этом исследователи подчёркивают: выявленные закономерности не доказывают, что конкретный текст написал искусственный интеллект.

Как Pew искал признаки машинного текста

Для анализа специалисты изучили около 500 000 страниц из архива Common Crawl. В выборку попали англоязычные материалы, опубликованные с января 2021 года по июль 2026 года.

Статистические признаки возможного ИИ-авторства искали с помощью системы Open Pangram. Она анализирует не содержание текста в привычном смысле, а повторяющиеся языковые закономерности: выбор слов, пунктуацию и особенности оформления фраз. Такие признаки могут указывать на машинное происхождение материала, но не позволяют вынести безошибочный вердикт по отдельной странице.

После запуска ChatGPT в ноябре 2022 года доля страниц с подобными признаками заметно выросла. Среди публикаций, появившихся позднее этой даты, такие особенности обнаружили более чем у каждой третьей страницы.

На коммерческих сайтах ИИ встречается чаще

Самый высокий показатель исследователи получили для доменной зоны .com. Статистические признаки возможного машинного авторства нашли примерно у 10% страниц.

  • .com — около 10% страниц;
  • .org — 4,6%;
  • .edu — около 1%;
  • .gov — около 1%.

Таким образом, материалы в зоне .com заметно чаще демонстрировали языковые особенности, которые Open Pangram связывает с использованием ИИ. Для сайтов общественных организаций, образовательных учреждений и государственных структур показатель оказался ниже.

Однако эти цифры описывают не всех авторов и не каждый опубликованный текст. Речь идёт о случайной выборке англоязычных веб-страниц из Common Crawl, а сами значения показывают распространённость определённых статистических признаков.

Какие особенности стали встречаться чаще

Pew отдельно проследил изменения в пунктуации и оформлении английских текстов. С 2023 года длинные тире стали использоваться в онлайн-публикациях вдвое чаще, чем раньше.

Ещё один заметный сдвиг связан с Oxford comma — запятой перед последним элементом английского перечисления. Её использование выросло на 63%. Подобные изменения могут быть связаны с распространением генеративных сервисов, поскольку ИИ-модели часто воспроизводят устойчивые стилистические шаблоны.

При этом длинное тире или Oxford comma сами по себе ничего не доказывают. Эти знаки препинания используют и люди, а отдельная языковая привычка не может служить надёжным доказательством машинного авторства.

Почему статистика не даёт окончательного ответа

Open Pangram предназначена для поиска закономерностей в больших массивах данных. Система может оценить, насколько текст похож на материалы с определёнными признаками ИИ-генерации, но не способна безошибочно установить происхождение конкретной публикации.

На результаты влияют редакторская правка, перевод, шаблоны сайтов и индивидуальный стиль автора. Человек мог отредактировать текст, созданный нейросетью, а авторская публикация, наоборот, может случайно совпасть с языковыми паттернами, которые система считает характерными для ИИ.

Другие исследования дают более высокие оценки. Например, исследование Graphite оценивало долю ИИ-текстов среди новых публикаций почти в половину. Pew при этом разделяет два показателя: распространённость машинного текста и его видимость в интернете.

Материалы, написанные людьми, по-прежнему чаще попадают в результаты Google и ссылки ИИ-сервисов. Это означает, что наличие ИИ-текстов в вебе не равно их доминированию в поисковой выдаче. Сколько таких материалов публикуется и какие из них видят пользователи, — разные вопросы.

Xrust: ИИ оставляет следы на каждой десятой англоязычной странице

ИИ, технологии, интернет, ChatGPT, исследования

Поделится
0 0

Комментарии


Первый FM-эфир с высоты 30 км: стратосферное радио над Арктикой
Российский хостинг-провайдер RUVDS сообщил об эксперименте по FM-радиовещанию со стратосферной платформы в Арктике. Передатчик подняли на высоту более 30 км и провели сеанс вещания в общедоступном FM-диапазоне, который принимают бытовые УКВ-радиоприёмники. FM-вещание со стратосферной платформы По данным RUVDS, платформу запустили в районе Северного полюса. После подъёма на высоту свыше 30 км оборудование передавало сигнал в FM-диапазоне. Организаторы заявили, что использовали не специализированный канал спутниковой или профессиональной связи, а диапазон для обычных радиоприёмников. Также участники проекта назвали эксперимент первым подобным опытом вещания из стратосферы для бытовых FM-приёмников. Испытания в Арктике Выбор арктической площадки организаторы объяснили низким уровнем радиопомех и отсутствием плотной наземной инфраструктуры. В проекте участвовали RUVDS, «Стратонавтика», Мурманский арктический университет, «Росатом» и радио «Маяк». Участники проверяли работу оборудования на
118 2