Развитие автоматизированных систем выявления машинно-сгенерированного текста (детекторы ИИ) постепенно изменяет представление о том, какие именно языковые характеристики могут использоваться при ИИ-детекции - однозначный вывод - набор таких маркеров достаточно беден. Если первоначально основное внимание уделялось таким общим статистическим параметрам, как длина предложений, частотность слов, лексическое разнообразие, повторяемость n-грамм, энтропия и бёрстность, то результаты анализа отчетов современных детекторов позволяют предположить существование значительно более локальных признаков (генератив кроется в деталях). К их числу относятся особенности пунктуационной организации предложения и, в частности, закономерности употребления запятых.
Запятая в данном случае представляет интерес не только как знак препинания. Ее положение связано с синтаксической структурой предложения, способом присоединения придаточных конструкций, характером перечислений, авторским ритмом и выбором между альтернативными разделителями. Поэтому статистическое распределение запятых потенциально способно выступать одним из косвенных признаков, используемых при классификации текста.
Для проверки этой гипотезы было проведено специальное комплексное исследование пунктуации по ИИ отчету Domate, объемом 1,5 млн. знаков (эквивалент 20 ВКР). Принадлежность текста ранжировалась согласно Думейт образного подхода - RED, ORANGE, YELLOW. Это принципиально важно, поскольку в отчетах {do}mate - красный, оранжевый и желтый цвета обозначают разные уровни уверенности, причем в итоговый процент ИИ-текста включается только RED.
При подготовке корпуса исключались десятичные запятые в конструкциях типа 11,2%, библиографические запятые, URL и очевидно нетекстовые элементы таблиц. Для межклассового анализа использовались только «чистые» предложения, в которых весь текст относился к одному уровню разметки. Предложения, содержащие одновременно несколько цветов, в прямом сравнении классов не применялись, хотя входящие в них запятые использовались для контрольного подсчета.
Размер корпуса позволяет рассматривать полученные результаты как достаточно представительные. В RED вошло 1 642 чистых предложения, содержащих 27 726 слов и 2 012 пунктуационных запятых. Для ORANGE исследовано 1 463 предложения, 25 539 слов и 2 135 запятых; для YELLOW — 2 151 предложение, 37 339 слов и 2 946 запятых. Корпус текста, который Domate идентифицирует как написанный человеком, составил 5 681 предложение, 110 541 слово и 8 882 пунктуационные запятые. С учетом смешанных предложений исследовано более 16 тыс. запятых.
Наиболее выраженная обнаруженная закономерность связана не с количеством запятых, а с их расположением внутри предложения. Позиция каждого знака нормировалась в диапазоне от 0, соответствующего началу предложения, до 1, соответствующего его окончанию. Средняя позиция составила 0,434 для RED, 0,439 для ORANGE, 0,444 для YELLOW и 0,464 для текста, который {do}mate классифицирует как человеческий.
Значительно более заметным оказалось различие в последних 20% предложения. По цветовой классификации Dumate получена последовательность:
RED — 3,38% → ORANGE — 3,75% → YELLOW — 4,07% → текст, идентифицированный Dumate как написанный человеком, — 7,58%
Иными словами, чем выше уровень подозрения по версии {do}mate, тем реже запятая располагается в завершающей части предложения.
Если последнюю пятую предложения разделить еще на два участка, различие усиливается. В интервале 90–100% предложения доля запятых составляет 0,20% для RED, 0,33% для ORANGE, 0,34% для YELLOW и 1,48% для фрагментов, которые Domate относит к человеческим. Следовательно, в RED-зонах по классификации Dumate запятая непосредственно перед окончанием предложения встречается приблизительно в 7,4 раза реже, чем в тексте, идентифицируемом системой как написанный человеком.
Особенно существенно, что эта зависимость сохраняется после контроля длины предложения. В предложениях длиной 6–14 слов поздние запятые составляют 1,46% в RED и 5,20% в тексте, который {do}mate определяет как человеческий. Для диапазона 15–20 слов показатели равны 1,01 и 4,50% соответственно. Таким образом, различие нельзя объяснить исключительно тем, что красные предложения могут иметь иную среднюю длину.
Дополнительная разбивка 625-страничного корпуса на шесть крупных участков приблизительно по 100 страниц показала, что дефицит поздних запятых у RED, ORANGE и YELLOW относительно текста, который Думейт относит к написанному человеком, сохраняется во всех шести частях документа. Это позволяет рассматривать положение запятой в последней части предложения как один из наиболее устойчивых обнаруженных пунктуационных признаков.
Первоначальное предположение о том, что RED может характеризоваться прежде всего малыми расстояниями между соседними запятыми, напротив, не подтвердилось. Медиана во всех четырех классах оказалась одинаковой и составила четыре слова. Среднее расстояние равно 4,43 слова для RED, 4,29 для ORANGE, 4,27 для YELLOW и 4,63 для текста, который Domate идентифицирует как человеческий.
Таким образом, простое правило «чем меньше расстояние между запятыми, тем выше вероятность RED» не соответствует данным.
Однако различие проявилось в форме самого распределения. Текст, который {do}mate относит к человеческому, чаще содержит крайние интервалы: очень короткие — 0–1 слово — и очень длинные — 10 и более слов. Цветные классы значительно сильнее концентрируются в среднем диапазоне 3–6 слов.
В терминах разметки Dumate доля интервалов 3–6 слов составляет:
RED — 46,16%; ORANGE — 45,67%; YELLOW — 46,39%; текст, определенный Dumate как написанный человеком, — 39,12%
Следовательно, различие связано не с абсолютным сокращением интервалов, а скорее с уменьшением их вариативности и концентрацией в некотором среднем коридоре. Для такого признака более корректно использовать условное обозначение COMMA_GAP_CORRIDOR.
Еще более заметная аномалия обнаружена при анализе альтернативных пунктуационных разделителей. Точка с запятой встречается в цветных классах существенно реже. На 100 предложений приходится 0,49 знака ; в RED, 1,23 в ORANGE, 2,00 в YELLOW и 10,17 в тексте, который система определяет как человеческий.
Если рассматривать долю предложений хотя бы с одной точкой с запятой, по версии Domate возникает последовательность:
RED — 0,43% → ORANGE — 0,55% → YELLOW — 1,35% → текст, идентифицированный {do}mate как написанный человеком, — 4,37%
Относительно последней группы точка с запятой в RED встречается примерно в десять раз реже, в ORANGE — приблизительно в восемь раз, а в YELLOW — примерно в 3,2 раза.
Это обстоятельство позволяет выдвинуть более содержательную гипотезу: детектор потенциально может реагировать не на запятую как таковую, а на структуру выбора между запятой и альтернативными средствами членения предложения. Чем выше уровень цветовой уверенности по версии Думейт, тем сильнее запятая превращается в универсальный внутренний разделитель.
Данное наблюдение подтверждается показателями пунктуационного репертуара. Если анализировать четыре внутренних разделителя — , ; : —, — доля запятой составляет 90,75% для RED, 93,52% для ORANGE, 92,29% для YELLOW и 86,22% для текста, классифицированного Domate как написанный человеком. Нормированная энтропия этого пунктуационного словаря равна соответственно 0,269; 0,200; 0,234 и 0,389.
Тем самым текст, который {do}mate относит к человеческому, демонстрирует значительно более разнообразный набор пунктуационных решений. Для цветных фрагментов характерна более высокая концентрация внутреннего членения вокруг запятой.
При этом ORANGE оказывается даже более «монопунктуационным», чем RED. Это обстоятельство принципиально важно: результаты не подтверждают существование единственной линейной шкалы, по которой каждый отдельный показатель обязан последовательно возрастать или уменьшаться от HUMAN к RED. Вероятнее, разные уровни цветовой разметки Dumate образуются за счет сочетания нескольких локальных микропаттернов.
Отдельное направление анализа было связано с лексическим элементом, расположенным непосредственно после запятой. В группу подчинительных маркеров были включены что, чтобы, когда, если, поскольку, хотя, формы слова который, а также где, куда, пока, чем, кто и другие аналогичные единицы.
По классификации {do}mate доля таких случаев составляет:
RED — 14,41% → ORANGE — 13,63% → YELLOW — 12,32% → текст, идентифицированный как написанный человеком, — 10,39%
Таким образом, в RED-зонах запятая чаще непосредственно связана с явным синтаксическим маркером. Речь идет не просто о последовательности X, Y, а о конструкциях типа X, что Y, X, если Y, X, когда Y, X, поскольку Y, X, который Y.
Наиболее заметно это проявилось в конструкции , что. По данным отчета Dumate она составляет 8,90% всех запятых в RED, 7,21% в ORANGE, 6,89% в YELLOW и 5,17% в тексте, который система определяет как человеческий. Следовательно, в красных фрагментах по версии Думейт такая конструкция встречается приблизительно в 1,7 раза чаще.
Разумеется, наличие сочетания , что не является самостоятельным доказательством генеративного происхождения текста. Его значение возникает только в составе совокупного статистического профиля.
Еще более выраженный корпусный эффект обнаружен для конструкции , включая. На 100 запятых показатели составили 3,28 для RED, 2,20 для ORANGE, 1,87 для YELLOW и 0,98 для текста, идентифицированного {do}mate как написанный человеком.
Таким образом, в системе цветовой классификации Domate прослеживается последовательность:
RED — 3,28 → ORANGE — 2,20 → YELLOW — 1,87 → текст, отнесенный Dumate к написанному человеком, — 0,98 случая , включая на 100 запятых
Для академического корпуса это выглядит достаточно сильным признаком. Конструкция , включая позволяет языковой модели удобно расширять перечень объектов и присоединять уточняющее перечисление. Вместе с тем данный результат следует считать именно корпусно-зависимым: нет оснований автоматически переносить его на любые жанры русского языка.
Определенные различия выявлены и для вводно-присоединительных конструкций. RED чаще характеризуется оборотами кроме того,, помимо этого,, например,. Для конструкции кроме того, получено 1,31 случая на 100 запятых в RED против 0,51 в тексте, который Domate относит к человеческому. Для помимо этого, соответствующие значения составляют 0,30 и 0,05. ORANGE, в свою очередь, выделяется повышенной частотой таким образом,.
Эти данные позволяют предположить, что цветовые категории могут отражать различные комбинации микропаттернов академического письма, а не только условную степень общей «генеративности».
Особенно важно, что обычный подсчет запятых такого эффекта не дает. На 100 слов RED содержит 7,26 запятой, ORANGE — 8,36, YELLOW — 7,89, а текст, который {do}mate идентифицирует как написанный человеком, — 8,04. Наибольшая плотность оказывается у ORANGE, а не у RED.
Среднее количество запятых на предложение также не образует линейной шкалы: RED — 1,23; ORANGE — 1,46; YELLOW — 1,37; текст, определенный Domate как человеческий, — 1,56.
Следовательно, гипотеза «чем больше запятых, тем выше вероятность ИИ» не подтверждается. Напротив, результаты показывают, что потенциально значимым является не количество знаков, а архитектура их использования.
Важным RED-специфическим показателем оказалось число предложений с четырьмя и более запятыми. Для красного класса по версии Dumate оно составляет 4,20%, тогда как среди текста, идентифицированного системой как написанный человеком, достигает 10,12%. Для ORANGE и YELLOW показатели равны соответственно 7,66 и 6,37%. Однако часть этого эффекта зависит от длины предложения, поэтому использовать его как универсальный самостоятельный критерий нельзя.
В совокупности проведенное исследование позволяет выделить несколько наиболее выраженных пунктуационных характеристик цветовой разметки {do}mate. К ним относятся дефицит запятых в последних 20% предложения, общее смещение их положения к более ранним частям предложения, редкость точки с запятой, повышенная зависимость запятой от подчинительных союзов, повышенная частота конструкций , что и , включая, концентрация межзапятных интервалов в диапазоне 3–6 слов, доминирование запятой над альтернативными разделителями и пониженная энтропия пунктуационного репертуара.
Полученный результат имеет значение и для понимания природы автоматической ИИ-детекции. Пользователь обычно видит только итоговую оценку: процент генеративного текста либо цветовые выделения. При этом конкретная комбинация статистических признаков, послужившая основанием решения, остается скрытой.
Если подобные пунктуационные зависимости действительно входят непосредственно или опосредованно в пространство признаков детектора, возникает существенная проблема интерпретации. Автор может получить высокий уровень подозрения не потому, что текст создан языковой моделью, а потому, что его собственный способ построения сложных предложений статистически похож на структуры, часто встречавшиеся в генеративных текстах обучающего корпуса.
Поэтому формулировка «Dumate ищет запятые» была бы некорректной. Проведенное исследование не раскрывает внутренний программный код сервиса и не доказывает непосредственное использование конкретных обнаруженных формул. Исследуется другое: какие статистические характеристики текста систематически связаны с цветовой разметкой, которую формирует {do}mate.
Иными словами, речь идет о реконструкции наблюдаемого статистического профиля детекции.
Такой профиль может включать позицию запятых, вероятность их появления в конце предложения, соотношение запятой и точки с запятой, лексическую конструкцию после запятой, характер межзапятных промежутков, разнообразие пунктуационного словаря и устойчивость определенных академических оборотов.
Именно поэтому вопрос о том, «как детекторы используют пунктуацию против автора», следует понимать не как утверждение о намеренном воздействии конкретного сервиса, а как следствие самой статистической природы классификации. Алгоритм не знает авторского намерения. Он сопоставляет наблюдаемые признаки с распределениями, известными ему по обучающим данным.
Если определенный способ расстановки запятых часто встречался в генеративном корпусе, новый человеческий текст с похожей структурой также может получить более высокий AI-score. Детектор в таком случае определяет не фактического автора, а степень статистического сходства с профилями, которые его модель связывает с машинной генерацией.
В этом отношении запятая становится показательным примером. Человек практически никогда сознательно не рассчитывает, какая доля его запятых находится в последних 20% предложения. Автор не следит за нормированной пунктуационной энтропией и не рассчитывает частоту сочетания , что на сто запятых. Для автоматического классификатора подобные операции, напротив, являются технически элементарными.
Проведенное исследование показывает, что текст, идентифицируемый Dumate как написанный человеком, характеризуется большей свободой пунктуационной организации. В нем существенно чаще появляются поздние запятые, активнее используется точка с запятой, выше разнообразие разделителей и чаще возникают как минимальные, так и очень большие расстояния между запятыми. Цветные фрагменты {do}mate демонстрируют более ограниченный пунктуационный репертуар и более устойчивую связь запятой с определенными синтаксическими схемами.
Поэтому перспективный классификатор не должен опираться на примитивный COMMA_COUNT. Гораздо более информативной представляется совокупность показателей COMMA_POSITION, LATE_COMMA_SHARE, SEMICOLON_RATE, COMMA_GAP_CORRIDOR, PUNCTUATION_ENTROPY, POST_COMMA_SUBORDINATE, COMMA_THAT и корпусного COMMA_INCLUDE_CONSTRUCTION.
Главный результат исследования состоит в том, что при ИИ-детекции потенциально значимо не само наличие запятых. Существенной становится структура их распределения: где находится запятая, какие части предложения она соединяет, какие слова следуют непосредственно после нее, какие альтернативные знаки автор предпочитает или почти не использует и насколько разнообразна пунктуационная система текста в целом.
Именно поэтому обнаруженная по разметке Dumate последовательность RED → ORANGE → YELLOW → текст, идентифицированный системой как написанный человеком следует рассматривать не как доказательство машинного происхождения конкретного предложения, а как статистический градиент признаков, на которые потенциально может реагировать автоматизированная система классификации.