Публичное описание алгоритма DoMate остаётся довольно общим, и это правильно: простым смертным не нужно знать, как работает ИИ-детектор, ведь это коммерческая тайна. Разработчики говорят о «мультифакторном анализе», языковых паттернах, структуре аргументации, особенностях научного стиля и статистических отклонениях. В других материалах упоминаются необычная для человека лексика, распределение частей речи и чрезмерная однородность текста. Однако исходный код production-детектора и полный набор признаков не опубликованы, поэтому эти заявления нельзя считать техническим описанием алгоритма.
КонтрПлагиат – Думейт, domate, {do}mate – подобный классификатор генеративного ИИ текста
Более содержательную картину дают научные работы исследователей из близкой профессиональной среды. В открытой модели Advacheck для COLING 2025 применяется DeBERTa-v3-base: Transformer преобразует текст в скрытое векторное представление, после чего классификатор определяет его происхождение. Дополнительные классификационные головы обучаются различать предметные области, что должно уменьшать зависимость детектора от конкретной тематики текста. Такая система получила 83,07% macro-F1 в соответствующем соревновании.
Для научных документов опубликован и другой подход — token-level detector. Он анализирует последовательность токенов и выделяет непрерывные подозрительные фрагменты длиной в сотни символов. Это уже очень похоже на принцип цветовой разметки, которую пользователь видит в отчёте DoMate, хотя доказательств использования именно этой модели в DoMate нет.
Ещё интереснее статистическая линия исследований. В Doklady Mathematics описан быстрый детектор, использующий perplexity и log-likelihood. Вместо запуска большой LLM строятся N-граммные словари текстов разных генеративных моделей, из них создаются KenLM-модели, а полученные числовые признаки передаются классификатору LightGBM. Авторы получили около 94% recall на исследуемых наборах. Аналогичная работа по N-граммной perplexity опубликована в материалах IEEE.
Обсуждения профессионального сообщества хорошо показывают слабое место таких систем. Формальный академический текст сам по себе часто обладает признаками, которые детектор считает «машинными»: ровным стилем, стандартными конструкциями, отсутствием ошибок, повторяющимися способами объяснения и высокой предсказуемостью. Поэтому возможны ложные срабатывания именно на хорошо отредактированных человеческих текстах. Такая проблема регулярно обсуждается специалистами. Научные исследования также предупреждают: качество AI-детектора на лабораторном датасете может резко падать на новых доменах и после перефразирования.
Наиболее обоснованная реконструкция следующая: DoMate, вероятно, использует не один «секретный маркер», а ансамбль — Transformer-представления текста, статистику N-грамм и вероятностной предсказуемости, лексико-грамматические признаки и локальную классификацию фрагментов. Это вывод по совокупности открытых публикаций, а не подтверждённое описание закрытого production-кода DoMate. Именно поэтому для собственного детектора рациональнее искать не один показатель вроде бёрстности или Δ, а устойчивую комбинацию нескольких независимых метрик.
От общих описаний к статистической проверке
Исследовав, что пишут в Интернете, перейдём к практике и попробуем определить, какие статистические признаки отличают генеративный текст: вариативность предложений, вариативность фраз и символьный канал. Для этого используем два отчёта «Думейт».
При анализе текста на признаки машинной генерации недостаточно искать отдельные «характерные слова» или оценивать общее впечатление от стиля. Более информативны количественные свойства текста: насколько неодинаково строятся предложения, как меняется внутренняя длина фраз и какие последовательности символов систематически возникают в словах и словосочетаниях.
Для проверки этих признаков были сопоставлены фрагменты двух выпускных квалификационных работ, размеченные сервисом «Думейт». В отчётах красный цвет соответствует наиболее высокой степени уверенности в признаках машинной генерации, и именно красные фрагменты учитываются в итоговом проценте ИИ-текста. Оранжевый и жёлтый цвета обозначают более слабые уровни: согласно самому отчёту, соответствующие признаки встречаются менее чем в 5% и 10% текстов, созданных человеком.
Для независимой проверки тексты каждой цветовой группы были проанализированы алгоритмами компонента «КонтрПлагиат»: CV предложений и CV фраз рассчитывались по общей последовательности предложений и фраз соответствующей группы, а символьный канал определялся моделью символьных n-грамм. Анализ четырёх классов текста дал следующую картину.
| Группа текста | CV длины предложений | CV длины фраз | Символьный канал |
|---|---|---|---|
| Без выделения | 71,01% | 64,74% | −0,735 |
| Жёлтый | 64,28% | 67,32% | +0,017 |
| Оранжевый | 61,07% | 70,96% | +1,175 |
| Красный | 59,40% | 69,83% | +1,310 |
Эти показатели описывают разные свойства текста, поэтому их нельзя смешивать и интерпретировать как взаимозаменяемые критерии.
CV длины предложений
Коэффициент вариации предложений — показатель неоднородности их длины. Алгоритм сначала подсчитывает число слов в каждом предложении, определяет среднюю длину, затем стандартное отклонение и рассчитывает отношение стандартного отклонения к средней длине в процентах.
CV = стандартное отклонение / средняя длина × 100%.
Представим два небольших текста. В первом предложения содержат 18, 19, 20, 18 и 20 слов. Средняя длина составляет около 19 слов, но отклонения от неё минимальны. Поэтому CV будет небольшим. Текст звучит ритмически ровно: предложение за предложением автор использует примерно одинаковый объём синтаксической конструкции.
Теперь другой ряд: 7, 31, 12, 42 и 16 слов. Средняя длина может оказаться вполне обычной, однако сами предложения радикально различаются. Стандартное отклонение становится большим, а вместе с ним возрастает CV.
Именно поэтому средняя длина предложения и CV — принципиально разные показатели. Два текста могут иметь среднее значение 20 слов, но один состоять почти исключительно из предложений по 18–22 слова, а другой чередовать предложения на 5, 35, 12 и 28 слов. Второй текст обладает гораздо более высокой структурной вариативностью.
В исследованной выборке различие оказалось последовательным. Невыделенный как генеративный «Думейт» текст получил CV предложений 71,01%. В жёлтой группе показатель снизился до 64,28%, в оранжевой — до 61,07%, а в красной — до 59,40%. Таким образом, по мере повышения уровня цветовой разметки DoMate наблюдается последовательное снижение вариативности длины предложений.
Это не означает, что значение 59%, 61% или 64% само по себе доказывает машинное происхождение текста. Однако внутри исследованной выборки направление изменения оказалось устойчивым: человеческий профиль характеризуется наиболее высоким CV предложений, а красный генеративно подозрительный текст — наиболее низким. Следовательно, CV предложений может использоваться как один из структурных диагностических признаков, но не как самостоятельный детектор.
CV длины фраз
CV фраз измеряет более глубокий уровень структуры. Предложение может быть длинным, но состоять из нескольких частей. В используемом анализаторе фразовые границы определяются, в частности, точками, запятыми и точками с запятой с предусмотренными исключениями для сокращений и некоторых специальных конструкций.
Возьмём предложение:
«Компания изучила спрос, изменила ассортимент, пересмотрела цены, увеличила рекламную активность».
Его внутренние части весьма похожи: «изучила спрос» — «изменила ассортимент» — «пересмотрела цены» — «увеличила рекламную активность». Даже если всё предложение достаточно длинное, его внутренняя композиция регулярна.
Другой вариант:
«После снижения спроса компания изменила ассортимент, однако результаты исследования потребителей потребовали значительно более глубокой корректировки ценовой политики; решение о продвижении было принято позднее».
Здесь внутренние фрагменты резко различаются по длине и устройству. Соответственно, CV фраз будет выше.
В исследованной выборке CV фраз не повторил закономерность, обнаруженную для предложений. Невыделенный текст получил 64,74%, жёлтый — 67,32%, оранжевый — 70,96%, а красный — 69,83%. Следовательно, этот показатель не образует последовательной шкалы «человеческий → жёлтый → оранжевый → красный» и в данном эксперименте не позволяет самостоятельно отделить генеративный текст от человеческого.
Этот результат особенно важен с методической точки зрения. Если измеряемый показатель не воспроизводит фактические классы внешней разметки, его нельзя объявлять универсальным маркером ИИ только потому, что теоретически более регулярные фразы кажутся характерными для генеративного текста. В рассматриваемой выборке CV фраз следует считать дополнительной структурной характеристикой, но не самостоятельным индикатором степени генеративности.
Символьный канал
Наиболее интересным оказался символьный канал.
В отличие от CV, он не измеряет длину предложений. Анализатор рассматривает текст как множество коротких последовательностей символов — символьных n-грамм. В исследованной модели используются комбинации длиной примерно от трёх до пяти символов.
Например, слово «маркетинговый» можно условно представить через множество перекрывающихся фрагментов:
мар, арк, рке, кет, ети, тин, инг, нго, гов, овы, вый
При длине четыре символа возникают:
марк, арке, ркет, кети, етин, тинг, инго, нгов, говы, овый
Анализируется не наличие конкретно слова «маркетинговый». Модель получает огромную совокупность таких микрофрагментов по всему тексту. Поэтому она способна замечать статистический рисунок языка на уровне, который плохо воспринимается человеком при обычном чтении.
Предположим, текст систематически содержит конструкции:
- «рассматриваемого предприятия»;
- «исследуемого предприятия»;
- «выявленного показателя»;
- «полученного результата»;
- «установленной зависимости»;
- «последующего анализа».
На уровне отдельных слов это разные выражения. Однако на символьном уровне многократно повторяются сходные морфологические последовательности: -ого, -енного, -анного, предпр, результ, исслед, а также целые семейства перекрывающихся n-грамм. Поэтому чрезмерная регулярность может проявляться даже тогда, когда автор формально заменяет слова синонимами.
Именно этим символьный анализ принципиально отличается от простого поиска повторов.
Допустим, исходная формулировка:
«Полученный результат характеризует деятельность исследуемого предприятия».
Её механически изменили:
«Выявленный показатель отражает работу рассматриваемой организации».
На уровне полных слов совпадений стало значительно меньше. Но морфологическая организация остаётся похожей: причастно-отглагольная конструкция + существительное + глагол + существительное + определение. Символьные n-граммы способны частично сохранить информацию об этой регулярности.
После формирования n-грамм используемый анализатор переводит их в числовые признаки, нормализует их и сопоставляет с весами обученной модели. Итоговый показатель char_contribution показывает, в какую сторону совокупность символьных характеристик сдвигает оценку модели.
И здесь эксперимент дал наиболее выраженную последовательность:
−0,735 → +0,017 → +1,175 → +1,310
невыделенный → жёлтый → оранжевый → красный
Разница принципиальна не только по величине, но и по знаку. У невыделенного текста символьный профиль даёт выраженный отрицательный вклад −0,735. Жёлтая группа находится практически около нуля: +0,017. Оранжевая переходит в явно положительную область с показателем +1,175, а красная демонстрирует максимальное значение +1,310.
Именно символьный показатель в изученной выборке лучше остальных воспроизводит последовательность цветовой разметки DoMate. Переход от человеческого текста к жёлтому, оранжевому и красному сопровождается практически последовательным увеличением char_contribution.
Что из этого следует
Важно корректно интерпретировать результат. Из эксперимента не следует, что сервис «Думейт» сам использует конкретно CV предложений, CV фраз или именно такую модель символьных n-грамм. Его внутренний алгоритм нам неизвестен. Доказано другое: когда независимо вычисленные характеристики сопоставляются с уже готовой разметкой «Думейт», некоторые из них демонстрируют выраженную связь с уровнем этой разметки.
Наиболее последовательными в исследованной выборке оказались два результата. CV предложений снижается от 71,01% у невыделенного текста до 59,40% у красного, то есть генеративно подозрительные группы оказываются синтаксически более выровненными. Символьный канал, напротив, растёт от −0,735 до +1,310 и значительно лучше воспроизводит переход от человеческого профиля к наиболее высокой степени генеративной подозрительности.
CV фраз показал другую картину: его значения составили 64,74%, 67,32%, 70,96% и 69,83%. Поэтому по результатам данного эксперимента нельзя утверждать, что уменьшение CV фраз является обязательным признаком генеративного текста. Это наглядный пример того, почему отдельную метрику нельзя заранее объявлять признаком ИИ без проверки на размеченных данных.
Практический вывод для анализа академического текста состоит в том, что наиболее подозрительной выглядит не просто «слишком правильная» длина предложений. Существенным может быть сочетание нескольких уровней статистической регулярности: предложения становятся менее вариативными, а на уровне коротких последовательностей символов возникает профиль, который обученная модель связывает с генеративным текстом.
Следовательно, при подготовке качественного академического текста важно не искусственно увеличивать или уменьшать отдельные предложения, а добиваться естественной языковой вариативности. Мысль должна определять конструкцию предложения, а не заранее установленный шаблон. Где-то достаточно короткой констатации, где-то требуется сложное причинно-следственное предложение, далее может использоваться пояснение, сопоставление данных или авторский вывод. Такая содержательно обусловленная неоднородность естественным образом увеличивает структурную вариативность.
Особенно малоэффективной выглядит простая синонимизация. Если одна и та же конструкционная схема многократно повторяется, замена «показатель характеризует» на «значение отражает», «результат показывает» или «фактор демонстрирует» меняет поверхность текста, но не обязательно его статистическую архитектуру.
Исследование отчётов позволяет сформулировать рабочую иерархию признаков. Символьный канал оказался наиболее сильным индикатором различий между четырьмя группами. CV предложений также показал последовательное изменение в сторону уменьшения по мере повышения генеративной подозрительности. CV фраз такой закономерности не продемонстрировал и поэтому должен рассматриваться только как дополнительная характеристика структуры текста.
Наиболее перспективным является совместное использование независимых статистических показателей, однако включать конкретную метрику в модель выявления генеративности следует только после проверки её поведения на размеченной выборке. В исследованном материале наиболее выраженную связь с цветовой классификацией DoMate показали символьный канал и CV длины предложений.