Детектор достоверности текста предназначен для предварительной проверки доказательной обеспеченности русскоязычных научных, учебных, аналитических и деловых материалов. Компонент выявляет утверждения, которым не хватает доказательной базы - автора, источника, метода, числовых данных, базы сравнения или обоснования вывода. Пользователь получает индекс генеративности, стилометрический профиль и оценку доказательной обеспеченности. Обнаруженный маркер указывает на необходимость ручной проверки, но сам по себе не доказывает ложность утверждения.
Назначение детектора достоверности текста
Проверка доказательности текста основана на раздельном анализе трёх характеристик. Индекс генеративности показывает соответствие материала фиксированному набору из 27 формальных признаков. Стилометрический профиль отражает особенности построения предложений, их длину и ритмическую вариативность. Доказательная обеспеченность характеризует наличие оснований для проверяемых утверждений.

Рисунок 1 — Индекс генеративности, стилометрический профиль и доказательная обеспеченность текста
Принцип проверки доказательности текста
Алгоритм разделяет материал на предложения и выделяет положения, которые допускают проверку. К ним относятся фактические сведения и оценочные формулировки. Отдельно распознаются причинные выводы и прогнозы. Компонент также анализирует категоричные обобщения, числовые показатели и прямые цитаты [Мустакимов , В.А. КонтрПлагиат методом перефразирования и рерайта для антиплагиат ВУЗ. Издательские решения, . ISBN 978-5-0064-3068-6. Карточка издателя].
После определения типа утверждения компонент проверяет наличие формального основания. Таким основанием может выступать названный автор или организация. Дополнительно учитываются документ и библиографическая ссылка. Алгоритм распознаёт DOI, описание метода и измеримый показатель. База сравнения либо ограничение применимости также уменьшают диагностический риск.
- Текст разделяется на предложения и связанные смысловые фрагменты.
- В каждом предложении выделяются проверяемые утверждения.
- Определяется категория утверждения и необходимый вид подтверждения.
- Проверяется наличие автора, источника, метода и числовых данных.
- Для каждого фрагмента рассчитывается диагностический риск.
- Замечание связывается с конкретным предложением исходного текста.
Какие утверждения требуют подтверждения
Детектор выделяет несколько основных категорий утверждений. Для каждой категории компонент показывает проблемный фрагмент и указывает отсутствующий элемент доказательства.
| Категория | Пример | Что необходимо добавить |
|---|---|---|
| Неопределённая атрибуция | «Исследования показывают» | Автора, организацию, название исследования либо библиографическую ссылку. |
| Причинный вывод | «Метод повышает эффективность» | Данные, описание метода или результаты сравнения. |
| Оценочное положение | «Имеет ключевое значение» | Критерий оценки, измеримый показатель либо названного эксперта. |
| Категорическое обобщение | «Всегда обеспечивает результат» | Условия применения и ограничения вывода. |
| Числовое утверждение | «Показатель вырос на 27 %» | Источник данных, период и базу сравнения. |
| Прямая цитата | Фрагмент в парных кавычках | Автора в формате И.О. Фамилия и ссылку в квадратных скобках. |
Число рассматривается как статистический показатель, если оно выражает процент, количество или сумму. Аналогичным образом анализируются срок, площадь и коэффициент. Годы и номера статей из такой диагностики исключаются. Номера нормативных актов, рисунков, таблиц и разделов также не считаются статистическими данными.

Рисунок 2 — Количество утверждений, формально обеспеченные положения, неопределённые акторы, числа без источника, критические фрагменты и цитаты
Расчёт доказательной обеспеченности
Для каждого утверждения формируется собственный риск. Он увеличивается, если отсутствует источник или метод. Показатель также возрастает без измеримого критерия либо ограничения применимости. Названный автор снижает итоговое значение. Аналогичным образом учитываются квадратная ссылка и DOI. Описание метода и наличие сравнения также уменьшают риск.
| Диагностический признак | Изменение риска |
|---|---|
| Неопределённый автор или источник | +5 |
| Причинное утверждение без основания | +3 |
| Оценка без измеримого критерия | +3 |
| Категорическое утверждение без ограничения | +3 |
| Числовой показатель без источника | +4 |
| Цитата без автора | +2 |
| Цитата без квадратной ссылки | +2 |
| Обнаружена ссылка или DOI | −5 |
| Назван автор, организация или источник | −4 |
| Указан метод или база сравнения | −2 |
| Установлены границы применимости | −1 |
В формуле N обозначает количество найденных проверяемых утверждений. Риск отдельного положения ограничивается восемью баллами. Поэтому одно предложение не может непропорционально изменить результат всего документа [Мустакимов , В.А. КонтрПлагиат методом перефразирования и рерайта для антиплагиат ВУЗ. Издательские решения, . ISBN 978-5-0064-3068-6. Карточка издателя].
Значение ниже 40 % указывает на существенный недостаток формальных оснований. Диапазон от 40 до 69 % означает, что часть положений требует уточнения. Результат от 70 % показывает отсутствие выраженных формальных замечаний к большинству найденных утверждений.
Результат проверки и диагностическая подсветка
После обработки пользователь получает три числовых показателя и текст с диагностической подсветкой. Отдельная таблица содержит фрагмент утверждения и его категорию. В ней также приводится отсутствующий доказательный элемент и установленный уровень риска.
Жёлтая подсветка обозначает положение, которому требуется уточнение. Оранжевый цвет показывает высокий риск недостаточного обоснования. Красный маркер применяется, если в одном утверждении одновременно обнаружено несколько существенных недостатков.
Фиолетовый цвет указывает на неопределённого автора либо источник. Синяя отметка применяется к числовым данным без подтверждения. Зелёная подсветка означает, что рядом обнаружен формальный доказательный элемент.

Рисунок 3 — Диагностическая подсветка утверждений, требующих проверки или дополнительного подтверждения
Нажатие на метку риска переводит пользователя к соответствующему предложению. Выбранный фрагмент временно выделяется в исходном тексте. Благодаря этому замечание можно проверить без повторного чтения всего документа.
Исправление неподтверждённых утверждений
Формулировку «исследования показывают» следует дополнить фамилией автора и названием публикации. После этого указывается год. Затем описывается исследуемая выборка и добавляется библиографическая ссылка.
Утверждение о повышении эффективности требует измеримого критерия. Автору необходимо обозначить исходное значение и итоговый результат. Далее указывается период и определяется объект сравнения.
Причинный вывод должен опираться на данные либо исследовательский метод. Простое совпадение двух событий не подтверждает причинную связь. Прогноз требует исходных данных и обозначенного временного периода.
Пример исходной формулировки: «Исследования показывают, что цифровизация значительно повышает эффективность образования».
Для доказательного изложения необходимо назвать исследование И.О. Фамилию авторов, и описать выборку. Затем следует определить показатель эффективности и привести числовой результат. После этого добавляется ссылка на публикацию.
Индекс генеративности и стилометрический профиль
Индекс генеративности используется как дополнительный показатель. Текущая версия анализирует 27 диагностических признаков. Среди них учитывается вариативность длины предложений и средняя абсолютная дельта. Отдельно определяется доля малых перепадов.
Стилометрический профиль показывает диапазон длины предложений и повторяемость языковых конструкций. Пунктуационная организация материала анализируется отдельным каналом. Полученные характеристики сопоставляются с параметрами калибровочных текстов.
Приоритетное срабатывание возможно, если в тексте обнаружено более пяти соседних переходов с абсолютной дельтой менее десяти слов. Отдельно проверяются пары предложений одинаковой длины. Повтор двух последовательных ненулевых дельт также учитывается как самостоятельный диагностический признак.
Стилометрические признаки не доказывают использование искусственного интеллекта. Они показывают совпадение текста с формальными конструкциями, выявленными во время калибровки.
Калибровка и независимое тестирование
Аналитический алгоритм версии 1.0.12 откалиброван на 35 157 валидных русскоязычных текстах. Человеческий класс включал 8 768 материалов. Генеративная часть состояла из текстов GPT-4 Turbo и Llama 3.3 70B. Дополнительно использовались материалы Gemma 2 27B.
| Показатель | Результат |
|---|---|
| Обучающая выборка | 21 094 текста |
| Валидационная выборка | 7 031 текст |
| Независимая тестовая выборка | 7 032 текста |
| ROC AUC после калибровки | 0,9412 |
| Balanced Accuracy при пороге 60 % | 86,16 % |
| Precision генеративного класса при пороге 60 % | 95,96 % |
| Recall генеративного класса при пороге 60 % | 82,82 % |
| Precision при пороге 75 % | 98,04 % |
| Recall при пороге 75 % | 66,34 % |
| Ложные срабатывания при пороге 75 % | 3,99 % |
Precision характеризует достоверность положительного решения. Recall показывает полноту обнаружения генеративного класса. ROC AUC оценивает способность модели разделять классы при разных порогах.
Значение 98,04 % не является общей точностью всех проверок. Оно относится к положительным решениям при пороге уверенности 75 %. При повышении порога Precision увеличивается, однако Recall закономерно снижается.
Экспертная и публикационная основа
Разработка методического направления связана с методическим подходом В. Мустакимова [Мустакимов, В.А. КонтрПлагиат методом перефразирования и рерайта для антиплагиат ВУЗ. Издательские решения, . ISBN 978-5-0064-3068-6. Карточка издателя].
Область применения и ограничения
Проверка научного текста на достоверность подходит для оценки заимствованных материалов из Интернет, текстов курсовых и выпускных квалификационных работ. Компонент применяется при подготовке магистерских исследований и научных статей. Его можно использовать для анализа отчёта, экспертного заключения или методического материала.
- Студент находит положения, которым требуются ссылки, статистика или описание методики.
- Научный руководитель ускоряет первичный просмотр материала.
- Редактор обнаруживает категоричные выводы и неопределённые ссылки.
- Автор аналитического документа проверяет связь выводов с исходными данными.
- Организация выполняет предварительную диагностику отчётов и экспертных материалов.
Детектор достоверности текста не выполняет полноценный фактчекинг. Он не обращается к внешней базе фактов и не устанавливает истинность конкретного события. Компонент определяет формальную доказательную обеспеченность утверждений.
Высокий риск не означает автоматическую ложность утверждения. Низкая доказательная обеспеченность указывает на отсутствие формального подтверждения. Достоверность самого источника необходимо проверять отдельно. Окончательный вывод принимает автор, редактор или предметный эксперт.
Частые вопросы
Проверяет ли сервис фактическую истинность?
Нет. Сервис определяет наличие формального доказательного основания. Фактическую точность необходимо проверять по первичному источнику.
Означает ли высокий риск, что текст создан ИИ?
Нет. Индекс генеративности и доказательная обеспеченность рассчитываются раздельно. Высокий доказательный риск может присутствовать в материале, написанном человеком.
Как компонент проверяет прямые цитаты?
Цитатой считается фрагмент в парных кавычках длиной более трёх слов. Рядом должен находиться автор в формате И.О. Фамилия. После цитаты требуется ссылка в квадратных скобках.
Можно ли проверить ВКР или диссертацию?
Да. Объёмный документ рекомендуется анализировать последовательными смысловыми разделами. Каждый раздел должен укладываться в доступный лимит.
Передаётся ли текст внешней нейросети?
Нет. Текущая версия использует детерминированное аналитическое ядро и не отправляет материал во внешний LLM-сервис.