Проверка текста на нейросеть: работают ли детекторы
Надёжного способа определить, писала ли текст нейросеть, не существует. Детекторы выдают вероятность, а не факт, и ошибаются в обе стороны: помечают живые тексты как машинные, особенно у неносителей языка и в деловом стиле, и пропускают машинные после лёгкой правки. Опираться на их вердикт при принятии решений о людях нельзя.
Запрос «проверка на нейросеть» задают тысячи раз в месяц, и почти всегда за ним стоит одна из двух ситуаций: заказчик хочет убедиться, что ему сдали не машинный текст, или автор боится, что его живой текст примут за машинный.
Плохая новость для обеих сторон: надёжного способа не существует. Разберём, почему так и что делать вместо этого.
Как работают детекторы
Они не узнают текст и не сверяются с базой. Они оценивают, насколько он предсказуем: если каждое следующее слово легко угадывается по предыдущим, текст похож на машинный.
Отсюда сразу видно, где ломается логика. Предсказуемость это свойство не происхождения, а стиля. Ровный, аккуратный, вычищенный текст предсказуем независимо от того, кто его написал.
Кого они обвиняют по ошибке чаще всего
Три категории, и все три несправедливо.
Тех, кто пишет на неродном языке. Простые конструкции и осторожный подбор слов дают ровно ту предсказуемость, на которую реагирует детектор.
Деловые и технические тексты. Инструкция, регламент, описание услуги. Там и должна быть ровная структура и повторяющиеся формулировки, это не порок, а жанр.
Тщательно вычитанные тексты. Чем лучше редактор убрал шероховатости, тем выше подозрение. Получается наказание за качество.
Почему обойти их несложно
Об этом стоит знать, чтобы не переоценивать инструмент. Достаточно поправить текст руками: разбить длинные предложения, добавить конкретный пример из своей практики, оставить неровность в ритме. Предсказуемость падает, вердикт меняется.
То есть детектор ловит не машинный текст, а невычитанный машинный текст. Это совсем другая задача, и в спорной ситуации она вам не поможет.
Что оценивать вместо процента
Если вы принимаете работу, работают три вопроса, и ни один не про происхождение.
Есть ли здесь что-то, чего нет в первых десяти статьях по этому запросу. Машинный текст без участия автора пересказывает общее место. Живой приносит частность.
Есть ли конкретика. Цифры с источником, названия, случаи из практики, сроки. Всё это модель либо не знает, либо выдумывает, и выдумку легко проверить.
Проверяемы ли факты. Откройте два числа и одну ссылку. Этот тест проходят не все тексты, и он полезнее любого детектора.
Если вы автор и боитесь подозрений
Оставляйте следы работы: черновики с датами, историю правок, собственные примеры и цифры из своей практики. Это надёжнее попыток подстроиться под детектор, потому что подстройка ничего не доказывает, а черновик доказывает.
И помните: поиск оценивает пользу страницы, а не способ её создания. Проблема плохих машинных текстов не в том, что их написала машина, а в том, что в них нет ничего нового.
Короткие ответы
- Можно ли точно определить, что текст написан нейросетью
- Нет. Все существующие способы дают вероятность, а не доказательство. Текст, слегка отредактированный человеком, обычно перестаёт определяться.
- Почему детектор помечает мой текст как машинный
- Он реагирует на ровность и предсказуемость. Деловой стиль, инструкции, тексты неносителей языка и просто аккуратно вычитанные тексты попадают под подозрение чаще остальных.
- Можно ли на основании детектора отказать исполнителю
- Это плохая опора для решения. Вердикт не является доказательством, а ошибка бьёт по конкретному человеку. Оценивайте работу по фактам, структуре и пользе, а не по проценту машинности.
- Понижает ли поиск тексты, написанные нейросетью
- Поиск оценивает пользу страницы, а не способ её создания. Проблема плохих машинных текстов не в происхождении, а в том, что в них нет ничего нового.
- Что делать, если текст нужно защитить от подозрений
- Оставляйте следы работы: черновики, даты правок, собственные примеры и цифры из своей практики. Это надёжнее любых попыток обмануть детектор.