Как проверить, что нейросеть не выдумывает
Модель не отличает факт от правдоподобного: она собирает ответ так, чтобы он выглядел уместно, и предупреждать о догадке не станет. Проверять надо три вещи, и в таком порядке: числа, названия и ссылки. Быстрый приём это спросить, откуда взялся конкретный факт, и потребовать точную цитату из файла. Если цитаты нет, факта тоже нет.
Самая опасная ошибка нейросети не та, где она отказывается отвечать. Та, где она отвечает уверенно и неправильно.
Отказ виден сразу. Выдуманная цифра выглядит ровно как настоящая, набрана тем же шрифтом и стоит в том же месте отчёта. Разбираемся, откуда это берётся и как поймать за минуту.
Почему это происходит
Модель не хранит факты списком и не сверяется с ними. Она достраивает ответ по форме: собирает то, что в таком месте, при таком вопросе, обычно оказывается уместным.
Отсюда главное следствие, из которого дальше вытекают все приёмы проверки: уверенность в ответе никак не связана со знанием. Тон одинаковый и когда она знает, и когда достраивает. Ждать от неё оговорки «я не уверена» бессмысленно: у неё нет способа отличить одно от другого изнутри.
Что она выдумывает чаще всего
Не всё подряд. Есть четыре области, где риск заметно выше, и знать их полезнее, чем перепроверять каждое слово.
Где ошибка вероятнее
Пропорции показывают порядок риска по нашим наблюдениям, а не измеренную частоту: считать её честно означало бы прогнать тысячи ответов, и такого исследования у нас нет.
Три вопроса, которые ловят выдумку за минуту
Работают лучше, чем перечитывание ответа.
Первый: «Приведи точную цитату, откуда это». Настоящая цитата приводится дословно и совпадает с файлом. Выдуманная превращается в пересказ своими словами, а если надавить, в извинение. Это самый быстрый способ, и он же самый надёжный.
Второй: «Чего в этих данных не было». Прямой вопрос про пропуски заставляет её отделить то, что она видела, от того, что достроила. Часто в ответ приходит честное «в файле не было разбивки по месяцам, я взяла среднее», и это ровно та строчка, которую вы иначе унесли бы в отчёт.
Третий: «Насколько ты уверена и почему». Работает хуже двух первых, но иногда вскрывает место, где ответ построен на предположении. Не полагайтесь только на него.
Признаки, по которым видно без вопросов
Четыре штуки, замечаются глазом.
Слишком круглые числа. Ровно 30 процентов, ровно 500 клиентов. Настоящие данные редко бывают такими опрятными.
Ссылка без адреса. «Согласно исследованию Гарварда» без названия работы и года это не источник, а форма источника.
Идеальная симметрия. Пять причин, у каждой ровно по три следствия. Реальность так не устроена, а модель любит ровные структуры.
Точность там, где её быть не может. Курс, изменившийся вчера, число подписчиков конкурента, дата, которой нет в ваших файлах. Всё, что она не могла увидеть, она могла только придумать.
Отдельный случай: пересказ файла, который она не открыла
Это самый обидный вариант, потому что выглядит как выполненная работа.
Помощник видит только то, что лежит внутри открытой папки. Если файл снаружи, он для него не существует. Но вопрос про этот файл всё равно получает ответ: по названию, по расширению, по контексту разговора.
Как ставить задачу, чтобы выдумок было меньше
Полностью они не исчезнут, но их станет заметно меньше.
Дайте данные вместо описания данных. Просите отмечать места, где сведений не было, отдельной строкой. Скажите прямо, что «не знаю» это допустимый ответ: без этого разрешения модель будет достраивать, потому что достроенный ответ похож на выполненную работу.
И разделите труд честно: она объясняет, вы проверяете. Найти закономерность в выгрузке на тысячу строк она может лучше и быстрее вас. Сложить эту тысячу строк без ошибки нет.
Короткие ответы
- Почему нейросеть уверенно говорит неправду
- Она собирает ответ из того, что статистически уместно, а не из того, что проверено. Уверенный тон это не признак знания: он одинаковый и когда модель знает ответ, и когда достраивает его по форме.
- Как быстро проверить факт из ответа
- Попросите точную цитату из файла или адрес источника. Настоящая цитата приводится дословно, выдуманная превращается в пересказ или в извинение.
- Что она выдумывает чаще всего
- Числа, даты, названия компаний и ссылки. Эти четыре вещи выглядят одинаково убедительно независимо от того, настоящие они или нет.
- Помогает ли попросить её не выдумывать
- Помогает частично. Прямое указание отвечать «не знаю» вместо догадки снижает число выдумок, но не отменяет проверку того, что пойдёт в работу.
- Можно ли доверять ей работу с цифрами
- Объяснять данные можно, считать итоги нет. Правильное разделение труда такое: она находит закономерность и объясняет её, вы проверяете сумму.
