Почему нейросеть врёт и выдумывает факты: разбор механики

Обложка статьи о том, почему нейросеть выдумывает факты

Вы просите нейросеть назвать источник, она выдаёт автора, название статьи и год. Открываете поиск: такой публикации нет. Причина, почему нейросеть врёт так уверенно, лежит в самом её устройстве: модель подбирает правдоподобное продолжение вашего текста и достать факт из справочника не может, потому что справочника у неё внутри нет.

Слово «врёт» тут условное. Обманывать модель не собирается и правду от выдумки вообще не различает: для неё это одинаково вероятные продолжения текста. На выходе они и выглядят одинаково: тот же спокойный тон, та же аккуратная формулировка. Промптом это до конца не чинится, но механику можно знать и обходить.

Дальше по порядку: как модель собирает ответ, откуда берётся ссылка на несуществующее исследование, почему в ответ почти никогда не попадает «не знаю», как на выдумку влияют дообучение под оценки людей и длина запроса. Отдельно разберём четыре заблуждения, из-за которых модели доверяют там, где доверять нечему, и что из механики следует для обычных рабочих задач.

Почему нейросеть врёт, если её учили на нормальных текстах?

Отвечаем сразу: языковая модель обучена продолжать текст и выдаёт самое вероятное продолжение вашего вопроса. На этом уровне достоверное утверждение и правдоподобная выдумка неразличимы. В работе «Why Language Models Hallucinate» (четыре исследователя, arXiv, сентябрь 2025 года) это объясняют так: модель отвечает себе на вопрос «утверждение верное или нет», и если ложь выглядит для неё как факт, ошибки появляются сами, без всякой поломки.

Слово «галлюцинация» в индустрии означает выдуманный, но правдоподобный кусок ответа, и ровно в этом значении его используют авторы работы «Why Language Models Hallucinate», открытой на arXiv с сентября 2025 года. Мистику из темы они убирают первой же строкой: «Hallucinations need not be mysterious». За выдумкой стоит обычная статистика обучения.

Модели оптимизируют так, чтобы они хорошо сдавали тесты, а на тесте угадать выгоднее, чем промолчать. Так выдумка не только возникает, но и закрепляется.

Российский вендор механику не объясняет, но пользователя предупреждает прямо. В документации GigaChat написано: «Всегда проверяйте ответы GigaChat. В связи с тем, что ответы генерируются нейросетью, информация в них может быть неактуальна или искажена». Это официальная страница ограничений, проверена 2 августа 2026 года.

Как модель собирает ответ?

Отвечаем сразу: модель режет ваш вопрос на короткие куски текста, а потом достраивает продолжение кусок за куском, каждый раз выбирая вероятный вариант. Она не ищет ответ в базе и не сверяется с источником. Готовая фраза собирается по ходу дела, и грамматическая гладкость получается всегда, даже когда содержание выдумано целиком.

Работает это как человек, который прочитал миллионы текстов и запомнил, как обычно устроены фразы. Его спрашивают про диссертацию малоизвестного учёного. Названия он не помнит, зато прекрасно знает, как названия диссертаций выглядят. И произносит правдоподобное.

Один ответ собирается в четыре хода:

  1. Ваш вопрос режется на короткие куски текста.
  2. Для следующего куска модель считает вероятности и выбирает подходящий вариант.
  3. Куски подставляются один за другим, пока ответ не закончится.
  4. Сверки с источником на этом пути нет ни на одном шаге.

Ровно это описано в работе «Why Language Models Hallucinate». Авторы спросили у трёх разных моделей название диссертации одного из соавторов и получили три разных ответа, все неверные. С днём рождения того же человека вышло смешнее: в трёх попытках одна модель выдала три разные неправильные даты.

Схема: как языковая модель собирает ответ по кускам текста

Тон ответа задаётся тем, как модель собирает фразу, поэтому уверенно звучит и верное утверждение, и выдуманное. Если вы только начинаете работать с такими сервисами, полезно сначала пройти пошаговый гайд по работе с нейросетями без опыта, там разобран сам порядок работы.

Откуда берётся ссылка, которой не существует?

Отвечаем сразу: форма ссылки модели знакома лучше, чем её содержание. Фамилии авторов, год, название журнала, номер тома, номер дела в суде: всё это узнаваемые шаблоны, которые встречались в обучающих текстах тысячи раз. Модель воспроизводит шаблон и заполняет пустые места правдоподобными значениями. Получается ссылка, которая выглядит настоящей и никуда не ведёт.

Самый известный разбор такого случая идёт из суда. В деле Mata v. Avianca нью-йоркские юристы подали в федеральный суд документ с решениями, сгенерированными ChatGPT. Часть дел не существовала.

Юрист переспросил у модели, настоящее ли дело Varghese против China Southern Airlines. Ответ был утвердительным: дело реально и его можно найти в юридических базах. 22 июня 2023 года судья P. Kevin Castel наложил санкцию в 5000 $ на двух юристов и их фирму. Разбор с текстом определения опубликован в NY Litigator, сводка по делу есть в открытой энциклопедии.

Четыре шага, на которых модель собирает несуществующую ссылку

Переспросить у модели «это точно правда?» бесполезно: проверка выполняется тем же механизмом, что и выдумка. Сверять приходится снаружи, по отдельной процедуре: как проверять ответы по источникам, логике и цифрам.

Почему модель почти никогда не говорит «не знаю»?

Отвечаем сразу: потому что за «не знаю» её наказывают на тестах. Авторы работы «Why Language Models Hallucinate» пишут, что оценка «верно или неверно» не даёт баллов за ответ, в котором выражена неуверенность. В их формулировке воздержаться от ответа при такой системе подсчёта строго невыгодно, а ответы вида «я не знаю» штрафуются максимально.

Авторы сравнивают это со школьным экзаменом. Ученик с закрытыми вариантами всегда выигрывает от догадки: пустая строка стоит ноль баллов, а угаданный вариант иногда приносит балл. Модели много лет обучали и измеряли ровно так.

Поэтому осторожное «я не уверен, проверьте по первоисточнику» выглядит слабым ответом на лидербордах, то есть в публичных таблицах, где модели сравнивают между собой по тестам. Индустрия годами оптимизировала результат на тесте, и осторожность в эту метрику не попадала.

Как дообучение под оценки людей усиливает выдумку?

Отвечаем сразу: после основного обучения модель настраивают на человеческих предпочтениях, и люди склонны предпочитать ответы, которые с ними согласны. Исследование про подстройку под собеседника показало: ответ, совпадающий со взглядами пользователя, чаще получает предпочтение, а оптимизация под такую разметку иногда идёт в ущерб правдивости.

Вы пишете «ты уверен? по-моему, там другая цифра», и модель охотно соглашается, извиняется и выдаёт новую цифру. Согласие в диалоге ничего не говорит о том, где правда.

Подстройку под собеседника разбирали отдельно: работа «Towards Understanding Sycophancy in Language Models» проверяла и живых оценщиков, и алгоритмы, которые расставляют оценки вместо людей. И те и другие в заметной доле случаев выбирали убедительно написанный подстраивающийся ответ вместо верного.

Почему нейросеть врёт чаще на длинном тексте?

Отвечаем сразу: чем длиннее поданный текст, тем хуже модель достаёт из него нужный кусок, если он лежит в середине. Работа «Lost in the Middle», открытая на arXiv с июля 2023 года, показала устойчивый эффект: качество выше всего, когда нужная информация стоит в начале или в конце запроса, и заметно проседает в середине. Эффект сохраняется у моделей, специально рассчитанных на длинный контекст.

Сценарий «загружу договор на восемьдесят страниц и спрошу, что там в пункте 4.3» рискованнее, чем кажется: нужный пункт как раз оказывается где-то в середине. Полный текст работы «Lost in the Middle» открыт на arXiv.

Что с этим делают на практике:

  1. Режут документ на куски и подают по одному разделу.
  2. Задают по одному вопросу за раз.
  3. Просят цитировать исходный фрагмент дословно.

Тогда ошибку видно сразу, потому что цитату можно найти глазами. На том же приёме держится и большой текст целиком: факты приносите вы, модель собирает из них форму, а порядок шагов разобран в инструкции по статьям с ChatGPT.

Чем ответ с поиском отличается от ответа по памяти?

Отвечаем сразу: ответ по памяти собирается из того, что осталось после обучения, и проверить его нечем. Ответ с приложенным документом или с поиском можно сверить с источником, который лежит перед вами. Даже на пересказе поданного текста выдумки не исчезают: на лидерборде Vectara у лидеров таблицы от 1,8% до 3,3%, и эта цифра описывает только пересказ.

По умолчанию модель работает с тем, что у неё есть внутри. В документации GigaChat про работу с функциями сказано, что модели «не исполняют функции самостоятельно, а принимают решения о работе с ними, опираясь на имеющиеся знания, текущий разговор и описание функций из запроса»: это страница про работу с функциями.

ПризнакОтвет по памятиОтвет с приложенным источником
Чем проверяетсявнутри диалога нечемтекстом, который вы дали сами
Как быстро видно ошибкучаще всего никогдаза минуту по цитате
Где уместенчерновик, идеи, формацифры, даты, формулировки документа
Что выдаёт выдумкуничегорасхождение с исходником

Сравнение ответа по памяти и ответа с приложенным источником

Приложенный источник не даёт гарантии: модель умеет отходить от поданного текста и досочинять. Ради этого и собрали отдельный набор тестов (бенчмарк) FACTS Grounding, где ответ сначала проверяют на соответствие запросу, а потом на точность относительно поданного текста. Описание методики опубликовано в январе 2025 года.

Работа с вашим же текстом идёт по второму сценарию. Адаптация текста под разные аудитории опирается на исходник, который вы принесли, и результат сверяется глазами за пару минут.

Онлайн-курс «Работа с чат-GPT»
Программа и условия обучения на странице курса.

Схема механики: где именно рождается выдумка

Отвечаем сразу: выдумка копится сразу на четырёх этапах жизни модели, и ни один из них не убирается настройкой промпта. Сначала обучение делает ложь статистически неотличимой от правды, потом дообучение под людей поощряет приятный уверенный тон, потом система оценки штрафует осторожность, и в конце ваш запрос просит достроить недостающее.
ЭтапЧто происходит с модельюГде рождается выдумка
Обучение на текстахучится продолжать любой текстложное утверждение неотличимо от факта
Дообучение под оценки людейподстраивается под то, что нравится оценщикамсогласный с пользователем ответ выигрывает у неудобного
Проверка на бенчмаркахучится набирать баллы на тестах«не знаю» приносит ноль, догадка иногда приносит балл
Ваш запросдостраивает вероятное продолжениенедостающие детали заполняются правдоподобными

Правило «пиши только правду» в промпте бьёт по последней строке таблицы и никак не трогает первые три. Поэтому точечные меры и дают так мало.

Что из этого следует для повседневных задач?

Отвечаем сразу: делить задачи надо по одному признаку, есть ли у модели перед глазами исходник. Работа с вашим текстом безопасна: перевод, сокращение, смена тона, структура, черновик письма. Работа по памяти модели ненадёжна везде, где важна точность: цифры, даты, нормы закона, цитаты, ссылки, названия и должности живых людей. Ненадёжность видна и на бенчмарке TruthfulQA: он собран из 817 вопросов в 38 категориях вокруг человеческих заблуждений.
ЗадачаОтдавать моделиПочему
Переписать свой текст другим тономдаисходник у модели перед глазами
Собрать структуру статьи или письмадапроверяется глазами за пару минут
Назвать цифру, дату или норму законанетответ строится по вероятности, сверять нечем
Найти исследование по памятинетформа ссылки известна модели, содержимое нет

Безопасную часть мы уже разбирали по шагам: двадцать сценариев для учёбы и работы. Этот список удобно держать под рукой, когда решаете, отдавать задачу модели или делать самому.

Вторая колонка бьёт по тем, кто пишет тексты за деньги. Для копирайтера граница проходит здесь, и разбор для копирайтеров показывает, какую часть работы отдавать машине. Та же граница видна у тех, кто ищет на нейросетях подработку: способы заработка на ChatGPT собраны отдельным материалом.

Какие заблуждения про враньё нейросети мешают больше всего?

Отвечаем сразу: четыре штуки. Что новая версия больше не выдумывает, что просьба «не выдумывай» решает проблему, что цифра «врут в 3% случаев» описывает надёжность модели, и что крупная модель правдивее мелкой. Каждое разбивается документом: в системной карточке OpenAI у более новой o3 доля выдумок на тесте PersonQA 0,33 против 0,16 у предыдущей o1.

«Новая версия больше не врёт». Системная карточка — это технический отчёт, который OpenAI выпускает к каждой модели. В карточке o3 и o4-mini от апреля 2025 года есть таблица с долей галлюцинаций по двум наборам тестовых вопросов, SimpleQA и PersonQA. На PersonQA у более новой o3 доля галлюцинаций 0,33 против 0,16 у предыдущей o1, то есть 33% против 16%, при этом точность выше: 0,59 против 0,47.

Объяснение вендора: новая модель делает больше утверждений вообще, поэтому растёт и число верных, и число выдуманных. Тут же в разделе стоит честная фраза о том, что причины этих результатов ещё предстоит понять. PDF системной карточки открыт и проверен 2 августа 2026 года.

Цифры из первоисточников про выдумки языковых моделей

«Если попросить не выдумывать, перестанет». Промпт меняет длину, тон и наличие оговорок, но знаний в модель он не добавляет. Модель по-прежнему достраивает недостающее, просто теперь без предупреждений, потому что вы попросили отвечать увереннее. Хорошая формулировка запроса экономит время на другом, и для этого удобно завести личную библиотеку промптов, но от выдумки она не спасает.

«Модели врут всего в 3% случаев». Такая цифра действительно публикуется, её ведёт лидерборд Vectara. Только меряет он одну узкую вещь: моделям дают текст и инструкцию «сделай краткий пересказ, используя только информацию из этого отрывка, не домысливай». Доля галлюцинаций считается как обратная величина к доле пересказов, согласованных с исходником.

На 11 мая 2026 года у лидеров таблицы от 1,8% до 3,3%. К вопросу «сколько выдумок будет в ответе про факты из головы модели» эта цифра отношения не имеет.

«Чем крупнее модель, тем она правдивее». Бенчмарк TruthfulQA собран из 817 вопросов в 38 категориях: здоровье, право, финансы, политика. Вопросы специально построены вокруг человеческих заблуждений. Вывод авторов в оригинальной работе звучал так: крупнейшие модели оказались наименее правдивыми, и это расходится с другими задачами, где рост размера улучшает результат. Конкретные проценты из той статьи относятся к моделям 2021 года, переносить их на сегодня нельзя.

Что делать, зная механику

Отвечаем сразу: перестать спрашивать модель о фактах и начать давать ей факты. Всё, что должно быть точным, кладите в запрос сами: документ, выписку, страницу с сайта. Всё, что модель выдала по памяти, считайте черновиком до проверки. И держите отдельный список тем, где цена ошибки высокая: право, медицина, налоги, деньги, техника безопасности.

Рабочий минимум выглядит так:

  1. Просите цитату из поданного документа дословно, а потом ищите её в исходнике поиском по странице.
  2. Любую ссылку открывайте руками. Проверяйте, что внутри лежит именно то, что модель описала.
  3. Спорное место переспрашивайте в новом чате, без подсказки желаемого ответа: в старом диалоге модель будет держаться за свою же версию.
  4. Цифры и даты сверяйте с первоисточником: сайтом ведомства, документацией вендора, текстом закона.
  5. В темах с высокой ценой ошибки используйте модель для черновика и списка вопросов, а решение принимайте по документам.

Чек-лист проверки ответа нейросети перед использованием

Собрать эту работу в один понятный процесс помогает курс «Работа с чат-GPT»: там разбирают, как ставить задачи модели и что делать с её ответами дальше. Выбрать сам сервис поможет обзор нейросетей, доступных в России.

Механика отвечает на вопрос, каким задачам вообще нельзя доверять. Как сверять конкретный ответ, разобрано в отдельном материале: как проверять ответы по источникам, логике, цифрам и спорным фактам. Открывайте его в тот момент, когда решили, что спрашивать модель всё-таки надо.

Ещё несколько вопросов

Почему на один и тот же вопрос приходят разные ответы?

Генерация вероятностная: на каждом шаге модель выбирает из нескольких подходящих вариантов продолжения. В работе «Why Language Models Hallucinate» это видно на примере с датой рождения, где в трёх попытках модель выдала три разные неверные даты. Разброс ответов сам по себе полезный сигнал: если модель трижды называет разные цифры, знания у неё нет.

Можно ли доверять цифрам и датам от нейросети?

Без первоисточника нет. Цифра, дата и норма закона относятся к тому классу деталей, которые модель достраивает по вероятности. Сверяйте с сайтом ведомства, документацией вендора или текстом закона. В документации GigaChat прямо сказано: всегда проверяйте ответы, потому что информация в них может быть неактуальна или искажена.

Помогает ли фраза «отвечай только по фактам»?

Она меняет стиль ответа и убирает оговорки, из-за чего текст выглядит надёжнее прежнего. Механика подстановки правдоподобного при этом остаётся. Работающий вариант другой: приложить документ и попросить отвечать только по нему, а на всё остальное отвечать «в тексте этого нет».

Российские модели выдумывают меньше зарубежных?

Сравнительных данных, которым можно верить, у нас нет: публичные бенчмарки меряют разные вещи и на разных языках, а сводные проценты гуляют по статьям без методики. Зато есть официальное предупреждение вендора: в документации GigaChat стоит требование всегда проверять ответы. OpenAI делает это по-своему: доля выдумок его моделей опубликована в системной карточке o3 и o4-mini отдельной таблицей.

Источники

  1. Kalai A. T., Nachum O., Vempala S., Zhang E. «Why Language Models Hallucinate», arXiv, сентябрь 2025 — https://arxiv.org/abs/2509.04664 (проверено 02.08.2026)
  2. System card OpenAI o3 и o4-mini, апрель 2025 — https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758f3722c1/o3-and-o4-mini-system-card.pdf (проверено 02.08.2026)
  3. Sharma M. и др. «Towards Understanding Sycophancy in Language Models», arXiv — https://arxiv.org/abs/2310.13548 (проверено 02.08.2026)
  4. Liu N. F. и др. «Lost in the Middle: How Language Models Use Long Contexts», arXiv — https://arxiv.org/abs/2307.03172 (проверено 02.08.2026)
  5. Lin S., Hilton J., Evans O. «TruthfulQA», arXiv — https://arxiv.org/abs/2109.07958 (проверено 02.08.2026)
  6. FACTS Grounding Leaderboard, arXiv, январь 2025 — https://arxiv.org/abs/2501.03200 (проверено 02.08.2026)
  7. Vectara hallucination leaderboard — https://github.com/vectara/hallucination-leaderboard (проверено 02.08.2026)
  8. Документация GigaChat, квоты и ограничения — https://developers.sber.ru/docs/ru/gigachat/limitations (проверено 02.08.2026)
  9. Документация GigaChat, работа с функциями — https://developers.sber.ru/docs/ru/gigachat/guides/functions/overview (проверено 02.08.2026)
  10. Christopher F. Lyon, «Fake Cases, Real Consequences», NY Litigator — https://www.goldbergsegalla.com/app/uploads/2023/10/Fake-Cases-Real-Consequences-Misuse-of-ChatGPT-Christoper-F.-Lyon-NY-Litigator.pdf (проверено 02.08.2026)
  11. Mata v. Avianca, Inc., сводка по делу — https://en.wikipedia.org/wiki/Mata_v._Avianca,_Inc. (проверено 02.08.2026)

Если тема вам откликается, посмотрите программу курса «Работа с чат-GPT» на сайте OnSkills.

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *