Галлюцинация нейросети — это ответ, которого нет ни в одном вашем документе, но который по форме неотличим от правильного. Не сбой, не поломка и не редкий случай: это штатное свойство языковой модели, которое проявляется всегда, когда в контексте не хватило опоры. Именно поэтому вопрос «как убрать галлюцинации» задан неверно. Правильный вопрос — сколько стоит удержать их в границах, которые вы готовы терпеть.

Ответ на него довольно устойчив: работа по ограничению выдумок занимает от трети до половины бюджета проекта и почти никогда не выделена в коммерческом предложении отдельной строкой. Если в смете на ИИ-помощника есть «разработка сценариев» и «интеграция», но нет ни слова про источники ответов, сценарий отказа и журнал разбора, — эта половина работы просто не запланирована.

Дальше — модельные расчёты по состоянию на сентябрь 2026 года: поток 3 000 обращений в месяц, ставка инженера 3 000 ₽/час, полная стоимость часа сотрудника 700 ₽. Внутреннюю механику явления — почему опора рвётся именно в этих местах — мы разбирали в материале про механику галлюцинаций; здесь словарный разбор с точки зрения сметы.

Почему модель выдумывает и почему уверенный тон ничего не значит

Языковая модель не хранит факты в виде справочника и не ходит в него сверяться. Она подбирает наиболее уместное продолжение текста по тому, как устроен язык и как обычно выглядят подобные ответы. Внутри известного ей материала это выглядит как знание. За его границей — как правдоподобная выдумка. И то и другое рождается одним и тем же механизмом, поэтому внешне ничем не различается.

Отсюда практическое следствие, которое стоит повторять на каждом обсуждении: уверенность формулировки не связана с её правильностью. Модель напишет «согласно пункту 4.2 договора срок составляет 10 рабочих дней» одинаково гладко и когда пункт 4.2 существует, и когда его нет. Собственная оценка уверенности, которую иногда просят выводить в ответ, тоже не спасает: она отражает гладкость текста, а не наличие источника.

Что это значитГаллюцинация (hallucination)

Ответ модели, содержащий сведения, которых нет в предоставленных ей документах и в проверяемой реальности. Бизнесу означает риск неверной консультации клиенту, ошибочной суммы в документе и спора, который придётся разбирать вручную. В смете превращается в четыре слоя защиты общей стоимостью 138 000–192 000 ₽. Проверочный вопрос подрядчику: покажите ответ вместе с фрагментами документов, на которых он построен.

В работе с клиентами выдумка принимает три устойчивые формы, и распознаются они по-разному. Полезно знать их заранее: две из трёх не выглядят как выдумка вообще и проходят мимо любой проверки «на глаз».

  • Несуществующая ссылка. «Согласно пункту 4.2 договора» — при том, что в договоре одиннадцать пунктов и четвёртый заканчивается на 4.1. Ловится сверкой ответа с источником и потому самая безобидная из трёх.
  • Верная форма, неверное число. Правило пересказано точно, а срок, сумма или процент подставлены из соседнего документа или из общего представления модели о том, как бывает. Отличить это в ответе невозможно — только сверкой со справочником.
  • Склейка двух документов. Условие взято из действующего регламента, исключение к нему — из отменённого. Самый дорогой случай: ответ проходит любую беглую проверку, потому что оба куска существуют и оба выглядят вашими.

Четыре слоя защиты и цена каждого

Слои работают только вместе и ставятся именно в этом порядке: каждый следующий ловит то, что пропустил предыдущий. Цены — часы работы при ставке 3 000 ₽/час, вилка зависит от того, сколько типов документов и справочников участвует в ответах.

Чаще всего покупают только первый слой — поиск по своей базе — и считают вопрос закрытым. Он действительно снимает половину случаев: там, где раньше модель отвечала «из общих знаний», теперь она отвечает по вашему регламенту. Но вторую половину он не видит вовсе, потому что там поиск как раз что-то нашёл и модель добросовестно пересказала не тот документ. Как устроен сам поиск и почему он промахивается — в разборе про что такое RAG.

СлойЧто делаетЧасы и ценаЧто перестаёт происходить
1. Ответ только по найденным документамМодель получает фрагменты вашей базы и инструкцию отвечать по ним; при пустом поиске — честный отказ12–16 ч — 36 000–48 000 ₽Ответы «из общих знаний интернета» вместо ваших регламентов
2. Ссылка на источник в каждом ответеРядом с ответом выводятся фрагменты, из которых он собран, открываемые в один клик8–10 ч — 24 000–30 000 ₽Споры «система сказала» без возможности проверить
3. Проверка формата и сверка со справочникомСуммы, даты, сроки, артикулы сверяются с учётной системой до показа ответа16–24 ч — 48 000–72 000 ₽Правильный по смыслу ответ с неверной цифрой внутри
4. Передача человеку и журнал разбораСомнительные случаи уходят оператору, каждый ответ пишется в журнал с найденными фрагментами10–14 ч — 30 000–42 000 ₽Невозможность разобрать спорный случай задним числом
схема процессаchto-takoe-gallyutsinatsii-neyroseti--01
Четыре последовательных слоя защиты от выдумок с ценами от 36 000 до 72 000 рублей

Горизонтальная схема из четырёх последовательных ворот, через которые слева направо проходит стрелка «ответ модели». Ворота подписаны: «Только по найденным документам, 36 000–48 000 ₽», «Ссылка на источник, 24 000–30 000 ₽», «Сверка сумм и дат со справочником, 48 000–72 000 ₽», «Передача человеку и журнал, 30 000–42 000 ₽». Из второго и третьего ворот вниз отходят короткие стрелки в блок «оператор». Справа итог в рамке: «138 000–192 000 ₽». Тонкие чертёжные линии, подписи по-русски.

Слои работают только вместе: каждый следующий ловит то, что пропустил предыдущий

Итого 46–64 часа и 138 000–192 000 ₽. Для сравнения: рыночная вилка заказного ИИ-агента на сентябрь 2026 — 250 000–500 000 ₽. То есть защита от выдумок съедает от трети до половины проекта, и это нормальная пропорция, а не переплата. Ненормально — когда её в смете нет вовсе: тогда деньги ушли на демонстрацию, которая красиво отвечает на подготовленных вопросах. Как из этого вырастает проект, не доживающий до эксплуатации, разобрано в материале о том, почему ИИ-проекты не доходят до эксплуатации.

«Точность 99 %»: три вопроса, после которых цифра уменьшается

Обещание точности в коммерческом предложении — самая частая цифра, за которой не стоит ничего проверяемого. Разбирается она тремя вопросами, и задать их надо до подписания, потому что после подписания спорить будет не с чем.

ВопросПлохой ответЧто цифра значит на самом деле
На какой выборке измеряли?«На тестовых вопросах»99 % на 100 вопросах — это одна ошибка. Добавьте вторую сотню вопросов, и та же система покажет 95–96 %
Кто собирал выборку?«Мы подготовили набор»Вопросы подобраны под то, что система умеет. Выборку должны составлять ваши сотрудники по реальным обращениям
Что делают с остатком?«Оставшиеся случаи дорабатываются»1 % от 3 000 обращений — это 30 неверных консультаций в месяц, примерно полторы в каждый рабочий день

Рабочая замена обещанию — протокол замера: 80–100 контрольных вопросов, составленных вашими людьми, эталонные ответы к ним, число верных в протоколе приёмки и подпись под этим числом. Методику мы разбирали отдельно — как измерить качество ИИ на своих данных. Без такого протокола любой спор после запуска превращается в обмен впечатлениями.

сравнениеchto-takoe-gallyutsinatsii-neyroseti--02
Обещание «точность 99 %» и три уточняющих вопроса, превращающих его в 30 ошибок в месяц

Слева крупная рамка с надписью «точность 99 %». От неё три стрелки вправо к трём блокам: «На какой выборке? → 100 вопросов = 1 ошибка», «Кто собирал? → подрядчик, под свои возможности», «Что с остатком? → 30 неверных консультаций в месяц». Ниже общая полоса-итог: «3 000 обращений в месяц, 1 % — полторы ошибки в рабочий день». Тонкие чертёжные линии, подписи по-русски.

Одна и та же цифра означает разное в зависимости от того, кто и на чём её получил

Сколько ошибок можно себе позволить

Допустимая доля ошибок — не техническая величина, а экономическая: она считается из цены одной неверной консультации. Единого норматива нет и быть не может. Во внутреннем помощнике, который подсказывает сотруднику, где посмотреть условие, спокойно живут 5 % ошибок: сотрудник видит источник и проверяет за секунды. В ответах клиентам приемлемая граница обычно 1–2 %. В исходящих документах с суммами допустимая доля равна нулю, и там меняется не настройка, а сам режим работы — модель готовит черновик, цифру подставляет учётная система. В модельном примере ниже ИИ-помощник отвечает клиентам сервисной компании, поток 3 000 обращений в месяц.

Во что обходится одна неверная консультация
Разбор случая менеджером, 40 минут при 700 ₽/час467 ₽
Компенсация или скидка в каждом пятом случае, 3 000 ₽ × 0,2600 ₽
Средняя цена одной ошибки1 067 ₽, округляем до 1 070 ₽
Доля ошибок 3 %: 90 случаев в месяц96 300 ₽/мес
Доля ошибок 1 %: 30 случаев в месяц32 100 ₽/мес
ИтогоСнижение с 3 % до 1 % даёт 64 200 ₽ в месяц

Третий и четвёртый слои защиты — сверка со справочником и передача человеку — стоят 78 000–114 000 ₽ и как раз отвечают за этот переход. Окупаются они за 1,2–1,8 месяца: 78 000 ÷ 64 200 ≈ 1,2 и 114 000 ÷ 64 200 ≈ 1,8. Арифметика повторяется на калькуляторе, и именно она, а не общие слова про надёжность, должна стоять в обосновании этих строк сметы.

Отдельно стоит посчитать альтернативу «пусть человек проверяет всё». При трёх минутах на проверку одного ответа 3 000 обращений дают 150 часов, то есть 105 000 ₽ в месяц — дороже, чем стоят сами ошибки при доле 3 %. Работает другой режим: система помечает сомнительные случаи, и проверяются только они. В модельном потоке это около 8 % ответов, 240 штук, 12 часов и 8 400 ₽ в месяц. Разница между 105 000 ₽ и 8 400 ₽ — и есть содержание четвёртого слоя.

графикchto-takoe-gallyutsinatsii-neyroseti--03
Сравнение месячных сумм: 96 300, 32 100, 105 000 и 8 400 рублей при потоке 3 000 обращений

Столбчатая диаграмма из четырёх столбцов на общей рублёвой шкале, верхняя отметка чуть выше самого высокого столбца. Столбцы подписаны: «Ошибки при 3 % — 96 300 ₽/мес», «Ошибки при 1 % — 32 100 ₽/мес», «Сплошная проверка всех ответов — 105 000 ₽/мес», «Выборочная проверка 8 % — 8 400 ₽/мес». Первый и третий столбцы даны сплошной заливкой, второй и четвёртый — штриховкой. Внизу подпись «модельный поток 3 000 обращений в месяц, сентябрь 2026». Тонкие чертёжные линии, подписи по-русски.

Сплошная проверка обходится дороже ошибок, которые она предотвращает

Три вопроса подрядчику про ошибки

  1. 1Как замеряется доля неверных ответов и на чём? Нужен набор из 80–100 контрольных вопросов, составленный вашими сотрудниками, эталонные ответы и число в протоколе приёмки. Формулировка «мы всё протестировали» — не замер.
  2. 2Кто и как часто проверяет качество после запуска? Ответы деградируют: меняются регламенты, приходят новые темы, обновляется модель. Нужен регламент выборочного контроля — сколько диалогов в неделю смотрит человек и по какому чек-листу. Как это устроено, разобрано в материале про выборочный контроль диалогов.
  3. 3Что происходит при росте доли ошибок? В договоре должен быть порог и действие: при превышении такой-то доли сомнительные темы переводятся на оператора, а подрядчик разбирает причину в такой-то срок. Без порога рост ошибок замечают по жалобам клиентов, а не по метрике.
С 1 сентября 2026 у ошибок появилась ещё и правовая цена

С этой даты действует регулирование ИИ: требования к маркировке ИИ-контента и к обработке персональных данных моделями. Практический минимум для компании — внутренняя политика использования ИИ с перечнем разрешённых задач и явным запретом на остальные. Шаблон и разбор — в материале про политику использования ИИ в компании.

Куда ИИ ставить нельзя ни за какие деньги

Есть три класса задач, где ни один из четырёх слоёв не даёт достаточной защиты, потому что цена единичной ошибки несопоставима со всей экономией процесса. Здесь модель допустима только как черновик для человека, который подписывается под результатом.

  • Юридически значимые ответы клиенту. Трактовка условий договора, сроки, основания для отказа. Ответ ИИ здесь становится позицией компании; проверка юристом обязательна, и это не слой защиты, а участник процесса. Ближе всего сюда подходит формат подсказки — проверка договоров с участием юриста.
  • Медицинские рекомендации. Всё, что похоже на назначение, диагноз или оценку симптомов. Допустимая зона — запись, напоминания, маршрутизация обращения; всё остальное решает врач.
  • Финальные суммы в исходящих документах. Счёт, акт, коммерческое предложение, расчёт стоимости. Модель может собрать черновик, но цифра в отправленном документе должна приходить из учётной системы и подтверждаться человеком.

И честный обратный признак: если цена единичной ошибки измеряется сотнями рублей, а поток измеряется тысячами обращений, четыре слоя защиты окупаются за пару месяцев и разговор о выдумках перестаёт быть страшным. Плохо не то, что модель ошибается, а то, что ошибку никто не замечает и не считает.

Точность 99 % без протокола замера — не характеристика системы, а характеристика презентации. Спрашивайте не про проценты, а про то, что происходит с тридцатью ошибками в месяц.