Перейти к содержимому

Ловим галлюцинации ИИ: 3 ограждения для B2B-команд

Резюме решения: ИИ ошибается — важна скорость отлова. Три проверенных ограждения: цитата источника, проверка правилами, человеческое одобрение. Останавливайте ошибки до прода.

Как выглядят галлюцинации ИИ в реальных B2B-воркфлоу

Галлюцинация — это когда модель генерирует уверенно звучащий, но неверный ответ. В B2B встречается в трёх классических формах: (1) выдумывает несуществующий номер заказа для запроса в поддержку, (2) "цитирует" дату, которой нет в договоре, при суммировании, (3) изобретает новую категорию при классификации счетов вне заданного набора.

Все три имеют один паттерн: без настоящей опоры модель заполняет пустоту. Проблема в том, что вывод выглядит уверенно — даже когда неверен. "ИИ ошибается" — недостаточно; нужно знать где и почему. Три ограждения ниже это делают.

Три ограждения: источник, правило, человек

1) Цитата источника: модель возвращает каждый ответ с id или номером строки исходного документа. Без источника отвечает «не знаю». Галлюцинации падают на ~80%.

2) Проверка правилами: валидируем вывод по доменным правилам до выдачи — номер заказа 8 цифр? Категория счёта в списке? Формат даты валиден? Эти дешёвые Python-проверки ловят большинство.

3) Человеческое одобрение: рискованные действия (возвраты, подписание договора) предлагает ИИ, одобряет человек. ИИ делает ~95% сам; 5% исключений идут к вам на ревью.

Три вместе: в независимом аудите процент галлюцинаций падает ниже 2%.

Выстраивание процесса оценки перед запуском

Уловить частоту галлюцинаций на глаз невозможно — нужен тестовый набор. Соберите золотой набор из 50–200 реальных примеров с известными правильными ответами и убедитесь, что он охватывает пограничные случаи — отсутствующие данные, неоднозначные запросы, обращения вне области применения. Прогоняйте модель на нём перед каждым изменением промпта или модели, а не только при запуске.

Отслеживайте два отдельных показателя: точность (дала ли модель правильный ответ) и долю воздержания (правильно ли модель сказала «я не знаю», когда это было нужно). Модель, которая никогда не воздерживается, выглядит уверенно, но несёт больший риск; модель, которая воздерживается слишком часто, раздражает, но безопаснее. Правильный порог зависит от того, насколько дорого обходится неверный ответ по сравнению с отложенным.

Состязательное тестирование важно не меньше, чем тестирование на обычных случаях — намеренно подавайте модели запросы, специально сконструированные для провоцирования галлюцинаций: вопросы о несуществующих сущностях, запросы, смешивающие две записи воедино, промпты, требующие экстраполяции за пределы исходного документа. Если модель не может изящно провалиться в контролируемом тесте, она не сможет изящно провалиться и в продакшене.

Относитесь к этому как к живому конвейеру, а не разовому контрольному пункту. Каждый раз, когда вы меняете промпт, заменяете модель или добавляете новый источник документов, заново прогоняйте набор для оценки и сравнивайте новые показатели точности и воздержания с базовым уровнем перед развёртыванием. Это та же дисциплина, что и регрессионное тестирование в традиционной разработке ПО, — только оно проверяет суждение, а не логику.

Какие задачи несут наибольший риск галлюцинаций

Не каждая задача ИИ несёт одинаковый риск, поэтому и бюджет на защитные механизмы не должен распределяться равномерно. Свободная генерация — набросок письма клиенту, резюмирование встречи, написание маркетингового текста — оставляет простор для творчества, но именно в этом просторе и прячется галлюцинация: выдуманная статистика, вымышленные цитаты, обещания, которые компания никогда не давала. Это категория наивысшего риска, потому что нет фиксированного «правильного» результата, с которым можно сверяться, — есть только диапазон приемлемых вариантов.

Числовое и финансовое извлечение данных стоит близко к этой категории. Извлечение итоговой суммы из счёта, расчёт скидки, извлечение налогового номера — ошибки здесь тихие (число выглядит правдоподобно) и дорогостоящие (оно напрямую влияет на движение денег). Юридические и медицински окрашенные утверждения — договорные обязательства, формулировки о соответствии требованиям, дозировки или предписания по безопасности — относятся к тому же уровню высокого риска: ошибиться здесь один раз — и результатом станет не неловкость, а юридическая ответственность.

На другом конце шкалы структурированное извлечение по фиксированной схеме — разобрать резюме на имя/email/навыки, классифицировать обращение по одной из 12 категорий, присвоить транзакции код продавца — относительно низкорисково. У модели меньше простора для выдумки, потому что пространство результатов ограничено и легко проверяется механически: можно проверить, что категория существует, что в email есть значок @, что значение входит в число 12 вариантов. Классификация в небольшой закрытый набор ведёт себя так же — даже когда модель ошибается, она ошибается в рамках заданных вами границ, а это принципиально более дешёвый режим сбоя.

Используйте этот градиент, чтобы решить, куда направить усилия по защите. Низкорисковые задачи с закрытой схемой часто можно запускать с лёгкой валидацией и выборочными проверками. Высокорисковые, свободные или числовые/юридические задачи заслуживают полного набора мер из предыдущего раздела — ссылки на источник, проверки по правилам и человека в контуре — прежде чем допускать автоматизацию до клиента или бухгалтерской книги.

Методология

Утверждения оцениваются по реализуемости, стоимости, риску и измеримости. Примеры расчётов — допущения; юридические и безопасностные решения требуют первичных источников.

Примечание об источниках

Ссылки и названные документы — отправные точки. Непроверенные результаты клиентов не публикуются.

Журнал изменений

— Нативная редакторская проверка ожидает у шлюза публикации v3.0.

Частые вопросы

Что такое галлюцинация ИИ?

Уверенно звучащий, но ложный результат — выдуманная ссылка на источник, неверное число, правило, которого не существует. Это статистический режим сбоя, а не баг, который чинят один раз; системы нужно проектировать в расчёте на то, что это произойдёт.

Как автоматически обнаруживать галлюцинации?

Многослойными проверками: опирайте ответы на собственные документы и отклоняйте неподкреплённые утверждения, сверяйте структурированные результаты со схемами и базами данных, а случаи с низкой уверенностью направляйте в очередь к человеку. Журналирование каждого ответа вместе с его источниками делает аудит возможным.

Какие бизнес-процессы больше всего рискуют из-за галлюцинаций?

Везде, где модель пишет факты, на которые будут полагаться клиенты или регуляторы: ценовые предложения, юридические и комплаенс-тексты, медицинские или финансовые рекомендации. Оставьте там одобрение за человеком: пусть ИИ готовит черновик, но никогда не отправляет автоматически.