Неопределённое выводение
Неопределённый вывод (англ. uncertain inference) — формальная концепция, впервые описанная К. Дж. ван Рейсбергеном для описания соотношения между запросом и документом в задачах информационного поиска. В этой формализации отношение между запросом и документом выражается как логическая импликация, дополненная мерой неопределённости. Концепция оценки неопределённости стала критически важной для современных систем искусственного интеллекта и включена в разрабатываемый стандарт ISO/IEC AWI TS 25223.
Определения
Ван Рейсберген предложил определять меру неопределённости между документом d и запросом q как вероятность их логической импликации:
Пользовательский запрос интерпретируется как совокупность утверждений о требуемом документе. Система должна, получив конкретный документ, выяснить, выполняются ли эти утверждения. Если выполняются — документ подлежит выдаче. Однако зачастую содержимое документов недостаточно для однозначного вывода истинности утверждений запроса. Для этого привлекается база знаний с фактами и правилами, но и они могут быть неопределёнными, поскольку некоторые факты используются с определённой вероятностью. В связи с этим этот подход называют также правдоподобным выводом. Правдоподобие вывода определяется функцией правдоподобия для каждого отдельного утверждения запроса. Вместо того чтобы извлекать только документы, полностью совпадающие с запросом, предлагается ранжировать их по степени правдоподобия относительно запроса. Поскольку как документы, так и запросы генерируются пользователями, они подвержены ошибкам, поэтому является неопределённым. Это влияет на правдоподобие формулировки запроса.
Подобный подход позволяет добиться двух целей:
- Разделить процессы пересмотра вероятностей и логического вывода
- Разделить обработку релевантности от обработки пользовательских запросов
Мультимедийные документы (изображения, видео) имеют разные свойства для вывода по сравнению с текстовыми документами. Модели правдоподобного вывода позволяют объединять вероятности, характеризующие различные свойства разных типов данных.
Неопределённый вывод обобщает понятия автоэпистемической логики, где значения истинности утверждений могут быть известны или неизвестны, а если известны — принимать значения «истина» или «ложь».
В современных нейросетевых моделях отношение моделируется через байесовские функции скоринга и байесовские нейронные сети (например, с использованием Monte Carlo Dropout). Для оценки соответствия предсказанных вероятностей реальной точности применяются методы калибровки уверенности, такие как ECE (Expected Calibration Error) и ERCE (Expected Ranking Calibration Error).
Пример
Если запрос имеет форму:
где A, B и C — отдельные утверждения запроса, то для некоторого документа D интерес представляет вероятность:
Преобразовав это выражение к условной вероятности и принимая независимость утверждений запроса, общую вероятность импликации можно найти как произведение вероятностей для отдельных утверждений.
В контексте больших языковых моделей (LLM) высокая вероятность импликации может сочетаться с фактической недостоверностью документа D. Поскольку архитектура LLM устроена как система предсказания следующего токена, модель не проверяет истинность фактов. Это приводит к уверенным галлюцинациям: нейросеть с высокой уверенностью генерирует вывод q из недостоверного текста, так как для неё убедительно написанное предложение с вымышленным фактом равноценно истинному[1].
Дальнейшие исследования
У. Б. Крофт и Р. Кровец[2] применили неопределённый вывод в системе информационного поиска офисных документов, получившей название OFFICER. Для таких документов предположение о независимости атрибутов запроса справедливо, поскольку обычно запрос касается отдельных характеристик. Помимо анализа содержимого документов, возможно выполнение запросов по автору, размеру, теме или коллекции. Учёные разработали методы сопоставления свойств документа и запроса, вычисления их правдоподобия и объединения в итоговую оценку для каждого документа. Специфическим вопросом было также учёт неопределённости содержания как документов, так и запросов.
Сети вероятностной логики реализуют неопределённый вывод, при этом значения истинности выражаются не только вероятностью, но и уровнем доверия, показывающим степень определённости оценки.
Сети Маркова с логикой позволяют выполнять неопределённый вывод с использованием принципа максимальной энтропии, аналогично тому, как марковские цепи описывают неопределённость конечных автоматов.
В современных исследованиях принцип максимальной энтропии применяется для оценки эпистемической неопределённости и предотвращения избыточной уверенности глубоких нейросетей на неизвестных данных. К таким методам относятся Maximum Weight Entropy (MaxWEnt), который выбирает распределение весов с максимальной энтропией для максимизации разнообразия гипотез при сохранении приемлемого эмпирического риска, и MaxWEnt-SVD, учитывающий корреляции между нейронами через сингулярное разложение для более эффективного увеличения энтропии весов и улучшения калибровки неопределённости[3]..
Применение в современных ИИ-системах
Проблема избыточной уверенности
Вербализованная уверенность языковых моделей (LLM) часто не совпадает с их реальной точностью. Заявленный уровень уверенности представляет собой лишь сгенерированную последовательность токенов, а не отражение внутренней вероятности правильности ответа. Процесс обучения с подкреплением (RLHF) может усугублять эту проблему, поскольку он вознаграждает уверенно звучащие ответы и штрафует модель за сомнения, что приводит к чрезмерной самоуверенности[4]. Для борьбы с галлюцинациями оценка неопределённости используется в качестве управляющего сигнала: если система не уверена в найденных доказательствах или генерируемом ответе, она может отфильтровать данные или полностью отказаться от ответа[5]. Среди методов решения проблемы выделяются:
- агрегация лог-вероятностей — усреднение вероятностей значимых токенов[4];
- оценка семантической энтропии — генерация нескольких вариантов ответа и вычисление энтропии для выявления смысловых противоречий[4];
- формализация состояния «неизвестно» с помощью специализированных фреймворков (например, ValidLogic4LLM). Подобные системы используют размеченные логические программы для проверки утверждений модели, агрегируя результаты в итоговый статус неуверенности.
Методы интеграции в RAG
В современных архитектурах RAG применяются алгоритмические методы для оценки неопределённости. Среди них выделяется адаптивный поиск, независимый от LLM (LLM-independent adaptive retrieval), где решение о необходимости обращения к поиску принимается классификатором на основе оценки знаний модели, вычисляемой через её вербализованную неопределённость[6]. Также используются архитектуры, которые разделяют достоверные факты и неопределённые выводы: Bayesian RAG, интегрирующая эпистемическую неопределённость в процесс поиска; Confidence-Aware RAG, применяющая многоуровневую стратегию проверки фактов; и FRANQ, разделяющая оценку достоверности и верности вывода извлечённому контексту[7][8][9].
Стандартизация и интерфейсы
Требования к оценке неопределённости в системах искусственного интеллекта разрабатываются в рамках стандарта ISO/IEC AWI TS 25223 («Information technology — Artificial intelligence — Guidance and requirements for uncertainty quantification in AI systems»).
В пользовательских интерфейсах применяются различные способы визуализации неопределённого вывода и сообщения о степени достоверности фактов. К ним относятся отображение точной вероятности или уровня уверенности, использование хеджирующего языка (оговорок), а также выделение токенов с наименьшей вероятностью генерации[10].