Холов Шавкат Ёрович, К.М. Бобобеков, Абдуллозода Хусейн Садулло, Абдуллозода Хасан Садулло
Аннотация:
Галлюцинации - фактически ошибочные, но уверенно сформулированные ответы - остаются одной из ключевых проблем современных больших языковых моделей (LLM). В данной работе предлагается гибридный пайплайн, объединяющий Retrieval-Augmented Generation (RAG) с верификационным модулем на основе классических методов машинного обучения (SVM, логистическая регрессия) для автоматического обнаружения и исправления галлюцинаций. Предложенная архитектура протестирована на корпусе университетских академических документов на английском и таджикском языках. Экспериментальные результаты показывают, что гибридный подход снижает уровень галлюцинаций на 41 % по сравнению с базовым LLM и на 23 % по сравнению с RAG без верификации, достигая значения F1-меры 0,90 для английского и 0,85 для таджикского корпуса.
Ключевые слова: галлюцинации LLM, RAG, верификация фактов, классическое машинное обучение, SVM, таджикский язык, университетские документы, снижение галлюцинаций.

