Худойбердиев Хуршед Атохонович, Сафаров Ганиджон Хабибуллоевич
Аннотация:
В статье проведён систематический обзор и классификация методов и моделей интеллектуального анализа юридических текстов. Особое внимание уделено перспективам применения рассмотренных методов к таджикскому языку, для которого характерны отсутствие крупных размеченных юридических корпусов и специализированных языковых моделей. Показано, что наиболее обоснованным для построения интеллектуальной правовой системы на таджикском языке является комбинированный подход, сочетающий построение структурированного нормативноправового корпуса, формирование семантического поиска на базе многоязычных векторных представлений и ограниченную генерацию ответов с обязательной привязкой к нормативным источникам.
Ключевые слова: интеллектуальный анализ текста; обработка естественного языка; большие языковые модели; дополненная поиском генерация; юридические тексты; низкоресурсные языки; таджикский язык; семантический поиск; корпусная лингвистика права.

