Труды КНЦ. Технические науки. – 2026. - № 1

Труды Кольского научного центра РАН. Серия: Технические науки. 2026. Т. 17, № 1. С. 129-142. Transactions of the Kola Science Centre of RAS. Series: Engineering Sciences. 2026. Vol. 17, No. 1. P. 129-142. Рис. 5. Схема работы RAG-технологии Fig. 5. RAG technology operation diagram Принцип работы RAG-технологии можно описать следующим образом. Запрос пользователя преобразуется с применением модели эмбеддинга HuggingFaceEmbeddings в численное векторное представление. На основе специальных метрик происходит поиск по ВБД наиболее близких по семантике векторов, которые связаны с текстовыми фрагментами исходного текста. Далее, извлеченные векторы преобразуются в текстовый вид, формируя контекст запроса. После этого контекст объединяется с исходным запросом, тем самым создается итоговый промпт, который затем отправляется языковой модели для генерации финального ответа. Данный подход позволяет снизить количество «галлюцинаций», характерных для любой БЯМ. Для оценки релевантности фрагментов текста применяются специальные метрики. В данной работе используется метрика косинусного расстояния [Configuring...]. М одуль генерации ответа Получение ответа на запрос пользователя по сгенерированному контексту является заключительным этапом работы RAG -технологии. В настоящей работе для локального развертывания большой языковой модели применяется Ollama [Ollama’a Documentation]. Ollama представляет собой платформу для запуска и управления БЯМ, а также содержит встроенную библиотеку моделей. В качестве БЯМ для генерации ответов применялась llama3.1:8b [llama3.1:8b], которая характеризуется 8 миллиардами параметров. Выбор модели обусловлен следующими критериями: 1) высокие способности к пониманию контекста и генерации связного текста при низких требованиях к аппаратному обеспечению (видеокарта ~ 4 Гб); 2) поддержка моделью нескольких языков, в том числе русского; 3) полная совместимость с Ollama, наличие исчерпывающей документации. Одним из наиболее важных элементов при разработке систем, базирующихся на применении БЯМ, являются промпты [Цзяншу и др., 2025]. Промпт — это специальная системная инструкция для модели, которая определяет ее поведение, стиль речи и напрямую влияет на качество генерации ответа на запрос пользователя. Для управления процессом генерации и обеспечения стабильности ответов применяются стандартные параметры языковой модели, описанные ниже: 1) параметр temperature контролирует случайность (энтропию) выбора слов. Для него устанавливается низкое значение в случае запросов, предполагающих предоставление конкретных фактов, и более высокое при составлении творческих резюме, а также для ответов на общие запросы; 2) параметр top_p отвечает за разнообразие лексики при сохранении смысловой точности. Ограничивает выбор слов верхним процентом распределения вероятностей, оставляет только наиболее вероятные и осмысленные слова; 3) параметр m a x to k e n s задает верхний предел длины генерируемого ответа в токенах. Ограничивает длину ответа, предотвращая избыточные и нерелевантные «рассуждения» модели; 4) параметр repeat_penalty увеличивает «штраф» за повторное использование недавно сгенерированных токенов. Применяется для снижения вероятности повторения одних и тех же фраз в ответе. В рамках исследований осуществлена типизация пользовательских запросов и разработаны специализированные шаблоны промптов для их обработки. Были выделены следующие типы запросов пользователей: 1) запросы на обобщение информации, нацеленные на сжатие и краткий пересказ информации с минимальной детализацией; 2) запросы на обзор документа, обеспечивающие генерацию полноценного описательного обзора; 3) запросы на проверку наличия информации, подразумевающие четкий утвердительный © Шестаков А. В., Зуенко А. А., Зуенко О. Н., 2026 1 3 5

RkJQdWJsaXNoZXIy MTUzNzYz