Труды КНЦ. Технические науки. – 2026. - № 1

Труды Кольского научного центра РАН. Серия: Технические науки. 2026. Т. 17, № 1. С. 129-142. Transactions of the Kola Science Centre of RAS. Series: Engineering Sciences. 2026. Vol. 17, No. 1. P. 129-142. Для преодоления трудностей, которые на текущий момент существуют при поиске информации на сайте ФИЦ КНЦ РАН, предлагается разработать специализированный диалоговый интерфейс (чат-бот), позволяющий организовать общение с пользователем на естественном языке. Чат-бот предполагается реализовать в виде отдельной страницы сайта, которая предоставляет расширенный функционал для выполнения поисковых запросов, как типовых, так и ad-hoc, что обеспечит переход от классической навигации по гиперссылкам и поиску по ключевым словам к взаимодействию с пользователем в формате диалога на естественном языке. В статье представлена гибридная архитектура разрабатываемой системы интеллектуального поиска, основанная на совместном применении больших языковых моделей (БЯМ, LLM) [Manning, 2022; Mitchell, Krakauer, 2022; LitLLM, 2024] и механизме извлечения релевантной информации (Retrieval-Augmented Generation, RAG) [Олейник и др., 2023; Шестаков и др., 2025; Gao et al., 2026]. В рамках соблюдения политики информационной безопасности ФИЦ КНЦ РАН с целью исключения возможности передачи конфиденциальных сведений внешним сервисам было принято решение о локальном развертывании программной системы на сервере Института информатики и математического моделирования ФИЦ КНЦ РАН (ИИММ КНЦ РАН). Применение RAG-технологии позволяет снизить риск генерации БЯМ ложных фактов («галлюцинаций») за счет возможности задания контекста запроса, тем самым повышаются релевантность и точность ответов, генерируемых БЯМ. Технология обеспечивает извлечение из корпуса документов фрагментов, релевантных запросу пользователя, и организует их передачу БЯМ в качестве контекста для генерации итогового ответа, что позволяет использовать модель без необходимости ее переобучения. В рамках предлагаемой архитектуры за парсинг, включая обработку структуры сайта, извлечение текста из документов различных форматов и преобразование текстовой информации в векторные представления (эмбеддинги) перед непосредственной передачей их в БЯМ, отвечает специализированный модуль предобработки и векторизации данных. Именно на основе векторного представления осуществляется семантический поиск информации. Представленная статья описывает этап разработки архитектуры системы, а также начальные этапы программной реализации ее базовых функций. Сайт ФИЦ КНЦ РАН как и сточник данны х Для определения логики парсинга и учета специфики данных при семантическом поиске необходимо использовать метаинформацию о структуре сайта (рис.1). Рис. 1. Иерархическая схема основных компонент сайта ФИЦ КНЦ РАН Fig. 1. Hierarchical diagram of the main components o f the FRC KSC RAS website © Шестаков А. В., Зуенко А. А., Зуенко О. Н., 2026 1 3 1

RkJQdWJsaXNoZXIy MTUzNzYz