Труды КНЦ. Технические науки. – 2026. - № 1
Труды Кольского научного центра РАН. Серия: Технические науки. 2026. Т. 17, № 1. С. 115-128. Transactions of the Kola Science Centre of r A s . Series: Engineering Sciences. 2026. Vol. 17, No. 1. P. 115-128. Abstract Automating software development and maintenance processes is a key factor in increasing the efficiency and speed of information system creation. As projects become increasingly complex and documentation quality requirements increase, tools that automate source code analysis and the generation of structured descriptions are becoming increasingly important. This article presents a solution for automated documentation of legacy code based on the integration of version control systems and a large language model. The developed pipeline sequentially processes source modules, extracts metadata for software entities (classes, methods, properties), generates descriptions using large language model when they are missing, and automatically publishes the results as wiki documentation in a collaborative development environment. The proposed approach reduces the labor costs of creating and maintaining documentation, ensures its constant synchronization with the code, and improves the quality of project documentation through artificial intelligent descriptions. The solution is designed for projects invarious programming languages that require automatic documentation of legacy code, integration of descriptions into collaborative development systems, and accessibility of documentation via a web interface. Keywords: documentation automation, artificial intelligence, large language model, description generation, static program analysis, legacy project support Acknowledgments: The study was carried out within the framework of the state assignment of the Putilov Institute for Informatics and Mathematical Modeling of the Kola Science Center of the Russian Academy of Sciences from the Ministry of Science and Higher Education of the Russian Federation, research topic: "Methods and technologies for creating intelligent information systems to support the development of complex dynamic systems with regional specificity in conditions of uncertainty and risk" (topic code FMEZ-2025-0053). For citation: Automated hypertext documentation of legacy systems based on static analysis of program code repositories and generative artificial intelligence / A. M. Fedorov [et al.] // Transactions of the Коіа Science Centre of RAS. Series: Engineering Sciences. 2026. Vol. 17, No. 1. P. 115-128. doi:10.37614/2949-1215.2026.17.1.012. Введение Прогресс в сфере информационных технологий во многом основан на автоматизации различных процессов, ключевыми из которых являются разработка и поддержка информационных систем. С появлением больших языковых моделей подходы к этим процессам претерпели существенные изменения. Устаревание существующих информационных систем происходит тем быстрее, чем быстрее развиваются информационные технологии. Современные информационные системы необходимо поддерживать и развивать. Значительная часть используемых сегодня систем строится на комбинации уже функционирующих (унаследованных, устаревших) и новых модулей. Зачастую унаследованные программные модули не имеют должным образом оформленной документации, что приводит к сложностям поддержки и развития всей системы. Извлечение и обогащение данных на естественном языке из унаследованных систем приобрели еще большую актуальность в процессе научно исследовательской работы коллектива авторов по теме «Методы и технологии создания интеллектуальных информационных систем для поддержки развития сложных динамических систем с региональной спецификой в условиях неопределенности и риска» [Информационная...]. В частности, развиваемое направление интеллектуализированного фокусированного сбора данных [Датьев и др., 2024; Федоров и др., 2025] потребовало углубленной концептуальной и практической проработки вопросов, вынесенных в заголовок настоящей статьи. В данной работе решается задача разработки технологии автоматизированного анализа и документирования унаследованной кодовой базы с использованием элементов искусственного интеллекта для облегчения ее сопровождения и модернизации. Подход ориентирован на работу с любыми проектами, обладающими структурированным синтаксисом и поддерживаемыми инструментами автоматизированной документации. Формально задача поставлена следующим образом: дана унаследованная кодовая база, представленная набором исходных файлов, часто с недостаточной или устаревшей документацией. Необходимо разработать метод и инструмент для автоматического преобразования данной кодовой базы в структурированную и связанную документацию в формате, пригодном для коллективного использования разработчиками (вики-система на базе Git). В качестве интеллектуального компонента используются большие языковые модели, технические характеристики которых позволяют им анализировать исходный код,и на его основе генерировать краткие содержательные описания программных сущностей (модулей, классов, методов) на естественном языке. © Федоров А. М., Датьев И. О., Илясов М. О., Вишняков И. Г., 2026 1 1 6
Made with FlippingBook
RkJQdWJsaXNoZXIy MTUzNzYz