Труды КНЦ. Технические науки. – 2026. - № 1
становится мало эффективным. Кроме того, лексикон социальных сетей обновляется быстрее, чем успевают создаваться и обучаться лингвистические ресурсы и модели. Исходя из имеющегося практического опыта извлечения знаний из социальных медиа, в частности из «Вконтакте» [Пимешков и др., 2024, Pimeshkov et al., 2025], существует также ряд структурных ограничений, которые могут затруднять процесс извлечения мнений. Например, публикации и комментарии, как правило, ограничены по длине, из-за чего могут содержать меньше оценочной лексики. Наряду с этим также возникает проблема кореференции — местоимения в коротких постах или ветках комментариев часто отсылают к объектам, упомянутым несколькими сообщениями выше, что требует использование моделей, способных решать такую задачу. Необходимо дополнительно фильтровать контент социальных сетей, поскольку для них характерно наличие спама, рекламы, ботов, оффтоп-обсуждений (отклоняющихся от целевой темы), которые не содержат каких-либо выражений мнений. В дополнение к этому фейковые дезинформирующие публикации в том числе порождают «искусственные» мнения, которые также целесообразно выявлять в рамках анализа. С другой стороны, текстовый контент социальных медиа всегда снабжен некоторой метаинформацией, анализ которой может облегчить решение задач извлечения различных атрибутов тонального высказывания. В частности, все сообщения в социальных медиа имеют связанный идентификатор авторства, временные метки и другие атрибуты. Кроме того, сообщения, как правило, являются компонентами ветки обсуждения, что позволяет определить некоторые свойства «транзитивно». Эти особенности расширяют проблематику семантического анализа контента социальных медиа за пределы классических задач NLP. Таким образом, извлечение мнений из социальных медиа является довольно трудоемкой задачей. Успешное ее решение требует создания гибридных систем, которые комбинируют устойчивые NLP -модели, анализ сетевой структуры и мультимодальную архитектуру. М етоды анализа мнений Традиционно методы анализа мнений можно разделить на 4 основные группы: методы на основе правил и словарей; машинное обучение; глубокое обучение; гибридные методы. Первые наиболее распространенные методы извлечения мнений основывались на прямом применении лингвистических правил и знаний. В основе лежат словари оценочной лексики (например, SentiWordNet, AFINN), где словам присвоены заранее известные полярность и ее сила. Алгоритмы анализируют текст, ищут слова из словаря и применяют к ним набор лингвистических правил. Например, в работе [Ahmed, Danti, 2016] предложен подход, позволяющий оценить тональность семью категориями (strong-positive, positive, weak-positive, neutral, weak-negative, negative и strong-negative) с использованием правил и SentiWordNet. Он продемонстрировал высокую точность при определении тональности онлайн-обзоров книг и политических текстов. С распространением доступных размеченных корпусов (например, отзывов с рейтингами) доминирующей парадигмой стало классическое машинное обучение. Задача формулируется как классификация (позитив/негатив/нейтрал) или регрессия (предсказание рейтинга). Текст представляется в виде вектора признаков (feature vector) с помощью мешка слов, статистических мер (TF-IDF) и др., на которых затем обучаются классические модели: Naive Bayes, SVM , логистическая регрессия, деревья решений. Например, в работе [Dulhare, Arif, 2017] сравнивалась эффективность двух классификаторов — Naive Bayes и максимальной энтропии — для анализа мнений в Twitter. Благодаря глубокому обучению модели стали самостоятельно извлекать иерархические и семантически важные представления текста. Вместо ручного конструирования признаков используются нейронные архитектуры (CNN , RNN , LSTM, Transformer), которые учатся распределенным векторным представлениям (эмбеддингам) слов и предложений. В работе [Yibeyin et al., 2024] оценили эффективность данных архитектур для анализа общественного мнения на малоресурсном амхарском языке. Гибридная модель CNN-BiLSTM показала наилучшие результаты, превзойдя RNN благодаря своей способности извлекать как прямую, так и обратную контекстную информацию из текста, а также возможностям CNN по извлечению признаков. Труды Кольского научного центра РАН. Серия: Технические науки. 2026. Т. 17, № 1. С. 105-114. Transactions of the Kola Science Centre of r A s . Series: Engineering Sciences. 2026. Vol. 17, No. 1. P. 105-114. © Никонорова М. Л., Шишаев М. Г., Штангель В. А., 2026 1 1 1
Made with FlippingBook
RkJQdWJsaXNoZXIy MTUzNzYz