Ученые Кольского научного центра РАН разработали и протестировали новый подход к интеграции больших языковых моделей (Large Language Models, LLM) искусственного интеллекта для анализа информации из социальных сетей. Это станет шагом к созданию «ответственного ИИ», сообщили в Министерстве науки и высшего образования РФ.
«Исследователи из Института информатики и математического моделирования Кольского научного центра РАН Андрей Федоров, Игорь Датьев и Иван Вишняков разработали и протестировали новый гибридный подход к интеграции LLM в системы мониторинга открытых данных социальных медиа. Этот метод уже внедрен в созданную авторами систему и может быть использован в региональном управлении, экстренных службах, аналитических центрах или даже в научных проектах, где важна не только скорость обработки данных, но и их достоверность», — сказано в сообщении.
В Минобрнауки уточнили, что соцсети могут быть надежным источником для анализа общественных настроений, однако традиционные методы использования LLM сталкиваются с тем, что такие модели склонны к генерации правдоподобной, но фактически недостоверной информации.
Ученые в своих исследованиях предложили три варианта последовательности действий, в которых LLM взаимодействует с реальными данными: прямой запрос — самый простой, но наименее стабильный. Второй — конвейер с предварительным извлечением ключевых слов, на основе которых формулируются темы. В третьем — кластерном — тексты преобразуются в векторы с помощью LLM, группируются по схожести, а затем каждая группа кластеров обобщается отдельно.
«Эксперименты проводились на двух реальных наборах данных из домовых чатов. Первый подход продемонстрировал хорошие результаты на небольших объемах данных, но страдает от вариативности формулировок и низкой прослеживаемости. Второй обеспечил неплохой баланс между стабильностью и точностью, особенно при средних объемах данных. Кластерный подход показал наилучшие результаты на большом наборе данных: 100% стабильность и 94% прослеживаемости. Это делает его наиболее перспективным для масштабного мониторинга общественных мнений», — отметили в Минобрнауки.
Исследование подтвердило, что эффективность и надежность LLM при мониторинге соцсетей существенно зависят от архитектуры обработки данных. Эффективность может продемонстрировать только хорошо продуманный гибридный подход, который объединяет классические методы информационного поиска, машинного обучения и генеративного ИИ. «Работа ученых из КНЦ РАН — это не просто техническое усовершенствование алгоритмов, а важный шаг к созданию “ответственного ИИ”, результаты которого можно проверить, понять и которым можно доверять, особенно когда речь идет об анализе общественных настроений — чувствительном и социально значимом процессе», — заключили в Минобрнауки.
Фото: hi-tech.mail.ru

