Разработан многофункциональный инструмент для оценки русскоязычных ИИ-ассистентов

Российские ученые разработали универсальный метод, позволяющий всесторонне оценивать качество функционирования русскоязычных систем генеративного искусственного интеллекта, дополненных поисковыми функциями.Нейросеть для генерации текстаИсточник: Hi-Tech Mail

Эта разработка будет продемонстрирована на крупнейшей международной конференции в области компьютерной лингвистики EACL 2026, которая проходит на этой неделе в Марокко.

«Сегодня основной интерес со стороны компаний сосредоточен на качестве извлечения данных, их актуальности и строгом контроле фактов. Методология легко адаптируется к любым языкам и сценариям — от анализа научных публикаций до судебных документов, что делает ее основой для создания надежных ИИ-систем в различных отраслях», — отметил руководитель центра разработки больших языковых моделей MWS AI Валентин Малых.

Как указывается в сообщении, многие крупные компании активно используют большие языковые модели для создания помощников, способных извлекать уже известные данные из корпоративных баз знаний и информационных систем, а также находить новую информацию по заданной теме в глобальной сети при подготовке ответов на запросы пользователей. Для обеспечения корректной работы этих ИИ-помощников крайне важно, чтобы они допускали минимальное количество ошибок и как можно реже генерировали галлюцинации.

Чаще всего для решения этой задачи применяются стандартизированные тесты, которые либо не отражают поведение таких систем в реальных условиях из-за несоответствия между тестовыми данными и базами знаний конкретной компании, либо основываются на статичных наборах данных, которые со временем устаревают и могут попадать в обучающую выборку моделей, что снижает объективность тестирования.

Исследователи из России разработали метод, который позволяет автоматизировать процесс подготовки этих тестов, делая их максимально актуальными. В рамках этого подхода система использует свежие новостные потоки и автоматически создает из них «карту знаний», выделяя новые факты, отсутствующие в архивах, и на их основе формирует многоуровневые логические задачи для проверки способности ИИ-помощника сопоставлять факты и решать другие задачи.

Опираясь на данный метод, ученые оценили качество работы нескольких ИИ-помощников, основанных на популярных открытых языковых моделях, и создали первый публичный рейтинг для таких систем. В будущем, разработка исследователей и созданный ими рейтинг помогут компаниям быстро оценивать точность работы их ИИ-ассистентов и сравнивать их эффективность с уже существующими решениями подобного рода.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru