Обширные языковые модели совершают множество ошибок в процессе диагностики депрессии

Их объяснения в среднем имеют более двух ошибок, что значительно сужает их использование в медицинской практике и указывает на необходимость доработки системДепрессияИсточник: Unsplash

МОСКВА, 27 ноября. /ТАСС/. Российские ученые провели исследование, чтобы выяснить, насколько эффективно большие языковые модели, другие формы систем машинного обучения и традиционные алгоритмы распознают признаки депрессии в текстах на русском языке. Результаты тестов показали, что большие языковые модели превосходят остальные системы, однако они совершают множество ошибок в диагностике, сообщает пресс-служба Института искусственного интеллекта AIRI.

"Наше исследование демонстрирует, что потенциал использования больших языковых моделей в качестве скрининговых или вспомогательных инструментов весьма высок, но перед их внедрением в клиническую практику необходимо не только улучшить интерпретируемость и качество объяснений, но и решить вопросы расширения клинической базы", — отметил научный сотрудник группы "Обучение на слабо размеченных данных" AIRI Глеб Кузьмин, слова которого приводятся пресс-службой института.

Специалисты из AIRI, а также ФИЦ ИУ РАН, ИСП РАН, МФТИ, РУДН и MBZUAI впервые всесторонне проанализировали, насколько эффективно распознают депрессию различные большие языковые модели, нейросети-трансформеры и традиционные алгоритмы машинного обучения. Для этого они подготовили набор текстов, написанных как здоровыми людьми, так и клинически подтвержденными носителями депрессии, а также собрали группу клинических психологов для оценки объяснений, генерируемых ИИ.

В этот набор тестовых примеров, как указывают исследователи, входили 500 коротких эссе, написанных здоровыми добровольцами и носителями депрессии специально для этого проекта, а также набор сообщений в социальных сетях, оставленных русскоязычными пользователями во время пандемии и в другие периоды. Эти данные были специально размечены и использованы как для обучения систем ИИ, так и для оценки качества их работы.

Проверки, проведенные учеными, продемонстрировали, что большие языковые модели значительно опережают традиционные методы, особенно на небольших и "шумных" наборах данных, где тексты сильно варьируются по длине и жанру. В то же время классические системы машинного обучения и трансформеры в целом показывали сопоставимые результаты с большими языковыми моделями при использовании клинически валидированных данных для их обучения.

Эксперты-психологи пришли к выводу, что большие языковые модели допускают много ошибок при постановке диагнозов. Подготовленные ими объяснения в среднем содержат более двух ошибок, включая тавтологию, ложные выводы и некорректные медицинские представления о депрессии. Это существенно ограничивает их применение в медицинской практике и подчеркивает необходимость доработки этих систем, резюмировали ученые.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru