Прорыв в оптическом распознавании символов: НИТУ МИСИС представляет эффективный способ обработки текстов

Представлен новый метод обучения систем OCR, основанный на интеграции машинного обучения и современных генеративных моделей искусственного интеллекта.В НИТУ МИСИС ускорили настройку системы распознавания текста.В НИТУ МИСИС ускорили настройку системы распознавания текста.Источник: Freepik

Эксперты НИТУ МИСИС предложили новый подход к ускорению процесса оптимизации систем оптического распознавания текста (OCR). Благодаря интеграции технологий машинного обучения и современных генеративных моделей искусственного интеллекта, ученым удалось значительно улучшить точность обработки документов на русском языке и сократить время настройки таких систем с нескольких недель до трех суток, как указано на сайте учебного заведения.

Современные компании активно внедряют технологии цифровизации бумажных материалов — от бухгалтерских отчетов до исторических архивов. Для преобразования изображений документов в читаемый компьютером текст используется технология OCR. Однако традиционные алгоритмы часто делают ошибки, сталкиваясь с помехами, такими как штампы, подписи, искаженные фрагменты или редкие шрифты. Процесс обучения системы занимает значительное время — обычно около месяца.

Группа отечественных специалистов разработала инновационную технологию, объединяющую инструменты машинного обучения и современные генеративные модели искусственного интеллекта. Созданная схема обеспечивает постоянный обмен информацией между движком OCR и языковой моделью, что позволяет автоматически анализировать результаты распознавания и исправлять ошибки. Эта методика значительно ускорила процесс обучения, сократив время полного цикла подготовки системы с традиционных восьми недель до всего лишь 72 часов непрерывной работы.

Дальнейшие исследования и совершенствование методик обучения на основе нейронных сетей позволят создать еще более точные и доступные решения для оптического распознавания текста, применимые как в бизнесе, так и в науке.Дальнейшие исследования и совершенствование методик обучения на основе нейронных сетей позволят создать еще более точные и доступные решения для оптического распознавания текста, применимые как в бизнесе, так и в науке.Источник: Freepik

«Одним из ключевых достижений стало улучшение качества распознавания — оно превысило 90% для русского языка, что соответствует современным требованиям автоматизации документооборота. Кроме того, затраты на обучение моделей удалось сократить почти на треть, а применение генеративных нейросетей уменьшило необходимый объем тестовой выборки», — комментирует один из авторов разработки, магистрант Института компьютерных наук НИТУ МИСИС Кирилл Пронин.

Разработчики тщательно исследовали работу систем на «идеальных» документах и на «реалистичных» сканах с неровными подписями и печатями. Анализ полученных результатов помог выявить оптимальные комбинации используемых технологий.

«Мы предложили подход, в котором языковая модель, понимающая контекст и смысл, помогает создавать более сложные и “хитрые” обучающие данные — например, имитирующие плохое качество печати, нестандартные шрифты или сложную верстку. Это позволяет научить систему распознавать текст в реальных, “неидеальных” условиях, что существенно повышает ее точность и надежность», — заключает к.т.н. Александр Сулейкин, доцент кафедры бизнес-информатики и систем управления производством НИТУ МИСИС.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru