В Новосибирске одна из студенток разработала программу для изучения тибетских текстов

Студентка Новосибирского государственного университета (НГУ) разработала приложение для автоматического распознавания, оцифровки и анализа традиционных тибетских текстов.Девушка работает за компьютером с большим экраномИсточник: Unsplash

«Инновационная программная платформа, предназначенная для автоматизированной работы с документами на тибетском языке, будет востребована среди исследователей, архивистов и библиотекарей. Новый фреймворк должен способствовать сохранению тибетского текстового наследия, которое является частью культурного достояния бурятского народа», — отметили в вузе.

Система ориентирована на старопечатные документы, основанные на тибетском слоговом письме, происходящем от древнеиндийского письма брахми. Ее автором стала студентка направления «Фундаментальная и прикладная лингвистика» гуманитарного института НГУ Анна Мурашкина, работающая в Институте вычислительной математики и математической геофизики Сибирского отделения РАН.

Она использовала изображения страниц классических тибетских текстов XVIII—XX веков из архивов.

«Старопечатные документы, рукописи и ксилографы содержат уникальные сведения о философии, религии, медицине, истории и искусстве, играя важную роль в изучении культурных традиций региона. Эти знания передаются в Тибете из поколения в поколение. Однако со временем, под воздействием природных и антропогенных факторов, бумажные носители подвергаются физическому разрушению, что приводит к утрате ценной информации и ограничивает доступ к этим уникальным материалам. В настоящее время в Тибетском фонде Института монголоведения, буддологии и тибетологии СО РАН хранится около 70 тысяч единиц хроники, которые могут быть утеряны. Один из наиболее надежных способов сохранения и систематизации исторических документов — их оцифровка», — рассказала исследовательница.

Мурашкина решила создать модель с использованием машинного обучения. Ее задачей было распознавать символы тибетского алфавита и переводить тексты в машиночитаемый формат, демонстрируя при этом большую точность, чем уже существующие открытые решения.

Для этого исследовательница вручную выполнила лингвистическую разметку строк тибетского текста и разработала систему оценки качества оптического распознавания символов с учетом особенностей тибетской графики. Затем она сравнила существующие архитектуры и выбрала модель сверхточной нейросети, которая потребовала дообучения.

В результате Мурашкина разработала полный модульный алгоритм оптического распознавания символов, включающий этапы предобработки, сегментации, распознавания и постобработки. У ученых появились новые возможности оцифровки древних тибетских рукописей.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru