Для ингушского языка создали первый морфологический анализатор и корпус из полумиллиона словоформ
Лингвисты и разработчики решили фундаментальную проблему для языка, не имевшего цифровых ресурсов, построив инструменты автоматической обработки с нуля и преодолев спорность академических описаний.
Для ингушского языка создали первый морфологический анализатор и размеченный корпус. До этого не было ни того, ни другого, а академические описания грамматики часто были неполными и противоречивыми. Значительную часть работы составила проверка реальности существования многих грамматических форм.
Объем корпуса составил около полумиллиона словоформ. Каждая из них прошла проверку на корректность и употребление. Например, для одного из глаголов было выявлено и описано 98 форм.
Этот ресурс - необходимый базис для разработки инструментов автоматической обработки языка. Без таких структурированных данных создание чат-ботов, систем проверки орфографии или машинного перевода для ингушского было бы невозможно. Современные большие языковые модели требуют огромных массивов текстов, и отсутствие корпусов для малых языков ставит их на грань цифрового забвения.
Методология проекта, сочетающая автоматическую генерацию языковых парадигм с тщательной экспертной проверкой каждой формы, может послужить примером для работы с другими языками, имеющими ограниченные ресурсы. Для разработчиков это показывает, что технологический барьер для поддержки малых языков можно преодолеть. Появление структурированных данных дает возможность местным IT-сообществам создавать прикладные решения, от образовательных приложений до голосовых интерфейсов, способствуя более инклюзивному цифровому пространству.


