Con el objetivo de contribuir a la preservación de las lenguas indígenas y fortalecer la investigación en tecnologías del habla, académicos de la Benemérita Universidad Autónoma de Puebla (BUAP) desarrollaron el proyecto ZETZOHO-YUHMU. SPEECH DATASET, un repositorio de datos orientado al estudio de la lengua Yuhmu, una variante del otomí que cuenta con pocos recursos digitales y se encuentra en peligro de extinción.
El proyecto es encabezado por los catedráticos e investigadores de la Facultad de Ciencias de la Computación de la BUAP, Arturo Olvera López e Iván Olmos Pineda. El repositorio está diseñado para apoyar investigaciones en reconocimiento automático del habla (ASR, por sus siglas en inglés) y el análisis de la pronunciación en escenarios con información lingüística limitada.
Inteligencia artificial para preservar lenguas indígenas.
El conjunto de datos proporciona una base para el desarrollo de sistemas destinados a la retroalimentación de la pronunciación en los procesos de aprendizaje de idiomas, así como para fortalecer los esfuerzos en la documentación y preservación de las lenguas indígenas en México.
El investigador Arturo Olvera López destacó que el repositorio es de libre acceso y representa una herramienta valiosa para la comunidad académica: “El repositorio es de libre acceso y puede ser de mucha utilidad para la comunidad que hace investigación relacionada al procesamiento del lenguaje natural considerando lenguas indígenas en México que actualmente están poco representadas respecto a la cantidad de personas hablantes de la lengua”.
Colaboración interinstitucional.
En el proyecto también colaboran Eric Ramos-Aguilar, Ricardo Ramos-Aguilar y Daniel Sánchez-Ruiz, investigadores de la Unidad Profesional Interdisciplinaria de Ingeniería del Instituto Politécnico Nacional, campus Tlaxcala (UPIIT-IPN). El repositorio puede consultarse en el conjunto de datos de voz de Zetzoho-Yuhmu, disponible en GitHub.





