Académicos de la Facultad de Ciencias de la Computación de la BUAP desarrollaron ZETZOHO-YUHMU. Speech Dataset, un repositorio de libre acceso diseñado para impulsar la investigación sobre la lengua Yuhmu, una variante del otomí considerada de pocos recursos y en riesgo de desaparición.
El proyecto es encabezado por los investigadores Arturo Olvera López e Iván Olmos Pineda, quienes buscan generar herramientas tecnológicas que contribuyan tanto al estudio de las lenguas indígenas como a su preservación.
El conjunto de datos está orientado al desarrollo de sistemas de Reconocimiento Automático del Habla (ASR) y al análisis de la pronunciación en contextos donde existe poca información lingüística disponible. Además, ofrece una base para crear aplicaciones que ayuden en el aprendizaje de idiomas mediante retroalimentación sobre la pronunciación.
La iniciativa también fortalece los esfuerzos de documentación y conservación de las lenguas originarias de México mediante el uso de inteligencia artificial y procesamiento del lenguaje natural.
En el proyecto participan además Eric Ramos-Aguilar, Ricardo Ramos-Aguilar y Daniel Sánchez-Ruiz, investigadores de la Unidad Profesional Interdisciplinaria de Ingeniería del Instituto Politécnico Nacional, campus Tlaxcala (UPIIT-IPN).
Arturo Olvera López destacó que el repositorio es de libre acceso y representa una herramienta valiosa para la comunidad científica dedicada al procesamiento del lenguaje natural, especialmente en investigaciones relacionadas con lenguas indígenas mexicanas que aún cuentan con escasa representación en recursos digitales.
El conjunto de datos puede consultarse en el repositorio ZETZOHO-YUHMU. Speech Dataset, disponible para investigadores y desarrolladores interesados en el estudio y preservación de las lenguas originarias.
