La inversión articulatoria ofrece nuevas perspectivas y aplicaciones interesantes en el campo de la voz; sin embargo, es aún un problema por resolver. El presente trabajo ofrece un método para la estimación de la distribución de la información articulatoria contenida en la acústica de consonantes explosivas, cuya parametrización se realiza mediante la transformada wavelet packet. El trabajo se centra principalmente en estimar la información acústica relevante, en términos de asociación estadística, para la inferencia de la posición de los órganos articuladores críticos involucrados en la producción de consonantes explosivas. Se usa el coeficiente de Kendall a modo de medida de relevancia. Los mapas de relevancia de tiempo-frecuencia se calculan para la base de datos MOCHA–TIMIT; de la cual, las zonas correspondientes a las consonantes explosivas son analizados. El método propuesto entrega un conjunto de componentes de tiempo-frecuencia intimamente relacionados al fenómeno articulatorio, lo cual ofrece un entendimiento más profundo de la relación existente entre los fenómenos articulatorio y acústico. Los mapas de relevancia se prueban en un sistema de inversión articulatoria basado en modelos de mezclas gausianas, donde se muestra que mejoran el desempeño de los mencionados sistemas aplicados sobre consonantes explosivas. El método se puede extender a otras categorías articulatorias, p.e. fricativas, con el fin de adaptar el presente método a sistemas de inversión articulatoria sobre voz continua.
1 INTRODUCCIÓN
La inferencia de la posición de los articuladores, a partir de la información acústica contenida en la señal del habla, ofrece nuevas perspectivas e interesantes aplicaciones en el campo del procesamiento del habla. Un sistema adecuado para recuperar las configuraciones articulatorias, a partir de la señal acústica del habla, podría utilizarse en varias aplicaciones: ayudas visuales en tareas de entrenamiento articulatorio para personas con problemas de audición o de habla; programas de aprendizaje de segundas lenguas guiados por ordenador para mostrar la pronunciación correcta e incorrecta [1]; codificación de baja tasa de bits, ya que los articuladores se mueven de forma relativamente lenta [2]; y representación complementaria en los sistemas de reconocimiento del habla para mejorar su rendimiento, ya que los parámetros articulatorios representan mejor los fenómenos relacionados con la coarticulación [3].
Los gestos del habla son movimientos planificados en una secuencia coordinada, cuyas acciones son relativamente lentas y se solapan.
Esta es una versión de prueba de citación de documentos de la Biblioteca Virtual Pro. Puede contener errores. Lo invitamos a consultar los manuales de citación de las respectivas fuentes.
Artículo:
Diseño de una superficie selectiva de frecuencia activa con estructuras compuestas curvadas y respuesta de frecuencia sintonizable
Artículo:
Antena de guía de ondas reconfigurable con patrón de radiación utilizando cristal líquido
Artículo:
Un Sistema de Guía para Ciegos Basado en un Microcontrolador Infrarrojo Inteligente
Artículo:
Búsqueda personalizada en repositorios de objetos de aprendizaje a partir del perfil del estudiante
Artículo:
Características de propagación del láser pulsado en la lluvia
Informe, reporte:
Diagnóstico sobre la logística del comercio internacional y su incidencia en la competitividad de las exportaciones de los países miembros
Artículo:
Nuevas necesidades cosméticas : tendencias y productos específicos
Manual:
Química de los taninos
Artículo:
Influencia del COVID-19 en las dinámicas de exportación, producción y consumo de carne vacuna en Colombia y el mundo: Una revisión monográfica.