¿Qué son los modelos psicoacústicos?

Los modelos psicoacústicos son marcos científicos que describen cómo el sistema auditivo humano percibe el sonido. Se construyen desde décadas de investigación hasta la audiencia, incluyendo la sensibilidad del oído a diferentes frecuencias, su rango dinámico, y su capacidad para detectar cambios en el campo y la ruido. Estos modelos van más allá de curvas de respuesta de frecuencia simples; incorporan comportamientos complejos como enmascaramiento, integración temporal y audiencia de código binaural.

La base del modelado psicoacústico radica en el concepto del “filtro auditivo”, que representa la selectividad de frecuencia de la cocha. El oído humano se comporta como un banco de filtros de bandpass superpuestos, y estos filtros tienen diferentes anchos de banda dependiendo de la frecuencia. A menor frecuencia, los filtros son estrechos; a frecuencias más altas, se ensancha.

La Mecánica de la Audiencia Humana

Para apreciar los modelos psicoacústicos, primero debes entender el hardware biológico que simulan. Las ondas sonoras entran en el oído externo y viajan por el canal auditivo al tímpano, que vibra. Estas vibraciones se transfieren a través de los huesos del oído medio (oxilas) a la coclea en el oído interno. La coclea es un órgano lleno de líquidos, en forma de espiral, alineado con células del cabello que convierten vibraciones mecánicas de la frecuencia auditiva a lo largo de las señales neumáticas.

Las células del pelo no son igualmente sensibles en todas las frecuencias. La sensibilidad del oído se eleva entre 1 kHz y 4 kHz, un rango crítico para la comprensión del habla. Debajo de 500 Hz y más de 8 kHz, la sensibilidad se desploma significativamente. Los modelos psicoacústicos capturan esto usando contornos de igual audencia, como las curvas Fletcher-Munson o el modelo más reciente de la curva 50 que se percibenz.

Bandas críticas y la Escala de Barcos

El concepto de bandas críticas es central a la modelación psicoacústica. Una banda crítica es la gama de frecuencias que el oído procesa como una unidad única. Dentro de una banda crítica, dos tonos no se pueden resolver por separado; se perciben como una sola sensación. El ancho de banda de estas bandas críticas aumenta con frecuencia: a 200 Hz, una banda crítica es de aproximadamente 100 Hz de ancho; a 5 kHz, se divide

Los codecs prácticos utilizan bancos de filtros que son espaciamiento de bandas críticas aproximados. Por ejemplo, el encoder MP3 utiliza un banco de filtros de polifase con 32 subbandes que combinan a anchos de banda críticos con frecuencias bajas pero son demasiado anchos en frecuencias altas. Los codecs modernos como AAC utilizan un grupo de cambios discretos cosine (MDCT) con una mayor resolución (1024 o 2048 líneas) y luego un grupo de frecuencias

El papel de los modelos psicoacústicos en la compresión de audio

Los algoritmos de compresión de audio tienen como objetivo reducir la velocidad de datos de una señal de audio digital, preservando la calidad más perceptual posible. Sin modelos psicoacústicos, la compresión perdida dependería de técnicas genéricas de procesamiento de señales que podrían desechar contenido audible o bits de desperdicio en ruido inaudible.Integrándose modelos psicoacústicos, codecs pueden alcanzar ratios de compresión de 10:1 o más mientras que son casi indistinguibles.

El elemento clave es que la audición humana es imperfecta. No podemos escuchar todas las frecuencias igualmente bien; nuestra sensibilidad se eleva alrededor de 1-4 kHz y se baja en los extremos. Más importante aún, no podemos escuchar sonidos silenciosos que ocurren inmediatamente después o en frecuencias similares a sonidos ruidosos. Modelos psicoacústicos cuantifican estas limitaciones, proporcionando un marco para la “codificación perceptual”.

Efectos de Masking y su medición

El ruido es un fenómeno en el que un sonido hace que otro sea inaudible. Hay dos tipos principales: el enmascaramiento de frecuencia (enmascaramiento simultáneo) y el enmascaramiento temporal. El enmascaramiento de frecuencias ocurre cuando un sonido alto en una determinada banda de frecuencia eleva el umbral de audición para frecuencias vecinas. Por ejemplo, un tono de 1 kHz a 80 dB puede enmascarar un tono de sensibilidad de 40 dB.

Los modelos avanzados también consideran el “spread of masking” a través de la frecuencia y el tiempo. Esta difusión no es lineal y depende del nivel de señal y el contenido espectral. Para una señal musical compleja, el umbral de enmascaramiento se calcula resumiendo las contribuciones de todos los componentes de frecuencia, utilizando funciones de difusión. El resultado es un nivel de “justo de distorsión” que el encoder puede seguir.

Measuring Masking in Practice

El estándar ITU-R BS.1387, conocido como PEAQ (Evaluación Perceptual de la Calidad de Audio), proporciona un método objetivo para medir la calidad de audio percibida utilizando un modelo psicoacústico. PEAQ compara las señales originales y comprimidas computando un “punto de máscara” para cada ficha de frecuencia y luego calcula el “disturbance” donde la señal comprimida supera este umbral. ITU‐R BS.1387‐1 (PEAQ) estándar.

Aplicación en los principales códigos de audio

Los modelos psicoacústicos no son abstracciones teóricas; están incrustados en cada importante codec de audio perdedor. La forma en que cada codec traduce principios psicoacústicos en asignación práctica de bits define su rendimiento y carácter.

MP3 El Pioneer

La aplicación más famosa de los modelos psicoacústicos es en el estándar MP3 (MPEG-1 Audio Layer III) desarrollado a principios de los años 90. MP3 utiliza un banco de filtros de polifase y un cambio de bits discretos cosine (MDCT) combinado con un modelo psicoacústico (espejado en el estándar ISO/IEC 11172-3).

AAC: Refined and Flexible

AAC (Avanzado Audio Coding), parte de la norma MPEG-4, incorpora un modelo psicoacústico más sofisticado. Utiliza un banco de filtros de alta resolución (1024 puntos MDCT) y una mejor función de difusión. AAC también admite herramientas adicionales como substitución de ruido perceptual (PNS) y la formación de ruido temporal (TNS).

Opus: Adaptive and Modern

El sonido de retroalimentación de radio es un modelo de retroalimentación de radio de alta calidad que se utiliza en el sistema de sonido de alta calidad (CTR) y de alta calidad (CTR) con un modelo de retroalimentación de radio de alta calidad.

Avances en la modelación psicoacústica

La investigación continua tiene como objetivo mejorar los modelos psicoacústicos más allá de los enfoques clásicos. Los modelos clásicos, aunque efectivos, tienen limitaciones. Se basan en la audiencia media y no representan diferencias individuales. También utilizan funciones de difusión simplificadas que pueden no captar todas las interacciones complejas en las señales del mundo real.

Integración de aprendizaje automático

Una dirección prometedora es el uso de redes neuronales para aprender funciones de enmascaramiento perceptual directamente desde pruebas de escucha. Los modelos de aprendizaje profundo pueden aproximar las relaciones complejas y no lineales en la audición humana sin depender de funciones de difusión artesanales. Dolby Laboratories son la investigación de los modelos perceptuales de datos para los codecs de próxima generación. Los codecs de audio neuronales de fin a fin, como EnCodec by Meta, no utilizan explícitamente un modelo psicoacústico sino que aprenden una función perceptual de pérdida de los juicios humanos. Esta función de pérdida es esencialmente un modelo psicoacústico aprendido que captura lo que los humanos encuentran perceptualmente importante.

Modelos personalizados y adaptables

Otro área es el procesamiento de audio personalizado. No hay dos pares de oídos idénticos. Edad, pérdida auditiva, e incluso la forma del canal auditivo afectan la percepción. Un oyente de 60 años con pérdida auditiva típica de alta frecuencia tiene un umbral de enmascaramiento muy diferente que un niño de 20 años con audición normal. Los futuros codecs pueden adaptar parámetros de compresión basados en perfiles auditivos individuales, obtenidos mediante una prueba rápida almacenada en el dispositivo del usuario. Sonos tiene programas de investigación en sonido personalizado, incluyendo corrección de habitaciones y compensación auditiva.

El contexto ambiental también importa. Un modelo psicoacústico que funciona bien en un estudio tranquilo puede ser demasiado conservador en un coche ruidoso o en una calle concurrida. Los modelos adaptables podrían tener en cuenta el ruido ambiente, permitiendo una compresión más agresiva cuando el ambiente de escucha enmascara ciertas frecuencias. El desarrollo de estos modelos requiere pruebas subjetivas de gran escala y algoritmos de estimación de ruido robustos.

Consideraciones espaciales de audio y de tipo biológico

Otro canal de frontera es el audio binaural y espacial. Como la realidad virtual y aumentada crece, los codecs deben preservar las cues espaciales (diferencias interaurales y de nivel) mientras siguen aplicando la codificación perceptual. Los modelos psicoacústicos para la audición espacial son más complejos, que implican funciones de transferencia relacionadas con la cabeza (HRTF) y efectos de precedencia.

El futuro de la codificación de audio perceptual

Un resultado práctico de estos esfuerzos es la mejora de la codificación de bajo contenido para el lenguaje y la música. Los estándares como EVS (Mejores Servicios de Voz) y LC3 (Código de Comunicación de Complejidad Low) incorporan modelos psicoacústicos avanzados optimizados para el audio conversacional. EVS, por ejemplo, utiliza un modelo psicoacústico para mezclar el lenguaje y la codificación de música sin problemas.

  • algoritmos de enmascaramiento mejorados: Las funciones de difusión modernas y la codificación de estéreo mixto (mid/side e intensidad) son ahora estándar, junto con el enmascaramiento temporal complejo que considera efectos tanto hacia adelante como hacia atrás. Esto permite mayores ratios de compresión sin artefactos audibles.
  • Tratamiento de audio personalizado: Los dispositivos futuros pueden realizar una prueba de audición rápida (similar a los que se utilizan en audífonos) y ajustar la compresión en consecuencia. Esto podría reducir el bitrate en un 20–30% para los usuarios con una disminución auditiva típica relacionada con la edad.
  • Calidad de sonido mejorada en los bitrates más bajos: Los codecs como Opus y xHE‐AAC ya coinciden con la calidad de los estándares anteriores a la mitad del bitrate. Los refinamientos continuos en modelos psicoacústicos prometen mayores ganancias, especialmente para el contenido desafiante como aplausos o gachas.
  • Integración con aprendizaje automático: Los codecs de audio neuronales de extremo a extremo no utilizan explícitamente un modelo psicoacústico sino que aprenden una función de pérdida perceptiva de los juicios humanos. Este enfoque basado en datos puede eventualmente superar modelos hechos a mano para casos de uso específicos.
  • Compresión adaptativa de conocimiento de red: Los futuros codecs pueden ajustar su modelo psicoacústico basado en condiciones de red en tiempo real, pérdida de paquetes y ruido ambiente, proporcionando la mejor calidad posible en circunstancias cambiantes.

Comprender y aprovechar los modelos psicoacústicos sigue siendo una piedra angular de desarrollar mejores tecnologías de compresión de audio. A medida que los investigadores se sumergen más profundamente en las sutilezas de la audiencia humana, podemos esperar aumentos continuos en eficiencia, robustez y personalización. el artículo de Wikipedia sobre psicoacústica o la biblioteca AES de papeles psicoacústicos. Estos recursos proporcionan una base sólida para cualquiera que busque entender la ciencia detrás de los sonidos que escuchamos y el audio comprimido que llena nuestras vidas digitales.