¿Qué es psicoacústica?

La psicoacústica es el estudio científico de cómo los humanos perciben el sonido. Se puentea la física, la fisiología y la psicología para explicar por qué dos personas pueden escuchar la misma onda de manera diferente, o por qué una frecuencia ligeramente alterada puede sentirse más agradable, intrusiva o natural. El campo examina cada atributo de la percepción auditiva: el campo, la ruido, la duración y la ubicación espacial.

Las raíces de la psicoacústica se remontan al siglo XIX, con el trabajo seminal de Hermann von Helmholtz Sobre las Sensaciones del Tono (1863). Helmholtz propuso que el oído interno analice sonidos complejos en sus frecuencias constitutivas, una teoría confirmada posteriormente por el Premio Nobel de Georg von Békésy sobre la membrana basilar. En los años 1930, Harvey Fletcher y Wilden Munson mapearon la sensibilidad de la oreja a diferentes frecuencias a diferentes niveles de ruido, produciendo la famosa Fletcher-Munson contornos de igual enojo. Estas curvas muestran que nuestros oídos son más sensibles entre 2-5 kHz (la gama de discursos humanos) y significativamente menos sensibles a frecuencias bajas y muy altas a volúmenes bajos. Este descubrimiento informa directamente cómo los ingenieros de audio aplican la igualación, compresión y normalización de la ruidosidad.

Una piedra angular de la psicoacústica es el concepto de enmascaramiento auditivo. Un sonido más fuerte puede hacer un sonido más silencioso y simultáneo inaudible si sus frecuencias están cerca. Enmascaramiento simultáneo ocurre cuando el ruido enmascara un tono casi al mismo tiempo. Enmascaramiento temporal, por otro lado, ocurre cuando un enmascarador afecta la percepción de una señal anterior o siguiente. Moderno códecs de audio perceptual (como MP3 o AAC) explota estos efectos de enmascaramiento para desar información drásticamente. mecanismos de enmascaramiento auditivo son también por qué los auriculares de aumento de ruido funcionan mejor en los sonidos continuos de baja frecuencia en lugar de sonidos repentinos de alta frecuencia.

Los psicoacústicos también abordan percepción de ruido, que no es una simple función lineal de presión de sonido. La escala de sone y la escala de phon describen cómo la intensidad percibida se duplica aproximadamente cada 10 dB. Esta no linealidad tiene enormes implicaciones para la compresión de rango dinámico en la radiodifusión y la música: un aumento de 6 dB en amplitud se percibe como sólo un modesto aumento en la ruidosidad, mientras que un salto de 20 dB se siente cuatro veces más alto.

Al abrazar psicoacústica, los ingenieros de audio se desplazan más allá del mero procesamiento de señales y el diseño para el cerebro del oyente, no sólo el micrófono. Este cambio es lo que eleva una grabación técnicamente adecuada en una experiencia emocionalmente atractiva.

Percepción y localización de sonido

La capacidad de localizar una fuente de sonido en el espacio — localización de sonido— es una de las hazañas más notables del sistema auditivo humano. La psicoacústica ha identificado dos cues principales: diferencias entre tiempo interaural (ITD) y diferencias entre niveles interaurales (ILD). Cuando un sonido se origina desde el lado izquierdo, alcanza la fracción de la onda izquierda con un milindo más rápido que el oído derecho.

Un tercer cue más complejo implica el función de transferencia de los jefes ejecutivos (recursos extrapresupuestarios). El oído externo (pinna), la cabeza y el torso filtro sonido en una dirección dependiente, agregando muslos espectral y picos que codifican la elevación y posición frontal. Cuando escuchas un sonido desde arriba, el pinna introduce un característico musgo alrededor de 6-8 kHz; un sonido desde atrás se percibe como ligeramente mudo porque carece de ese cue de alta frecuencia genérico que rodean el auricular es individual.

La psicoacústica también ha revelado el efecto anterior (también conocido como el efecto Haas). En una sala reverberante, el sonido directo llega a los oídos primero, seguido de reflexiones de paredes y suelos. El cerebro utiliza la primera llegada para determinar la ubicación de la fuente y suprime las reflexiones mientras llegan dentro de aproximadamente 1–40 milisegundos y no son mucho más ruido. Por eso podemos encontrar sonidos en una sala de reproducción de conciertos con fuerte simulación espacial – el efecto de la señal de audio

Estos principios de localización han impulsado grandes innovaciones en el audio de consumo. Stereo panning, grabación binaural, sonido envolvente (5.1, 7.1, Dolby Atmos), y audio basado en objetos dependen de cues psicoacústicas. Las aplicaciones de realidad virtual ahora utilizan la convolución HRTF para hacer audio 3D sobre los auriculares estándar, haciendo pasos detrás de usted o un susurro de la izquierda se sienten convincentemente presentes. Documentos técnicos de la AES sobre síntesis binaural detalle cómo estas cues son modeladas computacionalmente.

Técnicas de mejora de audio

Armados con conocimiento psicoacústico, los ingenieros implementan una caja de herramientas para hacer el audio más claro, más cómodo y más inmersivo. Cada método explota intencionadamente un quirk de la audición humana.

Compresión de rango dinámico

La compresión de rango dinámico reduce la brecha de volumen entre las partes más ruidosas y silenciosas de una señal de audio. En la escucha diaria — un coche, una calle concurrida, o una oficina abierta ruidosa— sonidos silenciosos como el diálogo susurrado pueden desaparecer en el ruido ambiente. Compresión eleva el nivel de los pasajes suaves mientras limita los picos, haciendo que cada elemento sea audible sin requerir que el oyente ajuste constantemente volumen.

Nivelación (PCE)

La ecuación ajusta el equilibrio de componentes de frecuencia. Un impulso simple en la región de 3-5 kHz puede aumentar la claridad del habla porque es donde vive la energía consonante (sibilants, fricatives). Un corte suave alrededor de 300 Hz reduce la “boxiness” y un impulso de frecuencia baja añade calor. Sin embargo, la misma curva EQ puede sonar diferente en diferentes volúmenes de reproducción debido al aumento de frecuencia

Procesamiento de audio espacial

El procesamiento de audio espacial crea un campo de sonido 3D percibido utilizando dos o más canales. Más allá de un simple recubrimiento estéreo, el audio espacial moderno utiliza la renderización binaural, los ambisónicos y la mezcla de objetos (por ejemplo, Dolby Atmos). Cada método se basa en la separación de imágenes de sonidos por vía intrauterina, ILD y HRTF para colocar sonidos en coordenadas específicas alrededor del oyente.

Reducción de ruido y cancelación de ruido activo

Los algoritmos de reducción de ruido (NR) analizan el perfil espectral del ruido de fondo y lo restan de la señal. La NR psicoacústica preserva el timbre del sonido de destino utilizando umbrales de enmascaramiento - sólo las frecuencias que son enmascaradas por el objetivo se suprimen, evitando los artefactos de onda de ruido de alta calidad para reducir el ruido de onda temprana. Investigación sobre enmascaramiento psicoacústico en ANC muestra que incluso la cancelación imperfecta puede mejorar la claridad percibida porque el ruido residual se desplaza a frecuencias donde causa menos molestia.

Loudness Normalization

La normalización de la loudness garantiza que el contenido diferente (comerciales, pistas de música, diálogo) se reproduce en una constante ruidosidad percibida. ITU‐R BS.1770 y el EBU R128 especificación define una medición de ruido cerrado que coincide con la percepción humana mejor que los niveles simples de pico o RMS. Los servicios de streaming (Spotify, YouTube, Apple Music) utilizan la normalización de la ruidosa para evitar saltos de volumen entre las canciones. Para el contenido de diálogo-peso, la normalización de la ruidosa combinada con compresión dinámica asegura que las líneas tranquilas todavía son inteligibles en los altavoces de dispositivos móviles sin hacer explosión el oyente durante secuencias de acción.

Aplicaciones en Ayudas de Audición y Tecnología Asistida

La psicoacústica es la columna vertebral del diseño moderno de la ayuda auditiva. La pérdida auditiva a menudo afecta a frecuencias altas más que frecuencias bajas, pero la amplificación simple puede hacer sonidos dolorosos. En lugar de ello, ayudas a utilizar compresión de banda múltiple para aplicar diferentes ganancias a diferentes regiones de frecuencia, que coinciden con el audiograma del paciente.

Los sistemas de micrófonos direccionales en los audífonos imitan los cues de localización del cerebro mediante la grabación de sonidos de múltiples micrófonos y la aplicación de rayos de tiempo. El cerebro del usuario utiliza el efecto de precedencia para priorizar la fuente de sonido orientada hacia el futuro. Para los pacientes de tinnitus, la neuromodulación acústica utiliza tonos o patrones musicales que interrumpen la sincronización neuronural causando el sonido fantasma hace décadas.

Futuros Direcciones en la Percepción de Audio

La próxima frontera del realce psicoacústico radica en sistemas personalizados y adaptables. Se están capacitando modelos de aprendizaje automático en grandes conjuntos de datos de preferencias de oyentes para crear curvas de igualación y conjuntos de filtros espaciales que coincidan con el perfil auditivo único de un individuo. Estos algoritmos “perceptualmente optimizados” pueden compensar la pérdida auditiva relacionada con la edad sin requerir audífonos tradicionales, convirtiendo los auriculares comunes en dispositivos de escucha.

Las interfaces de ordenador cerebral (BCIs) para el audio siguen siendo experimentales pero prometen cambios radicales. Los investigadores han demostrado que los usuarios pueden enfocarse en un hablador específico en una sala ruidosa simplemente pensando en esa voz: el BCI extrae la señal de atención selectiva del cerebro y amplifica la entrada correspondiente. Esto es un bucle neuropsicoacoustic directo. codificación de audio neural: en lugar de transmitir audio analógico o digital, los sistemas futuros pueden enviar un conjunto comprimido de parámetros de estimulación neuronal directamente al nervio auditivo o corteza, pasando por el oído por completo. Los implantes cocleares ya implementan formas rudimentarias de esto estimulando electrodos discretos según bandas de frecuencia. El reto es entregar la riqueza total de cues timbre y espaciales a través de impulsos eléctricos.

La realidad virtual y aumentada seguirá impulsando la innovación en la renderización psicoacústica. Con el aumento del audio espacial para la metaversa, los investigadores están perfeccionando la “simpresión de la acústica de la sala” que utiliza respuestas de impulso en tiempo real para modelar cómo un entorno virtual refleja el sonido. presencia efecto tan convincente que los oyentes se sienten físicamente ubicados en el espacio virtual. Normas de la UIT para sistemas de audio de próxima generación incorporan estos modelos psicoacústicos.

Finalmente, la convergencia de psicoacústica y la sensibilidad biométrica podría llevar a audio que se adapta a su estado emocional. Un rastreador de fitness que detecta una frecuencia cardíaca elevada puede ajustar el igualador para enfatizar el ritmo y reducir el trazo duro, o cambiar la imagen espacial de ancho a íntimo. El objetivo final es el audio que se siente tan natural y sensible como la verdadera audición, un real real real real que funciona con el cerebro, no contra él.

Al comprender la ciencia detrás de cómo percibimos el sonido, cada innovación en el realce de audio se convierte en más que un ejercicio de ingeniería; se convierte en un acto de empatía con el mundo interior del oyente. El futuro del sonido no es sólo una resolución más alta o más alta — es más humano.