El Imperativo para los Protocolos Estandarizados en Medición y Validación de los FNUOS
Este protocolo de transferencia relatado (HRTF) forma la columna vertebral de la reproducción de audio espacial moderna, impulsando todo desde entornos de realidad virtual inmersiva y sonido envolvente cinematográfico hasta algoritmos avanzados de audición. Sin embargo, durante décadas, la falta de protocolos de medición y validación universalmente aceptados ha introducido una variabilidad significativa en los conjuntos de datos de HRTF, dificultando la reproducibilidad en los laboratorios y limitando la interoperabilidad de los sistemas de audio espaciales.
Comprender las funciones de transferencia relacionadas con el jefe
En su más simple, un HRTF describe cómo las ondas sonoras desde un punto específico en el espacio se difraccionan y filtran por la cabeza del oyente, pinnae (ojos externos), y torso antes de llegar al tímpano. Este filtro codifica las claves espaciales críticas: diferencias de tiempo interaural (ITD), diferencias de nivel interaural (ILD), y sonidos espectrales generados por el pinna—que permiten que el sistema auditivo local tres dimensiones.
La anatomía de cada individuo es única, lo que significa que los HRTFs son inherentemente dependientes de la persona. Un HRTF genérico o “dummy‐head” proporciona sólo una aproximación áspera; para el audio espacial realmente convincente, los HRTFs individualizados son deseables. La medición precisa de los HRTFs es, por lo tanto, esencial no sólo para la investigación en psicoacústica, sino también para aplicaciones comerciales en realidad aumentada, juegos, teleconferencia, escucha y dispositivos y asistencia.
Cómo los equipos de recursos humanos están tradicionalmente medidos
El método clásico implica colocar un sujeto en una cámara anecólica con un altavoz montado en un arco robótico que puede girar alrededor de la cabeza. Se insertan micrófonos de sonda pequeña en los canales del oído para registrar la respuesta a impulsos acústicos desde cada ángulo. Este proceso se repite para cientos o miles de direcciones espaciales, dando lugar a un conjunto denso de funciones de transferencia direccional.
Aunque conceptualmente sencillo, los detalles de la implementación varían enormemente: la distancia del altavoz, el tipo de micrófono, la presencia o ausencia de un láser subjetivo, las propiedades de la cámara anecópica, y el método utilizado para compensar la respuesta del altavoz todos introducen diferencias. Sin un protocolo común, los datos de un laboratorio pueden ser difíciles —si no imposibles— para comparar con los datos de otro.
Evolución histórica y el empuje para la reproducción
Las primeras mediciones sistemáticas de HRTF datan de los años 70, con estudios de referencia de Shaw y colegas usando arrays de altavoces estáticos. A lo largo de los años 90, el aumento del procesamiento digital de señales permitió una adquisición de datos más eficiente utilizando swept-sine y máximo-length secuencia (MLS) estímulos evidentes.
En 2015, el AES formó el grupo de trabajo SC-02-03‐L específicamente encargado de elaborar normas de medición de HRTF. Simultáneamente, la Unión Internacional de Telecomunicaciones (UIT) comenzó a incorporar la renderización binaural basada en HRTF en sus recomendaciones para la próxima generación de radiodifusión. Estos esfuerzos marcaron el comienzo de un impulso coordinado hacia datos de audio espacial reproducibles y de alta calidad.
El caso de la normalización
La variabilidad de los datos de HRTF representa un grave obstáculo para el progreso en el audio espacial. Cuando los conjuntos de datos no pueden ser validados cruzadamente, los investigadores no pueden construir con confianza en el trabajo anterior, y los fabricantes de dispositivos no pueden garantizar que una fuente de sonido virtual sea percibida consistentemente por diferentes usuarios.
- Reproducibilidad: Permitir a otros laboratorios replicar mediciones con confianza que las diferencias se deben a fenómenos reales en lugar de artefactos de procedimiento.
- Pautas de referencia: Proporcionar conjuntos de datos de referencia contra los cuales se pueden evaluar nuevos sistemas de medición o algoritmos de individualización.
- Interoperabilidad: Permitiendo que los datos de HRTF se recojan en un contexto (por ejemplo, un laboratorio de investigación) se utilicen en otro (por ejemplo, un auricular VR de consumo) sin degradación de la precisión espacial.
- Aceptación regulatoria y clínica: En la adaptación de audiología y audífonos, los datos normalizados de la HRTF podrían formar parte de bases de datos normativas utilizadas para la evaluación de diagnóstico.
Fuentes de variabilidad que la estandarización debe abordar
La vacunación surge de cuatro categorías amplias: anatomía de sujeto, hardware de medición, procedimiento de medición y procesamiento post. La anatomía de asunto es la más fundamental, pero las opciones de hardware, como el tipo de micrófono (omnidirectional vs. tipo de presión), la directividad de altavoz y la precisión de posicionamiento de arco, pueden introducir sesgos sistemáticos.
Un protocolo estandarizado no pretende eliminar la variación de la anatomía de sujeto, es decir, parte de la señal, sino minimizar todas las demás fuentes para que la HRTF medida refleje sólo la acústica del sujeto.
Componentes clave de un protocolo de medición de la HRTF estandarizado
Partiendo de la labor de los comités de normas de la AES, la UIT y diversos consorcios académicos, un protocolo general abarca normalmente los siguientes elementos.
Medición del medio ambiente
El espacio acústico debe ser anecoico o al menos tener un tiempo de reverberación muy bajo, con una respuesta de campo libre a la frecuencia más baja de interés (comúnmente 100 Hz). Los niveles de ruido de fondo deben estar por debajo de 20 dBA. Las superficies reflectantes, incluyendo la estructura de arco, deben ser tratadas para prevenir reflexiones secundarias que corrompan la respuesta del impulso. ISO 3745 especifique los límites aceptables para las cámaras anecóticas y a menudo se hacen referencia en los protocolos de HRTF.
Preparación y Posicionamiento del Asunto
Los sujetos se asientan normalmente en una taburete o silla no reflectante. La cabeza está alineada con los ojos cruzados láser que se intersectan en el centro del eje interaural de la cabeza. El eje interaural debe estar alineado con el centro de rotación del arco de altavoz. La manta de la cabeza (por ejemplo, un descanso de la barrita de mordedura) minimiza el movimiento durante la medición real
Los micrófonos en el exterior se colocan con la entrada de la oreja, o ligeramente receso, y deben ser calibrados para cada sujeto. El punto de referencia estándar es la entrada bloqueada del oreja, como recomendó el grupo de trabajo AES‐X188. Algunos protocolos también requieren el uso de un tapón de silicona para bloquear el canal del oído más allá del micrófono, asegurando una terminación acústica repetible.
Calibración del equipo
Tanto el altavoz como los micrófonos deben ser calibrados usando una referencia trazable (por ejemplo, un pistón calibrado para micrófonos y un micrófono de referencia calibrado para el altavoz). La magnitud y respuesta de la fase del altavoz deben medirse en la posición de escucha y desconvolverse de los datos registrados, esto se conoce como el paso de la “ecalización”.
Parámetros de adquisición de datos
El protocolo debe especificar:
- Resolución anglosa: Los valores típicos oscilan entre 5° y 10° en azimut y elevación, pero las resoluciones superiores (1°–2°) pueden ser necesarias para las frecuencias superiores a 8 kHz para capturar pinnas finas.
- Distancia a la fuente: Los HRTFs de campo lejano se miden a 1–2 metros; los efectos de campo cercano se vuelven significativos más cerca de 0,5 m y requieren un manejo separado.
- Tipo de estímulo: Secuencias máximas de longitud (MLS), se succionan los pecados (chirps), o los códigos Golay se utilizan para obtener una alta relación de señal a ruido. La longitud y el número de promedios deben definirse.
- Tasa de muestreo y profundidad de bits: Típicamente 48 kHz o 96 kHz a 24 bits, aunque se pueden necesitar tasas de muestra más altas para analizar las características de pinna por encima de 20 kHz.
- Número de promedios: Típicamente 3-10 promedios por dirección para mejorar SNR sin tiempo de medición excesivo.
Procesamiento de datos y Windowing
Después de la captura, la respuesta del impulso crudo debe ser ventanada para eliminar las reflexiones residuales. La puesta en marcha y la longitud de la ventana deben ser estandarizadas, comúnmente se aplica una ventana de Hanning de 256 muestras, con el punto de inicio fijado exactamente a la llegada directa del sonido. Los umbrales de relevado espectral (por ejemplo, 1/12 octaff) también pueden ser especificados para reducir el ruido de medición preservando cues espectrales relevantes para la curvatura.
Métodos de validación para los datos de la HRTF
Incluso con un protocolo de medición cuidadoso, el HRTF resultante debe ser validado para confirmar que representa con precisión la acústica del sujeto y produce una espacialización creíble. La validación suele tomar dos formas: objetivas y perceptivas.
Validación objetiva
Los controles objetivos incluyen comparar la HRTF medida con un estándar conocido (por ejemplo, un maniquí o una base de datos de HRTFs validados previamente del mismo tema).Métricas como la distorsión espectral (SD) entre mediciones repetidas, la suavidad de la respuesta de magnitud, y la congruencia de las diferencias de nivel interaural con predicciones teóricas para una cabeza esférica se utilizan.
Validación perceptiva
La validación perceptual implica pruebas de escucha donde los sujetos localizan fuentes de sonido virtuales emitidas utilizando la HRTF medida. La prueba más común es la prueba de precisión de localización, midiendo el error angular entre la dirección percibida y la dirección prevista. Además, las pruebas de “externalización” evalúan si la fuente virtual aparece dentro o fuera de la cabeza. Para que un HRTF sea considerado válido, debe producir un error de localización mediana debajo de 5°-10° y una baja incidencia de la confusión frontal. ITU‐R BS.1727 La recomendación de evaluación subjetiva del audio espacial proporciona un marco para tales pruebas.
Algunos protocolos también incorporan un criterio de fiabilidad de “remedición”: un subconjunto de direcciones de medición se repite al final de la sesión, y la desviación media debe caer dentro de la tolerancia predefinida. Esto ayuda a detectar movimiento de sujeto o deriva de equipo.
Actividades de normalización actuales y su progreso
Varias organizaciones están trabajando activamente en la medición de HRTF. Los más destacados son la Audio Engineering Society (AES), la Unión Internacional de Telecomunicaciones (UIT) y el IEEE. AES Standards Committee formó el grupo de trabajo SC‐02‐03‐L sobre medición de HRTF, que ha propuesto un protocolo detallado para la adquisición de HRTF de campo lejano en condiciones anecóticas, incluyendo especificaciones para las mediciones de cabezas dummy y sujetos en vivo. AES Technical Document TD-1002 ofrece directrices para la medición y presentación de datos sobre la Fuerza de Policía de Kosovo, con el objetivo de establecer un consenso sobre las mejores prácticas.
Mientras tanto, el Grupo de Trabajo de la UIT-R 6C En el ámbito académico, la Iniciativa de Normalización de la HRTF en la reunión de la Sociedad Acústica de América 2021 reunió a investigadores para proponer un conjunto mínimo de normas de reporte que todas las publicaciones deben incluir. El IEEE también ha iniciado un proyecto de estándares (IEEE P3701) específicamente para la caracterización de sistemas de audio espacial, que incluye protocolos de medición de HRTF.
Función de los datos abiertos y el formato SOFA
Todos los esfuerzos arriba serán ineficaces sin un formato de datos común. SOFA (Formato espacialmente orientado para la acústica) convención ha surgido como un estándar para almacenar HRTF y mediciones acústicas conexas. Los archivos SOFA contienen no sólo la magnitud y los datos de fase, sino también metadatos sobre la configuración de medición, geometría y calibración. Los protocolos futuros deben ordenar el uso de SOFA (o sucesor) para asegurar la portabilidad y transparencia de los datos. Varias bases de datos de código abierto HRTF, como las bases de datos CIPIC y SADIE II, han adoptado datos de referencia valiosos.
Retos pendientes
A pesar de estos esfuerzos, persisten varios obstáculos:
- Variabilidad del sujeto: Un protocolo único no puede captar completamente la diversidad de formas de cabeza, morfologías del oído y tamaños del cuerpo en poblaciones humanas. Un cierto grado de individualización es necesario, pero estandarizar cómo dar cuenta de esto sigue siendo difícil.
- Costo y disponibilidad del equipo: Las mediciones esféricas completas requieren cámaras anecóticas costosas y sistemas de mesa de cambios robótica. Los protocolos simplificados que trabajan con hardware de menor costo (por ejemplo, arrays de plano o plataformas de medición portátiles) pueden cambiar la precisión.
- Libertad de procesamiento posterior: Incluso con datos brutos idénticos, diferentes investigadores aplican diferentes algoritmos de suavidad, extrapolación o interpolación. La norma debe definir un oleoducto de procesamiento de referencia, o al menos requerir la presentación completa de todos los pasos de procesamiento.
- Near‐field vs. far‐field: Muchas aplicaciones, como audífonos y teléfonos móviles, implican fuentes de sonido muy cercanas al oído. La estandarización debe abordar protocolos distintos para mediciones de campo cercano y campo lejano.
- Dinámica de los equipos de recursos humanos: El movimiento de cabeza altera los HRTFs en tiempo real. La medición de cues dinámicas (por ejemplo, cambios con la rotación de cabeza) es un reto abierto.
Tecnologías emergentes y futuras direcciones
La próxima generación de estandarización de HRTF es probable que sea de datos y adaptables, aprovechando el aprendizaje de máquinas y los arrays de sensores de bajo costo.
Aprendizaje de máquina para la individualización de la HRTF
En lugar de medir cada sujeto en una cámara anecónica, los investigadores están desarrollando modelos que predicen la HRTF de un individuo de mediciones anatómicas, como escaneos 3D del oído y la cabeza. Las redes neuronales entrenadas en grandes bases de datos de HRTFs medidos pueden generar un HRTF personalizado en segundos. La estandarización tendrá que extenderse a estos modelos de predicción, definiendo cómo se deben recopilar datos de entrenamiento y cómo se debe validar la exactitud predictiva. opensource HRTF database community ya está trabajando en formatos comunes para almacenar y compartir esos datos.
Sistemas de medición portátiles e in situ
Los sistemas de medición nuevos y portátiles utilizan una serie de micrófonos (por ejemplo, 32 arrays esféricos) para capturar el campo de sonido alrededor de la cabeza en una sola grabación, reduciendo drásticamente el tiempo de medición. Estos sistemas funcionan en habitaciones ordinarias con cierta reverberación, utilizando la síntesis de desconvolución o de campo de onda para recuperar HRTFs anecoicos.
Validación adaptativa y en tiempo real
Los protocolos futuros pueden incorporar retroalimentación perceptual en tiempo real: mientras un oyente está utilizando un sistema de audio espacial, el sistema puede ajustar el HRTF basado en errores de localización medidos durante una prueba rápida de juego. Esta validación de apertura cerrada podría llevar a la individualización que se adapta a cambios en la anatomía del oyente (por ejemplo, el crecimiento del oído en niños, o cambios después de la fijación de la ayuda auditiva).
Formatos y metadatos de datos estandarizados
Todos los esfuerzos arriba serán ineficaces sin un formato de datos común. La convención SOFA ha surgido como un estándar para almacenar HRTF y mediciones acústicas conexas. Los protocolos futuros deben ordenar el uso de SOFA (o un sucesor) para garantizar la portabilidad y transparencia de los datos. Además, se están elaborando normas de metadatos como el lenguaje de marcado “HRTF‐ML” para capturar información detallada de procedencia.
Conclusión
Los protocolos estandarizados para la medición y validación de HRTF ya no son una preocupación mínima: son un habilitador crítico para el futuro del audio espacial en el entretenimiento, la comunicación y la tecnología de asistencia. Al abordar sistemáticamente el entorno de medición, preparación de temas, calibración de equipos, adquisición de datos y validación, la comunidad de ingeniería de audio puede crear una base sobre la cual se pueden construir datos de HRTF reproducibles y confiables.