Desarrollo y significación de audio basado en objetos en plataformas de transmisión
La forma en que experimentamos el sonido en los medios digitales ha sufrido una transformación radical. Durante décadas, el audio fue entregado a través de formatos fijos basados en canales como el estéreo y el sonido envolvente 5.1, que pintó una imagen sónica estática. Hoy, un nuevo paradigma — basado en objetos- permite a los diseñadores de sonido para tratar sonidos individuales como elementos separados que se pueden colocar, mover y escalar dentro de un espacio tridimensional.
Las plataformas de streaming son la incubadora perfecta para esta tecnología. Ofrecen un gasoducto directo a los consumidores, superando las limitaciones de medios físicos y infraestructura de transmisión. Servicios como Netflix, Apple TV+, Disney+ y Amazon Prime Video ahora ofrecen rutinariamente pistas de audio inmersivas, mientras que los servicios de streaming de música como Apple Music, Tidal y Amazon Music han aceptado el audio basado en objetos poéticos para una nueva era de la música espacial.
La evolución de las tecnologías de audio
De Mono a Surround Sound
La historia de la reproducción de audio es una historia de creciente dimensionalidad. mono (canal de sonido) que podría venir de una sola dirección. estéreo en los años 50 dio a los oyentes dos canales y un sentido rudimentario de posicionamiento de izquierda derecha, pero la profundidad y la altura estaban ausentes. sonido envolvente formatos como Dolby Pro Logic (matrixed 4.0) y formatos discretos posteriores como Dolby Digital (5.1) y DTS proporcionaron un plano horizontal de 360 grados, con un canal de subwoofer dedicado para efectos de baja frecuencia. Estos sistemas basados en canales tratan al oyente como un punto fijo; el campo de sonido se mezcla a un número predeterminado de oradores dispuestos en un diseño específico (por ejemplo, 7.1, 5
Mientras el sonido envolvente era un avance importante, tenía limitaciones fundamentales. La mezcla se crea para un “punto de remojo” en una configuración de altavoces específica. Si un oyente no tiene esa disposición exacta, por ejemplo, una barra de sonido en lugar de altavoces separados, la experiencia espacial está comprometida. Además, los sistemas basados en canales no pueden controlar individualmente la posición o el movimiento de cada fuente de sonido.
Empujando más allá de la cama de Canal
A principios de los años 2000, los ingenieros de cine y teatros de casa reconocieron que la próxima frontera era la altura, el eje z. Dolby Atmos en teatros, que añadieron altavoces generales e introdujo el concepto de objetos de audio en lugar de canales solos. Esto rompió el molde de mezcla estática basada en altavoces. Poco después, otros formatos como DTS:X y la norma de transmisión MPEG‐H Audio emergido, cada uno ofrece su propia implementación de audio basado en objetos. El principio subyacente es el mismo: el sonido ya no está ligado a un soporte de altavoz; es un elemento independiente que lleva metadatos describiendo su posición tridimensional, tamaño, velocidad y otros parámetros.
El desarrollo de audio basado en objetos representa una convergencia de procesamiento digital de señales, avances en los estándares de metadatos y la disponibilidad de chips de renderización más potentes en los dispositivos de consumo. Es la culminación de décadas de investigación en la audición espacial, psicoacústica y tecnología de compresión. Hoy, el audio basado en objetos no es sólo para los cines insignia, es una característica fundamental del ecosistema de streaming.
Comprender el audio basado en objetos: principios y formatos
Cómo los objetos se diferencian de los canales
En un sistema tradicional basado en canales, la mezcla de audio se “baked” en un número de fuentes de altavoz. Por ejemplo, una mezcla de 5.1 contiene seis canales discretos: izquierda, centro, derecha, rodear izquierdo, rodear derecho y efectos de baja frecuencia. El ingeniero de mezcla decide qué sonidos van a qué altavoz y a qué nivel. El sistema de reproducción no tiene flexibilidad; simplemente envía cada canal a su altavoz asignado.
El audio basado en objetos cambia totalmente este paradigma. Las fuentes de sonido originales (por ejemplo, el diálogo de un personaje, un coche que pasa, un goteo de lluvia) se codifican como objetos de audio. Cada objeto está acompañado de metadatos —instrucción que describen su posición prevista en el espacio 3-D (x, y, coordenadas z), su tamaño (cuán ancho aparece el sonido), y su trayectoria de movimiento con el tiempo. El dispositivo de renderización (Receptor AV, barra de sonido, o incluso auriculares) utiliza este metadato para calcular en tiempo real cómo el objeto debe ser distribuido a través de los altavoces disponibles en esa sala.
Es importante que los objetos también puedan llevar audio “cama” – una mezcla tradicional basada en canales que sirve como la base sobre la cual se capan los objetos. En Dolby Atmos, por ejemplo, una mezcla típica de películas podría contener una cama 7.1 más hasta 118 objetos simultáneos. Este enfoque híbrido garantiza la compatibilidad atrasada, permitiendo una flexibilidad y una inmersión sin precedentes.
Formatos líderes en el mercado
Se han establecido varios formatos de audio basados en objetos, cada uno con sus propias fortalezas y patrones de adopción:
Dolby Atmos — El formato más ampliamente reconocido y desplegado basado en objetos. Originalmente diseñado para el cine, Atmos está disponible ahora en prácticamente todas las plataformas de streaming principales, en receptores de teatro, barras de sonido e incluso auriculares (a través de procesamiento binaural virtualizado). Atmos soporta hasta 118 objetos y una cama 9.1, con renderizado a medida para el diseño de altavoces del oyente. Utiliza un codec patentado (Dolby Digital Do
DTS:X — Respuesta de DTS a Atmos, DTS:X también utiliza audio basado en objetos pero con un motor de renderización diferente. Destaca la “libertad de colocación” y está orientada hacia el objeto en lugar de canal; a diferencia de Atmos, DTS:X no requiere una cama fija. DTS:X es más común en medios físicos (Blu-ray y Ultra HD Blu-ray) y es compatible con plataformas de streaming selectas y dispositivos. Auricular DTS:X extiende el audio espacial a los auriculares.
MPEG‐H Audio — Un estándar ISO desarrollado por el Grupo de Expertos en Imágenes Moving, MPEG‐H está diseñado para la transmisión y transmisión. Ofrece un marco integral que incluye formatos tanto canalizados, basados en objetos, y inmersivos. MPEG‐H se utiliza en el estándar de audio 3D para la radiodifusión terrestre (por ejemplo, en Corea del Sur) y es apoyado por Dolby como el núcleo de Dolby AC‐4.
IAMF (Modelos de audio inmersivos y formatos) — Un nuevo estándar de código abierto desarrollado por la Alianza para los Medios Abiertos (AOM). IAMF pretende proporcionar una alternativa libre de regalías para el audio espacial, utilizando el codec de Opus. Está diseñado para trabajar sin problemas con la transmisión de Internet y para ser implementado en navegadores web y dispositivos que soportan el vídeo AV1. IAMF podría convertirse en el estándar para el audio basado en objetos web, similar a cómo Opus se utiliza para el streaming de audio general.
El surgimiento de un audio basado en objetos en plataformas de streaming
Corriente de Video: La Revolución del Teatro Casa
La adopción de audio basado en objetos por plataformas de streaming de vídeo ha sido un cambiador de juego para el entretenimiento en casa. Netflix comenzó a ofrecer Dolby Atmos en 2017 con la serie “Okja”, señaló que el audio inmersivo ya no era exclusivo de los cines. Hoy en día, una vasta biblioteca de Netflix Originals y contenido licenciado está disponible en Atmos, junto con títulos selectos en DTS:X. Disney+ rápidamente seguido, proporcionando Atmos para el contenido de la Marvel y Star Wars. Apple TV+ va un paso más allá apoyando tanto Dolby Atmos como, para el auricular Apple Vision Pro, un sistema único “Audio Pod” que utiliza la renderización binaural basada en objetos para colocar sonidos en el entorno real del usuario.
La entrega técnica de audio basado en objetos sobre streaming es un logro de ingeniería notable. A diferencia de discos Blu-ray, que ofrecen un audio sin pérdida de bitrate alto (por ejemplo, Dolby TrueHD), los servicios de streaming deben comprimir audio para adaptarse al ancho de banda disponible mientras preservan la integridad espacial. Dolby Digital Plus (E‐AC‐3) con codificación conjunta de objetos (JOC) para Atmos, y AC-4 para audio avanzado inmersivo e interactivo. Estos codecs logran una excelente calidad en bitrates tan bajos como 384 kbps para una mezcla Atmos completa — mucho menos que los 6-8 Mbps de una pista de TrueHD sin pérdidas. Flujo de bitrate adaptativo ajusta la calidad de audio en bloqueo con vídeo para evitar el amortiguación, asegurando una experiencia suave incluso en conexiones de red variables.
Las plataformas de streaming también gestionan la compatibilidad con gracia. Si el dispositivo del usuario no admite la reproducción basada en objetos, el sistema automáticamente se vuelve a la cama estéreo o envolvente incrustada. Esta compatibilidad atrasada, integrada en los metadatos de audio, garantiza que el contenido basado en objetos llegue a la audiencia más amplia posible sin exigir a todos los usuarios que actualicen su hardware.
Música Streaming: Audio espacial toma el centro de la escena
Tal vez el crecimiento más explosivo del audio basado en objetos en la streaming ha ocurrido en la música. Música de Apple introdujo audio espacial con Dolby Atmos, haciendo que miles de canciones estén disponibles en una mezcla inmersiva que coloca instrumentos y voces alrededor del oyente. Música de Amazon ilimitada ofrece una característica similar llamada “Amazon Music HD” con Dolby Atmos y el audio de realidad 360 de Sony (que utiliza principios basados en objetos con una filosofía diferente—plazando sonidos en una esfera alrededor del oyente). Tidal ha sido pionero en audio de alta resolución y ahora incluye pistas Dolby Atmos y 360 Reality Audio en su nivel de calidad Master.
La transmisión de música requiere un enfoque diferente para la mezcla basada en objetos. En la película, los objetos están a menudo ligados a la acción en pantalla; en la música, el objetivo es crear un sentido del espacio y el envelopment que complementa la canción en lugar de imitar la realidad. Los productores y los ingenieros de mezcla pueden colocar voces en el centro, reverber colas en la parte posterior, y la mezcla de guitarra arpeggios, mezclando el estéreo espacio-
Para ofrecer música espacial de manera eficiente, los servicios de streaming utilizan los mismos codecs como video —Dolby Digital Plus con JOC— pero a menudo con bitrates más altos (unos 256–512 kbps) para preservar el matiz de la música. Como los auriculares se convierten en el dispositivo de reproducción dominante, el procesamiento binaural virtualizado integrado en aplicaciones de streaming (por ejemplo, Apple Spatial Audio con seguimiento de cabeza) hace que el campo de audio convence
Impacto en la creación y entrega de contenidos
Para los cineastas y desarrolladores de juegos
El audio basado en objetos permite a los creadores con herramientas de narración sin precedentes. Un cineasta puede colocar un susurro directamente detrás de la oreja izquierda del espectador, hacer una nave espacial rugir desde arriba, o tener pasos de un personaje moverse sin problemas desde el frente al lado. Debido a que el audio se hace en tiempo real, la misma mezcla puede adaptarse al ambiente del oyente, ya sea un 7.1.4 de cine en casa o un conjunto de diseño de altavoces estéreo.
En el juego, el audio basado en objetos es esencial para la inmersión. Motores de juego como el motor irreal y Wwise integran el soporte para API de audio espacial (por ejemplo, Dolby Atmos para el juego, Windows Sonic, Steam Audio). Los desarrolladores pueden posicionar sonidos individuales — disparos, pasos, ambiente ambiental— como objetos de 3D que interactúan con la geometría del juego de manera más competitiva.
Cambios de flujo de trabajo de producción
La adopción de audio basado en objetos requiere cambios en la cadena de producción. El software de mezcla de consolas, estaciones de audio digitales (DAWs), y herramientas de masterización han evolucionado para apoyar los metadatos de objetos. Por ejemplo, Avid Pro Tools ahora incluye un “Renderer” que envía información de objetos a un Dolby Atmos RMU (Rendering and Mastering Unit).
Los ingenieros deben asignar coordenadas 3-D a cada objeto y decidir si un objeto debe ser “panned” (moving) o estático. También establecen distancias y divergencias (spread) parámetros. Los metadatos se almacenan junto con el audio en un formato de archivo maestro como ADM (Modelo de Definición de audio) o BWF (Broadcast Wave Format con metadato integrado).
A pesar de estos pasos adicionales, el audio basado en objetos no necesariamente aumenta el costo de la creación de contenidos significativamente. Muchas plataformas de streaming proporcionan directrices e incluso subvencionan la creación de mezclas espaciales, especialmente para la música. El retorno de la inversión es claro: el contenido con audio inmersivo tiende a tener mayor compromiso, tiempos de visión más largos, y una promoción de palabras más fuerte.
Beneficios clave de audio basado en objetos
Inmersión mejorada
El beneficio más obvio es un sonido espectacular más realista y engrosante. El audio basado en objetos replica la forma en que escuchamos en el mundo real - sonidos vienen de puntos específicos en el espacio, con señales naturales para la distancia y la elevación. En una película, una tormenta de lluvia puede sentir que está cayendo a su alrededor, no sólo de los altavoces frontales y laterales. En un juego, el sonido de una flecha que azote más genuina conexión
Personalización
Debido a que el audio se produce de metadatos, cada oyente puede adaptar la experiencia. Algunos servicios de streaming y dispositivos permiten a los usuarios ajustar el nivel de diálogo relativo a los efectos, cambiar el idioma de una narración, o incluso cambiar objetos de audio (por ejemplo, elegir entre diferentes comentarios de audio). Esta personalización se construye en formatos como MPEG‐H y AC‐4, que incluyen funciones de “experto de audio interactivo” para resolver el problema de audio canal de audio
Flexibilidad en todos los dispositivos
El audio basado en objetos se adapta automáticamente al entorno de reproducción. La misma mezcla maestra puede sonar excelente en un sistema de 7.1.4 de alta gama y todavía proporcionar una experiencia espacial convincente en una barra de sonido estéreo o auriculares. Esta flexibilidad es crítica para la transmisión, donde los usuarios acceden al contenido en una amplia variedad de dispositivos: TV inteligentes, laptops, tabletas, teléfonos y auriculares VR.
Compatibilidad futura
El audio basado en objetos se construye para el futuro. A medida que emergen nuevas configuraciones de altavoces, como arrays de altura más grandes, controladores de fijación lateral, o incluso acústica holográfica, mezclas existentes basadas en objetos automáticamente se harán para aprovecharlas. No se necesita remezclar los parámetros de compatibilidad más antiguos. De igual manera, como la realidad virtual y la realidad aumentada se vuelven más dominantes, el audio basado en objetos será la columna vertebral del sonido espacial en esas experiencias.
Futuros perspectivas y desafíos
Ampliación del ecosistema
La adopción de audio basado en objetos sigue en sus inicios tempranos. Mientras que las principales plataformas de streaming lo han abrazado, muchos servicios más pequeños, corrientes de eventos en vivo y plataformas de contenido generadas por el usuario se retrasan. Como el ancho de banda crece y el hardware de consumo se vuelve más asequible (por ejemplo, barras de sonido de nivel de entrada con canales de altura virtualizados), la base instalada de dispositivos capaces aumentará. IAMF y soluciones de audio espacial de código abierto pueden acelerar la adopción entre plataformas basadas en la web como YouTube, Twitch y aplicaciones de redes sociales, que actualmente dependen en gran medida de los estéreos.
Desafíos en normas y licencias
Una de las principales barreras a la adopción generalizada es la fragmentación de formatos y licencias. Dolby Atmos requiere licencias de Dolby, que pueden ser costosos para fabricantes de hardware y servicios de streaming. DTS:X tiene su propia licencia. MPEG‐H es un estándar ISO pero implica la concesión de licencias de Via Licensing Alliance. IAMF es libre de regalías, pero carece del ecosistema establecido de contenido y herramientas que Atmos mercado de propiedad no tiene un término.
Audio en Realidad Virtual y Aumentada
El audio basado en objetos es el único enfoque viable para VR y AR, donde el oyente puede girar su cabeza arbitrariamente y el campo de sonido debe responder en tiempo real. Los auriculares actuales de VR integran el procesamiento de audio espacial (por ejemplo, Oculus Audio SDK) que utiliza la renderización basada en objetos basados en objetos basados en objetos relacionados con la cabeza (HRTFs) para crear un sonido 3-D convincente sobre los auriculares.
Aprendizaje de máquinas y máquinas en audio
La inteligencia artificial está empezando a desempeñar un papel en la creación y entrega de audio basada en objetos. AI puede analizar automáticamente una mezcla estereotipada y extrapolar metadatos espaciales, “aplicar” el contenido heredado en audio basado en objetos, aunque los resultados todavía son imperfectos. En el lado de renderizado, los modelos de aprendizaje automático pueden predecir asignaciones de altavoces óptimas para una determinada disposición de la habitación, mejorando la precisión espacial.
La carretera de frente
El audio basado en objetos en plataformas de streaming no es sólo una tendencia, sino un cambio fundamental en cómo el sonido se integra en medios digitales. Con continuas mejoras en la eficiencia de compresión, las capacidades de hardware y las herramientas creativas, eventualmente se convertirá en la forma predeterminada de experimentar el audio a la demanda. La línea entre cine, teatro de casa, juegos y eventos en vivo se desenfoque, todo impulsado por el mismo paradigma impulsado por metadata.