Introduction : Le paradigme de la pleine sphère
La façon dont nous vivons le son subit une profonde transformation. Pendant des décennies, la reproduction audio a été confinée à un plan plat et bidimensionnel devant l'auditeur. Le son stéréo et même 5.1 surround ont créé une "fenêtre" convaincante en un monde sonore, mais ils ont finalement lutté pour capturer l'aspect le plus fondamental de l'audition naturelle : la sphère. L'ambisonique, cadre théorique et pratique complet pour l'encodage, la manipulation et le décodage des champs sonores tridimensionnels, offre la solution définitive. Initialement théorisée au début des années 1970 par les pionniers britanniques Michael Gerzon et Peter Craven, l'ambisonique était en avance de plusieurs décennies. Il a exigé une puissance et des capacités de stockage informatiques qui n'existaient tout simplement pas pour le marché des consommateurs.
Pour bien comprendre où se trouve l'ambisonique aujourd'hui, il est essentiel de comprendre ses fondements théoriques et les percées pratiques qui l'ont transformée d'une curiosité de laboratoire à un standard industriel. Le parcours est un parcours de raffinement progressif, animé par la poursuite incessante du réalisme en audio.
Les origines : un cadre mathématique pour la réalité
L'histoire de l'ambisonique commence non pas dans un studio d'enregistrement, mais dans le domaine des mathématiques pures. harmoniques sphériques, un ensemble de fonctions orthogonales définies à la surface d'une sphère. Tout comme une série de Fourier peut représenter n'importe quelle forme d'onde périodique comme une somme d'ondes sinusoïdales, les harmoniques sphériques peuvent représenter n'importe quel champ sonore entrant à un point unique de l'espace comme une somme de motifs spatiaux. Le génie de Gerzon et Craven, travaillant à l'Institut mathématique d'Oxford, a été de réaliser qu'un champ sonore complet de premier ordre pourrait être encodé en seulement quatre signaux audio. Tableau B, forme le substrat de tous les systèmes Ambisoniques.
La principale idée était que l'oreille humaine ne perçoit pas seule la pression acoustique; elle détecte également les gradients de pression (la différence de pression entre deux points voisins). En capturant à la fois la pression omnidirectionnelle et les gradients de pression orthogonale, un système ambassique de premier ordre peut reconstruire une représentation fidèle du champ sonore en un point. Ceci est fondamentalement différent de stéréo ou 5.1, qui ne capture qu'une tranche bidimensionnelle du champ sonore.
Le B-Format et le A-Format
Le B-Format est le mécanisme de transport principal. Il se compose de quatre canaux:
- W: le composant omnidirectionnel (la pression totale au point).
- X: la composante de vitesse avant-arrière (dégradation de pression le long de l'axe des X).
- Y: La composante vitesse gauche-droite (dégradation de pression le long de l'axe Y).
- Z: la composante de vitesse ascendante (dégradation de pression le long de l'axe Z).
Lorsqu'un tableau de microphone capture le son, il sort généralement A-Format, qui est un ensemble de signaux de capsule brute. Ces signaux sont convertis mathématiquement, ou "encodé", en B-Format à l'aide d'une matrice connue sous le nom de Matrice d'encodage ambassique. Cette standardisation permet de décoder tout enregistrement A-Format pour tout système de lecture, tant que le B-Format est utilisé comme intermédiaire. La matrice d'encodage est dérivée de la géométrie du réseau de microphone et des motifs polaires de ses capsules, assurant que le B-Format représente le véritable environnement acoustique.
Dans la pratique, de nombreux microphones modernes, tels que le REG (S), sortie directement dans B-Format, simplification du workflow. Cependant, les utilisateurs professionnels travaillent toujours souvent avec A-Format de tableaux tiers pour gagner plus de contrôle sur le processus d'encodage, en particulier lorsque l'utilisation de tableaux avec des emplacements de capsules non idéales.
Encodage et décodage pratiques
Encodage d'une source sonore dans Ambisonics est simple. Une source monophonique peut être "pannée" dans le B-Format en appliquant des gains aux quatre canaux basés sur la direction de la source. Par exemple, un son directement devant aurait maximum X (positif), zéro Y et Z, et W égal à une constante. C'est la forme la plus simple de l'encodage Ambisonique synthétique.
Le décodage est le processus inverse : conversion de B-Format en signaux pour une disposition spécifique des haut-parleurs ou pour des écouteurs binaural. Pour les haut-parleurs, la matrice de décodage dépend du nombre et de la position des haut-parleurs. Pour le binaural, le B-Format est associé à des fonctions de transfert de tête (HRTF) qui simulent les effets acoustiques de la tête et des oreilles de l'auditeur. Suite de plugins IEM (un ensemble d'outils open-source), offrent un rendu de haute qualité avec un support de suivi de tête, ce qui les rend idéales pour les VR.
Les limites précoces et la niche de premier ordre
Les premières implémentations de l'Ambassic, connu sous le nom de Ambisonique du premier ordre (AFO), ont été remarquables pour leur élégance mais frustrant dans leurs limites pratiques . Le premier microphone commercialement viable à cette fin était le Microphone Soundfield, une gamme tétraédrique de quatre capsules sous-cardioïdes. Alors révolutionnaire, la FOA souffrait d'un «spot sucré» critiquement petit. Tout mouvement significatif loin de la position d'écoute idéale ferait s'effondrer ou devenir instable l'image spatiale.
De plus, le décodage de lecture était très complexe. Pour reproduire le champ sonore sur un ensemble de haut-parleurs, un matrice de décodage Ce processus de décodage était intensif sur le plan informatique pour le matériel analogique des années 1970 et 1980. Le marché de consommation, déjà confondu par l'échec du son quadrphonique, a largement ignoré l'ambisonique. Il n'a trouvé une maison que dans la recherche académique et parmi un petit groupe de passionnés d'audio dédiés qui valorisaient sa pureté théorique sur sa viabilité commerciale.
Une autre limite de la FOA est sa faible résolution spatiale. En termes techniques, un système de premier ordre ne peut représenter que le champ sonore avec un nombre limité de composants harmoniques sphériques (seulement quatre), ce qui se traduit par un « brouillage » de l'image spatiale, semblable à une photographie à basse résolution.
La Résurgence Numérique : VR et la Renaissance de l'Audio 3D
Pendant près de deux décennies, Ambisonics est resté à la périphérie. Le tournant a été la convergence de deux facteurs : l'augmentation spectaculaire de la puissance de calcul des consommateurs et la montée des écrans à tête haute (HMD). Le son surround traditionnel ne pouvait pas résoudre le problème fondamental présenté par la réalité virtuelle. En VR, l'utilisateur peut regarder en haut, en bas et autour librement. L'audio doit suivre la rotation de la tête avec zéro latence et doit rester stable indépendamment de l'orientation de la tête.
Ambisonics a fourni la réponse parfaite. Parce que le B-Format code le entier champ sonore à un moment, un moteur VR peut simplement faire tourner le champ sonore mathématiquement (en appliquant une matrice de rotation aux composants X, Y et Z) avant de le décoder en audio binaural pour casque. Cette "rotation" est trivialement bon marché par rapport à la ré-rendage de dizaines de sources sonores individuelles.
Les étapes clés de cette résurgence comprennent le développement de moteurs de décodage en temps réel et l'adoption d'Ambisonique par les grandes plateformes VR. Omnitone La bibliothèque a apporté le rendu Ambisonic en temps réel au navigateur Web, permettant aux vidéos à 360 degrés sur YouTube d'avoir un son spatial. De même, Facebook (Meta) a fortement investi dans Ambisonics pour son écosystème de VR, fournissant des outils pour les créateurs pour coder audio pour les messages Facebook et les expériences Oculus. Le succès commercial de l'Oculus Rift et HTC Vive a créé une forte demande pour l'audio immersif, et Ambisonics est devenu la solution par défaut.
Un autre fait important a été la normalisation des systèmes de Ambisonique de l'ordre supérieur (HOA). Bien que la FOA soit suffisante pour le suivi de la tête de base, les commandes plus élevées fournissent une meilleure résolution spatiale pour les applications critiques. L'industrie a rapidement dépassé la FOA, avec des 3e et 4e commandes (16 canaux) et (25 canaux) devenant courantes dans les productions professionnelles de VR. Cela a nécessité de nouveaux réseaux de microphone et un traitement plus puissant du signal numérique, mais les améliorations dans la localisation et le réalisme ont été spectaculaires.
Ambisonique de l'ordre supérieur (HOA): Pousser le plafond de résolution
Alors que la FOA était idéale pour la VR à la tête où la tête de l'utilisateur est dans le spot, sa résolution spatiale limitée était insuffisante pour l'écoute critique dans la production musicale ou la conception sonore cinématographique. Pensez à la FOA comme une image à basse résolution. Vous pouvez voir les formes, mais les détails fins sont flous. Ambisonique de l'ordre supérieur (HOA) augmente le nombre de composants harmoniques sphériques, augmentant de façon spectaculaire la « résolution » du champ sonore.
Le compte de canal s'échelle exponentiellement avec ordre en utilisant la formule: N = (commande + 1)^2
- 1ère commande (AFO): 4 canaux (faible résolution, petite tache douce).
- 2ème ordre : 9 canaux (amélioration notable de la localisation).
- 3ème ordre : 16 canaux (haute précision, adapté à la musique).
- 5ème ordre : 36 canaux (très haute résolution, typique pour les VR cinématographiques).
- 7ème ordre : 64 canaux (extrêmement haute résolution, approche de la synthèse des champs d'ondes).
En pratique, les commandes les plus courantes utilisées dans la production sont les troisième et quatrième. La cinquième commande est généralement réservée aux applications de cinéma et de recherche haut de gamme en raison du nombre de canaux massifs et de la charge informatique correspondante.
Défis dans la capture des HOUA
Capturer HAO nécessite des réseaux de microphone sophistiqués avec un nombre élevé de canaux et des tolérances serrées. La géométrie du réseau doit être précisément connue pour calculer la matrice d'encodage, et les capsules doivent être bien appariées dans la sensibilité et la réponse de phase.
Plusieurs entreprises ont produit des réseaux sphériques spécialement conçus pour la capture des HOA :
- Mh Acoustique Eigenmike: Un tableau sphérique de 32 capsule capable de capturer jusqu'à 4ème Ordre Ambisonique. Il est devenu un outil standard pour la capture audio spatiale professionnelle, largement utilisé dans le film et la diffusion.
- Zylia ZM-1: Un tableau de 19 capsules offrant jusqu'à la 3ème Ordre Ambisonique, conçu pour la portabilité et la facilité d'utilisation dans l'enregistrement de musique. Son facteur de forme plus petit le rend idéal pour l'enregistrement sur le terrain.
- C'est un problème. Bien qu'il soit lui-même un tableau de 4 capsules pour FOA, il peut être utilisé en conjonction avec un logiciel de décodage spécialisé pour réaliser des commandes plus élevées par des techniques de microphone virtuel.
En plus du matériel spécialisé, des outils logiciels comme le Suite de plugins ambulatoires IEM et Son bleu de la raie Les plugins permettent aux ingénieurs de mixer des HOA dans un DAW standard. Ces plugins fournissent des encodeurs, décodeurs, rotateurs et autres outils de traitement spatial qui traitent les mathématiques complexes dans les coulisses.
Écosystèmes modernes et flux de travail dans le monde réel
Aujourd'hui, Ambisonics est profondément intégré dans le pipeline de production audio professionnelle, de l'étape de l'enregistrement à la livraison finale.
Jeux et médias interactifs
Les moteurs de jeu comme Unity et Unreal, combinés avec des middlewares audio tels que Audiokinetic Wwise et FMOD, ont un support natif pour les pipelines audio Ambisonic. Les concepteurs de sons peuvent placer des sources audio dans l'espace 3D, et le moteur les rend dans un «bus» Ambisonic. Ce bus peut ensuite être tourné en fonction de l'orientation de la tête de l'auditeur et décodé sur audio binaural en temps réel.
Un exemple pratique est l'utilisation d'ambisoniques pour l'ambiance environnementale. Au lieu de placer des dizaines de boucles stéréo individuelles pour le vent, les oiseaux et le trafic éloigné, un concepteur de son peut capturer un environnement réel à l'aide d'un microphone HOA et importer le fichier B-Format résultant directement dans le moteur de jeu. Ce fichier unique reconstitue l'ensemble du champ sonore avec des repères spatiaux corrects, réduisant l'utilisation de la mémoire et la charge CPU tout en fournissant un sens de présence plus réaliste.
De plus, la matrice de rotation en ambassan permet un suivi dynamique de la tête avec une latence minimale. Lorsque le joueur tourne la tête, le moteur de jeu tourne simplement le champ Ambisonic avant le décodage binaural. Cette opération est tellement efficace qu'elle peut être effectuée par cadre sur des casques VR modernes sans impact sur le taux de trame.
Production musicale et Dolby Atmos
Dans le monde du mixage musical, Ambisonics a trouvé une forte position aux côtés de formats basés sur des objets comme Dolby Atmos. Alors qu'Atmos utilise un modèle audio basé sur des objets et lit, Ambisonics est utilisé comme un format de traitement intermédiaire. la convolution réverbère avec un ensemble de Réponses Ambisoniques à Impulse de Salle (BRIR). Ces BRIR capturent les caractéristiques directionnelles d'un espace réel, permettant à la réverbération de se sentir vraiment tridimensionnelle.
Un autre flux de travail commun est de mélanger des tiges individuelles dans Ambisonics, d'appliquer des effets spatiaux (rotation, polarisation ou atténuation basée sur la distance), puis de décoder à la disposition des haut-parleurs cibles. Champ son de RODE et NOA Audio Certains ingénieurs utilisent également Ambisonics pour créer des « tiges spatiales » qui peuvent être remixées ultérieurement pour différents formats, ajoutant de la flexibilité au processus de mastering.
Il est important de noter que l'Ambasonics et Dolby Atmos sont complémentaires, non pas en concurrence. Atmos est un format de livraison optimisé pour la lecture par le consommateur, tandis qu'Ambasonics est un outil de production qui excelle dans la capture et la manipulation de champs sonores réalistes.
Film et cinéma VR
Les cinéastes documentaires et les concepteurs de sons utilisent des microphones HOA pour capter l'ambiance naturelle d'un endroit, appelé « pistes sauvages » ou « tonalité de pièce ». Après la production, ces enregistrements HOA peuvent être importés dans une station de travail audio numérique (DAW) et utilisés comme un lit de fond 3D réaliste, sur lequel peuvent être placés des effets sonores individuels mono ou stéréo (dialogue, Foley).
Par exemple, dans un documentaire sur la nature, une capture d'une forêt pluviale à l'aide d'un Eigenmike peut être décodée pour fournir un fond plein de sphères d'oiseaux, d'insectes et d'eau. Le concepteur du son peut ensuite ajouter des narrations et des appels d'animaux comme objets individuels, créant un paysage sonore riche sans annulation de phase ou d'altération spatiale.
La bande-son doit être entièrement à 360 degrés et répondre aux rotations de la tête. L'ambisonique est la norme de facto pour l'audio VR cinématographique, supportée par des plateformes comme YouTube, Facebook et Oculus TV. Les cinéastes utilisent les microphones HAO sur des ambiances de position de réglage ou d'enregistrement séparément, puis mélangent ces derniers avec des effets sonores spatialisés et un rendu binaural pour casques.
Convergence et Horizon : Audio scénique
Le standard MPEG-H Audio, conçu pour Next Generation Audio (NGA), supporte l'audio basé sur canal, objet et scène (Ambisonic) dans un seul flux. Cela permet aux diffuseurs de fournir une expérience personnalisée où le spectateur peut ajuster le volume d'éléments spécifiques (par exemple, dialogue, bruit de foule) tout en maintenant une cohérence spatiale parfaite.
MPEG-H est déjà déployé dans les systèmes de radiodiffusion en Corée du Sud et au Japon, et son adoption est en croissance. Pour le créateur de contenu, cela signifie qu'un lit Ambisonic peut être combiné avec des objets dynamiques en un seul maître, fournissant à la fois efficacité et interactivité.
AI et apprentissage automatique
L'intelligence artificielle commence à jouer un rôle important dans l'ambisonique. Les algorithmes modernes peuvent analyser un signal audio monophonique ou stéréo et le mélanger intelligemment à l'HOA. Bien que ces outils ne remplacent pas une véritable capture multimicrophonique, ils deviennent remarquablement bons pour extraire des informations spatiales de contenu hérité, permettant aux anciens enregistrements d'être expérimentés de nouvelles façons immersive. Cette technologie est déjà utilisée dans les smartphones et les casques VR de consommation pour fournir une expérience audio plus immersive à partir de contenu stéréo standard.
Par exemple, Facebook upmixer audio spatial utilise un réseau neuronal pour estimer les paramètres spatiaux à partir de l'audio monophonique et générer un champ Ambisonique de premier ou deuxième ordre. Chère réalité a développé un outil de mixage qui peut convertir les mixages stéréo en formats immersifs. Bien que les puristes puissent s'y opposer, ces algorithmes de mixage sont remarquablement efficaces pour le contenu ambiant et musical, ouvrant de nouvelles possibilités pour les catalogues existants.
Les modèles d'apprentissage automatique peuvent corriger les imperfections des réseaux de microphone, estimer les matrices d'encodage optimales et même réduire le bruit tout en préservant les repères spatiaux. Les laboratoires de recherche explorent le rendu neuronal de bout en bout des champs sonores des réseaux de microphones clairsemés, ce qui permet potentiellement la capture de HAO avec moins de capsules et un matériel plus simple.
Normalisation et PI Transports
Pour la production à distance et le streaming en direct, l'IETF a publié des RFC pour la transmission de l'audio ambassique sur les réseaux IP (par exemple, RFC 7198 pour Ambisonics sur RTP).Cette normalisation est essentielle pour l'avenir des événements immersifs en direct, permettant à une arène sportive ou salle de concert de diffuser son mix audio 3D directement à des millions d'auditeurs à domicile.
Les applications incluent des concerts en direct VR, où un flux Ambisonique du lieu est combiné avec un mélange binaural capté dans le casque de l'auditeur. La nature faible latence de la rotation Ambisonique rend cela possible même sur les réseaux actuels. Suivant et MélodieVR ont déjà expérimenté avec des émissions Ambisoniques en direct, et la technologie devrait devenir plus commune à mesure que les réseaux 5G mûrissent.
En outre, les Modèle de définition audio (ADM) Les métadonnées Ambisonic permettent une intégration transparente avec les flux de production existants, ce qui garantit que le contenu Ambisonic peut être archivé, échangé et remixé sans perdre d'informations spatiales.
Outils et plugins pour le producteur moderne
Pour les professionnels de l'audio qui cherchent à plonger dans l'ambisonique, il y a maintenant une multitude d'outils disponibles à différents prix. Voici quelques ressources clés:
- Suite de plugins ambassiens IEM: Une collection gratuite et open-source de plus de 40 plugins pour l'encodage, le décodage, la rotation et la visualisation Ambisonic. Disponible pour tous les DAW majeurs, il inclut le support pour jusqu'à 7ème ordre et est largement utilisé dans l'éducation et la production.
- Son bleu de la raie : Une suite commerciale de plugins Ambisonic de haute qualité avec un accent sur la convivialité et la qualité sonore. Ils offrent des outils spécialisés pour le mixage, les effets spatiaux et le codage de troisième ordre.
- C'est un champ sonore de RODE : Suite plugin gratuite pour travailler avec le microphone NT-SF1, fournissant encodage, décodage et outils de simulation.
- NOA Audio : Un ensemble d'outils complet avec un «spatialiseur» unique qui permet une manipulation intuitive des champs sonores. Comprend également un décodeur de cap pour la surveillance binaural.
- Suite SPARTA : Une collection d'outils basés sur le MATLAB (avec des versions autonomes) pour la recherche et la production avancée, développée par l'Institut de recherche acoustique de Vienne.
- Bibliothèque de l'HOA pour l'unité/Inréalité : Bibliothèques communautaires qui intègrent le traitement ambassique directement dans les moteurs de jeu, supportant le rendu binaural en temps réel et la rotation dynamique.
Lors de la construction d'un workflow Ambisonic, il est important de maintenir des conventions cohérentes de commande et de normalisation. ACN (numérotation des composants ambisoniques) avec la semi-normalisation Schmidt (SN3D) ou la normalisation N3D. Les plugins IEM et Blue Ripple utilisent ACN-SN3D comme défaut, qui est également le format recommandé pour les normes MPEG-H et VR.
Conclusion : Le cercle (et la sphère) est maintenant terminé
Du craie d'Oxford aux scènes sonores d'Hollywood et aux casques de millions d'utilisateurs de VR, le voyage d'Ambisonique est un exemple clair de la puissance de la recherche fondamentale. Ce qui a commencé par un exercice purement théorique en harmoniques sphériques est maintenant une composante essentielle des pipelines audio les plus avancés en existence.
L'évolution de l'ambisonique est loin d'être terminée. Avec les avancées en AI, en technologie de microphone et en puissance informatique, la promesse d'un audio spatial vraiment parfait est plus proche que jamais. La vision de Gerzon et Craven a finalement été réalisée, et elle continuera à façonner nos expériences sonores pendant des décennies. Que vous soyez un concepteur audio de jeu, un producteur de musique, un cinéaste ou un passionné de VR, comprendre l'ambisonique devient une compétence essentielle.