Comment créer une expérience sonore 3D convaincante en réalité virtuelle

Luke Goodloomis
|
|
June 8, 2017
|
5
Min Read
Comment créer une expérience sonore 3D convaincante en réalité virtuelle

‍Le rôle de l'audio en réalité virtuelle

Avec le développement de la réalité virtuelle (RV) et la multiplication quotidienne de ses cas d'usage, il est clair que le champ sonore est un élément essentiel de l'expérience immersive. Comment créer une expérience sonore 3D convaincante en réalité virtuelle ? Dans cet article, TEECOM définit les meilleures pratiques pour l'acquisition, la production et la distribution audio lors de la création de contenu RV, incluant la synchronisation audio/vidéo et la spatialisation.

Un son réaliste et synchronisé renforcera la perception d'immersion de l'utilisateur dans l'environnement de réalité virtuelle et réduira les effets secondaires physiologiques courants dans les productions actuelles, tels que les maux de tête, le mal des transports et la fatigue. Les meilleures pratiques suivantes peuvent sembler élémentaires, mais chaque étape est suffisamment importante pour être considérée comme un élément distinct de la chaîne de production. Ces directives ne doivent pas être considérées comme exhaustives, mais comme un point de départ pour une exploration plus approfondie à mesure que ce domaine évolue. La méthodologie de production audio existante doit être adaptée aux spécificités requises pour un mixage RV réussi.

How to Create a Convincing Virtual Reality 3D Sound Experience
©ISE2017

‍

Directives de production pour un son 3D réaliste

Pour créer une expérience de réalité virtuelle convaincante et atténuer les effets secondaires physiologiques liés au port d'un casque de réalité virtuelle, l'ensemble de la chaîne de signal audio nécessite plus d'attention que pour les productions précédentes. Un examen minutieux de chaque étape du flux de travail de production audio est indispensable. L'ingénieur du son pour la RV doit être capable de contrôler et d'écouter le son mixé et traité sur un casque en temps réel. Cela inclut toute compression à l'exportation, le traitement par fonction de transfert liée à la tête (HRTF) et la calibration psychoacoustique.

Acquisition audio

Évitez les ressources audio au format MP3 ou tout autre format compressé avec perte. Cela concerne aussi bien les bibliothèques audio existantes que les nouvelles acquisitions. Le traitement requis pour les productions RV créerait des artefacts audibles dans les éléments sonores et empêcherait un placement précis du son dans le champ sonore.

Évitez les enregistrements de sons localisés (pas, clics, grincements de porte et autres effets sonores) contenant du bruit ambiant, de la réverbération ou de la convolution. Les effets et le traitement nécessaires pour créer l'environnement sonore de la pièce en RV seront appliqués à chaque son que vous mixez lorsqu'il sera traité pour une écoute dans un environnement à 360 degrés (4πr2). Si plusieurs convolutions sont appliquées à un enregistrement, la spatialisation est déformée et une localisation précise devient impossible.

Utilisez, au minimum, des enregistrements en 24 bits / 48 kHz. Même les enregistrements en 16 bits / 44,1 kHz peuvent ne pas répondre aux besoins élevés de traitement de la RV. Les enregistrements avec une fréquence d'échantillonnage plus élevée seront moins sensibles à la distorsion de phase causée par les multiples couches de filtres appliquées lors du processus de post-production. Des profondeurs de bits plus élevées sonneront plus naturellement lorsqu'elles seront traitées pour la convolution. Vous devrez peut-être repenser les bibliothèques sonores que vous utilisez et la manière dont vous capturez vos ressources audio. L'emplacement du microphone sera déterminant dans le processus d'enregistrement. Le placement doit être suffisamment proche de la source sonore pour éviter d'enregistrer le bruit de la pièce et tout autre son indésirable, mais suffisamment éloigné pour capturer le son dans sa globalité et non un seul de ses éléments.

Si vous êtes créateur de bibliothèques d'effets sonores, proposez un contenu robuste et résistant à une post-production intensive. Idéalement, les sons doivent être enregistrés nativement en 24 bits/96 kHz ou au moins en 24 bits/48 kHz dans des fichiers audio non compressés.

Post-production et station de travail audio numérique (DAW)

Évitez d'importer des ressources d'une manière qui altère la phase ou déforme le contenu haute fréquence de l'audio. L'audio doit être importé dans son format natif ou converti uniquement vers un format similaire non compressé (par exemple, conversion de .wav vers .aiff ou .wav64).

Évitez d'appliquer des filtres altérant la phase ou éliminant les hautes fréquences, tels que la compression dynamique, la compression de fichier, les plug-ins de spatialisation 3D de faible qualité, ainsi qu'une égalisation complexe ou lourde. Tous les effets doivent être à phase linéaire.

Si vous êtes créateur de DAW ou fabricant de plug-ins, envisagez de publier une suite de plug-ins de post-production vidéo couramment utilisés avec peu ou pas d'altération de phase. Créez un plug-in capable d'analyser les ressources audio et de recommander si l'élément audio possède les qualités requises pour supporter un traitement intensif sans nuire à la qualité sonore, ce qui affecterait négativement l'expérience VR.

Assurez-vous que vos outils de production VR fonctionnent nativement à un minimum de 24 bits et 48 kHz (24/96 recommandé). Cette profondeur de bits et cette fréquence d'échantillonnage accrues aideront à atténuer les effets dommageables liés au traitement intensif nécessaire à la création de l'environnement audio VR.

Rendu pour la lecture VR et exportation depuis la DAW

Cette étape peut être divisée en deux processus selon les formats exportés et la méthodologie de post-traitement.

  1. Évitez d'utiliser un format de mixage unique pour toutes les situations de lecture. Par exemple, ne mixez pas en 5.1 pour ensuite traiter ce mixage 5.1 pour la VR. Créez des mixages distincts pour chaque format de lecture.
  2. Utilisez un algorithme VR qui se prête à une conversion vers un HRTF optimisé (O-HRTF) ou personnalisé (P-HRTF) avec le moins de distorsion possible.

Distribution à l'utilisateur final

Évitez la compression avec perte lors du traitement du contenu pour la distribution. Votre production en pâtira si tout le travail et le soin apportés à la préservation de la précision audio sont perdus dans la chaîne de distribution. Idéalement, une fréquence d'échantillonnage de 48 kHz ou plus sera conservée dans le format audio final. Cela aidera à éliminer toute distorsion de phase introduite par les filtres de limitation de bande requis pour l'audio 44,1 kHz, qui affectent la spatialisation[1].

Matériel de lecture : Casques et lunettes VR

Utilisez des casques de haute qualité capables de produire une scène sonore et une spatialisation aussi précises que possible. THX et Oculus déconseillent l'utilisation d'écouteurs intra-auriculaires ; leurs tests ont montré que ces derniers ne fournissent pas une scène sonore précise, bien que les recherches formelles utilisant des P-HRTF et un système de lecture calibré n'aient pas confirmé ces anecdotes. Des études et des tests supplémentaires sont nécessaires.

Logiciel de lecture : HRTF et étalonnage

  1. Intégrez les P-HRTF dans le logiciel de lecture.
  2. Incluez un moyen de calculer la taille de la tête de l'auditeur. Cela pourrait être aussi simple qu'un dispositif de mesure intégré aux bandeaux du casque VR.

Incluez une étape finale d'étalonnage de l'audio après l'application du P-HRTF et de la taille de la tête. Chaque paire de casques et chaque paire d'oreilles humaines localiseront les sons dans le monde VR avec des variations allant de légères à importantes. De plus, des expériences récentes ont montré que les P-HRTF ne fournissent pas de résultats précis en raison de la manière dont le cerveau humain traite l'audio. Plus de 25 % des sujets ne localisent pas les sons là où les 75 % restants les entendent en utilisant uniquement le P-HRTF. Ces variations de localisation vont d'un son qui devrait être localisé mais qui est perçu comme une masse sonore floue, à un son qui devrait être devant l'auditeur mais qui semble provenir de l'intérieur de sa tête ou de derrière lui.

L'audio doit être synchronisé avec la vidéo. La latence maximale estimée doit viser environ 2 à 3 ms. Une grande partie du contenu actuellement disponible peut présenter jusqu'à 10 ms de latence audio. Le tableau suivant résume ce qui précède :

VR Audio Best Practices

L'audio au service de l'expérience immersive

Ce n'est qu'en prenant en compte ces éléments, ainsi que la résolution vidéo par rapport à l'acuité visuelle et aux fréquences d'images, qu'une expérience de réalité virtuelle convaincante et sans danger peut être obtenue.

L'expérience doit primer sur toute autre considération. Nous devons reconnaître les limites de nos outils et évoluer dans le cadre de ces contraintes. Tous les éléments qui composent une expérience doivent servir l'intention du créateur et l'expérience elle-même. Laissez l'art guider la technologie. Comme le dit George Massenburg : « Si nous pensons que cela peut être amélioré, nous devrions au moins essayer. »

[1] L'audibilité des filtres audio numériques classiques dans un système de lecture haute fidélité. Document AES 9174. 2014. Jackson, Helen M. ; Capp, Michael D. ; Stuart, Robert J.