Skip to main content
Mise à jour : 29 avril 2019 L’architecture audio de XBOX One cherche un équilibre entre les réussites et les compromis des plateformes de génération précédente, tout en anticipant les besoins techniques croissants des implémentations de nouvelle génération. L’architecture fournit des voies accélérées par le matériel pour les aspects les plus courants du rendu audio, comme la compression, le mixage et le filtrage, sur de nombreuses voix simultanées. De plus, l’architecture fournit un modèle de ressources partagées pour la consommation du traitement logiciel, ce qui permet à chaque titre de choisir le type et la quantité de manipulation de signal personnalisée à appliquer en utilisant le processeur. Cette rubrique décrit ces caractéristiques logicielles et matérielles de l’architecture audio de XBOX One. Elle fournit également des détails sur la façon dont ces caractéristiques peuvent influencer les choix que vous faites lors de l’implémentation.

Vue d’ensemble de l’architecture audio

En plus de la puissance générale du processeur, qui peut servir au décodage, à la synthèse, au rendu et à d’autres tâches, XBOX One fournit plusieurs composants matériels (comme le montre la figure 1) qui sont dédiés au traitement audio et qui peuvent adresser l’ensemble de l’espace mémoire unifié. Figure 1. Illustration des composants audio accélérés par le matériel Composants audio accélérés par le matériel
  • Le moteur SHAPE (Scalable Hardware Audio Processing Engine) constitue la majeure partie des fonctionnalités audio de XBOX One, bien que les autres processeurs apportent aussi des fonctionnalités importantes.
  • Le processeur ACP (Audio Control Processor) assure la gestion de l’état et la planification.
  • Le processeur ASP (Audio Scalar Processor) prend en charge les opérations scalaires en virgule flottante et les opérations vectorielles sur des entiers.
  • Le processeur AVP (Audio Vector Processor) prend en charge les opérations vectorielles en virgule flottante et est conçu principalement pour l’annulation d’écho multicanal (MEC).

SHAPE

SHAPE est le matériel central dédié au traitement audio. SHAPE effectue un grand nombre des opérations de base qui sont couramment requises voix par voix. Avec SHAPE, vous pouvez réduire l’impact sur le processeur, même en cas de polyphonie élevée et de routages de signaux complexes, tout en conservant la souplesse de l’échange de données entre SHAPE et le processeur si un titre choisit de traiter un signal numérique de façon personnalisée ou d’effectuer une analyse ou une synthèse logicielle. SHAPE fonctionne sur des blocs de 128 échantillons, chaque échantillon prenant en charge une résolution entière de 24 bits ou une valeur flottante de 32 bits lorsqu’il est utilisé par le processeur. À 48 KHz, cela représente une trame audio de 2,67 ms, ce qui offre une résolution temporelle plus élevée et une latence plus faible que celles possibles avec le bloc de 256 échantillons de XBOX 360. SHAPE offre les six blocs à fonction fixe suivants, axés sur les tâches audio courantes.
  • Décodeur XMA XMA fournit le décodage simultané de 512 voix au format XMA. Il s’agit d’un codec perceptuel qui a été développé pour XBOX 360 et qui offre une qualité et une compression réglables par l’utilisateur, généralement entre 6:1 et 14:1.
  • SRC Le bloc SRC (Sample Rate Convertor) polyphasé, dédié et de haute qualité, permet un rééchantillonnage de fréquence performant et de haute qualité de 512 canaux mono de données audio. Le SRC peut servir à la conversion de format, à l’effet Doppler ou à la variation de hauteur.
  • Mémoires tampons de mixage Les mémoires tampons de mixage sont les accumulateurs dédiés à 128 canaux de mixage sur place. Elles n’ont pas besoin d’accéder à la mémoire et disposent d’un total de 8192 canaux disponibles virtuellement. Les mémoires tampons de mixage fournissent également une mesure approximative des niveaux et la détection de l’écrêtage à des fins de débogage et de surveillance.
  • FLTVOL Le module FLTVOL fournit la mise à l’échelle du volume et l’implémentation d’un filtre à variables d’état pour 2560 voix ou mixages. Il est analogue au filtre par voix de XAudio2 exposé par logiciel qui est disponible sur Windows et XBOX 360. Le filtre peut fournir un filtrage passe-bas, passe-haut, passe-bande et coupe-bande. Le filtre expose les paramètres Q et de fréquence de coupure/centrale. Il est le plus souvent utilisé pour la modélisation de la distance et de l’occlusion.
  • EQ/CMP Le module EQ/CMP fournit jusqu’à 512 canaux d’égalisation à trois bandes et de compression de la plage dynamique. L’égaliseur se compose de trois filtres biquadratiques en cascade série. Le compresseur a une réponse à coude dur et prend en charge les fonctionnalités de chaîne latérale (sidechain) et d’expandeur.
  • DMA SHAPE dispose d’un matériel DMA (Direct Memory Access) dédié pour transférer des données audio vers et depuis l’espace mémoire unifié. Le DMA rend possibles des scénarios comme le transfert sans convertisseur de fréquence d’échantillonnage, le transfert des canaux de mixage finaux et le traitement par le processeur au milieu d’un graphe audio basé sur SHAPE.
La lecture d’un graphe audio typique devrait utiliser abondamment chacun de ces processeurs.

ACP

L’ACP assure la gestion de l’état et la planification de tous les autres composants matériels audio sur le pont nord. Il n’est pas nécessaire de faire intervenir le processeur dans le traitement intra-trame ni dans la synchronisation ou la latence qu’il pourrait introduire.

ASP

L’ASP prend en charge les opérations scalaires en virgule flottante et les opérations vectorielles sur des entiers. Le matériel fournit des codecs de clavardage vocal : ceux qui gèrent la communication sans fil entre un casque de clavardage vocal et la console, et ceux qui servent à compresser et à décompresser les données vocales du codec SILK pour la communication vocale en réseau.

AVP

L’AVP prend en charge les opérations vectorielles en virgule flottante et est conçu principalement pour le MEC et d’autres formes de réduction du bruit pour l’entrée audio du Kinect de nouvelle génération. L’AVP prend en charge la reconnaissance vocale et l’utilisation de l’entrée audio pour le clavardage ou à des fins arbitraires. Le MEC et les autres processus de réduction du bruit fournissent un flux plus intelligible des données audio parlées de l’utilisateur, même à partir d’un microphone placé plus près des haut-parleurs de sortie que de l’utilisateur.

L’audio et le matériel XBOX One

Le pipeline de sortie audio de XBOX One élimine le convertisseur numérique-analogique (DAC) que l’on trouvait dans les consoles de génération précédente. Tout l’audio est émis strictement dans le domaine numérique, par HDMI 1.4a ou par sortie optique S/PDIF. HDMI 1.4a permet la transmission depuis la console d’une modulation par impulsions et codage (PCM) linéaire haute fidélité à 7.1 canaux. Par défaut, les titres utilisent une fréquence d’échantillonnage de sortie de 48 KHz et une profondeur de 24 bits. XBOX One peut également prendre en charge jusqu’à quatre sorties simultanées vers des casques stéréo. Chaque sortie peut représenter des mixages multicanaux uniques qui sont réduits (downmix) au besoin selon le format de sortie, comme un casque ou la sortie S/PDIF. XBOX One accepte l’entrée audio de diverses sources, comme le réseau de microphones du Kinect, les casques de clavardage vocal et les ressources infonuagiques. De plus, l’audio peut être généré de façon algorithmique par un calcul effectué par le processeur et manipulé en temps réel sur le processeur, au moyen des composants matériels SHAPE, ou des deux.

Formats de compression

XBOX One prend en charge la décompression matérielle pour XMA2, ce qui procure des réductions importantes de stockage, de bande passante et de mémoire par rapport au PCM non compressé. XAudio2 offre aussi la prise en charge du décodage logiciel pour xWMA et pour la modulation ADPCM (Adaptive Differential Pulse Code Modulation). Bien que le calcul pour le format ADPCM ait une faible surcharge, en tant que codec non perceptuel, l’ADPCM peut produire des artefacts perceptibles à des fréquences d’échantillonnage plus faibles.
xWMA et XMA2 tirent tous deux leur origine des codecs développés pour Windows Media Audio (WMA) et ont tous deux été développés spécifiquement pour les jeux XBOX. Le sous-ensemble de codecs et de paramètres disponibles utilisé par XMA2 est plus petit que celui utilisé par xWMA. Bien que xWMA et XMA2 aient été développés pour XBOX, ils ne sont pas interchangeables : les en-têtes de chaque format de fichier diffèrent, et les formats sont incompatibles avec les versions PC de Windows. Les codecs utilisés pour XMA2 et xWMA sont aussi légèrement différents, de sorte que chacun aura ses propres artefacts issus du système de compression utilisé.
Le tableau suivant présente le format, la compression approximative et la capacité de boucle. Le MP3, l’OGG et d’autres formats audio pour les ressources de jeu peuvent être fournis au moyen de codecs logiciels du titre ou d’intergiciels exécutés sur le processeur.

L’audio et le modèle d’application XBOX One

Lorsqu’elle est au premier plan, une application a un accès complet au matériel SHAPE. Cependant, lorsqu’elle passe en arrière-plan épinglé, en mode image dans l’image ou dans un autre scénario, l’application renonce au contrôle du matériel. Par défaut, son matériel est suspendu et il reprend lorsque le titre revient au premier plan. Cela vaut aussi pour les applications à ressources exclusives (ERA), dont le graphe logiciel est suspendu. Un titre a la possibilité de détruire son graphe audio et de le reconstruire lors de la reprise. Certains titres, en particulier les applications à ressources partagées (SRA) qui jouent de la musique en arrière-plan, comme la radio en diffusion continue, peuvent choisir de faire en sorte que certains aspects de l’audio continuent de jouer même pendant la pause. Pour ces scénarios, les titres doivent évaluer attentivement s’il faut tenter une transition fluide du rendu matériel au rendu logiciel, ou toujours lire l’audio destiné à la lecture en arrière-plan au moyen d’un pipeline uniquement logiciel. Cela a des répercussions sur les formats de compression et les coûts en ressources processeur. Par exemple, les ressources compressées en XMA nécessitent l’utilisation du matériel SHAPE et ne pourront donc pas être décodées par une application en arrière-plan. Pour un titre qui choisit d’allouer des ressources processeur, le moteur audio XAudio2 fournit des voies logicielles pour de nombreuses fonctions. Lorsque c’est possible, ces fonctions imitent les capacités matérielles, mais certains traitements exigeants en calcul sont soit indisponibles, soit implémentés différemment dans le logiciel. Les titres qui passent du traitement matériel au traitement logiciel en fonction de l’état d’une application voudront peut-être tenir compte de ces différences lors de la planification de leurs pipelines audio, comme le montre le tableau suivant. | Fonctionnalité| Capacité matérielle de XBOX One | Capacité logicielle de XBOX One | Équivalent? | | --- | --- | --- | --- | --- | --- | --- | --- | --- | | Conversion de la fréquence d’échantillonnage| SRC, polyphasé| Interpolation linéaire XAudio2| Non | | Égaliseur paramétrique| EQ/CMP, égaliseur à trois bandes| Égaliseur simple à une bande ou traitement numérique du signal (DSP) personnalisé| Non | | Compresseur/limiteur| EQ/CMP, capacités de coude dur, de chaîne latérale et d’expandeur| DSP personnalisé| Non | | Filtrage| FLTVOL, filtre à variables d’état| Filtre à variables d’état XAudio2, filtre passe-bas unipolaire ou DSP personnalisé| Oui | | Mixage| Mémoires tampons de mixage; comprend la détection de l’écrêtage et la mesure des niveaux| Mixage logiciel; DSP personnalisé pour la détection de l’écrêtage et la mesure des niveaux| Oui, pour le mixage |

Bibliothèques audio XBOX One

XBOX One prend en charge deux API de rendu audio pour une utilisation typique dans les jeux, ainsi qu’une variante de l’API Media Foundation de Windows 8 pour la lecture de la musique de l’utilisateur.
  • XAudio2 est une bibliothèque audio axée sur les jeux qui est déjà disponible sur XBOX 360 et sur Windows, de Windows XP à Windows 8. Nous recommandons XAudio2 pour le développement de la plupart des titres.
  • L’API WASAPI (Windows Audio Session API) peut être utilisée pour tout pipeline personnalisé implémenté exclusivement par logiciel. WASAPI fournit uniquement des fonctionnalités de point de terminaison audio. Le client doit implémenter la décompression, la conversion de la fréquence d’échantillonnage, le mixage et le traitement numérique du signal, ainsi que les interactions avec les composants matériels audio de XBOX One. WASAPI est le plus souvent utilisée par les solutions d’intergiciel audio.
L’outil Microsoft Cross-Platform Audio Creation Tool (XACT) et DirectSound ne sont pas pris en charge dans l’environnement XBOX One. Les titres qui utilisaient auparavant ces technologies devraient envisager les solutions présentées dans cette rubrique ou utiliser des options d’intergiciel audio XBOX One approuvées.

En résumé : commencer dès aujourd’hui

Les créateurs de contenu et les responsables de l’implémentation des titres qui commencent à développer pour XBOX One pourraient tenir compte des éléments suivants lorsqu’ils commencent leur planification.
  • Prévoyez l’audio 7.1. Cela englobe le panoramique et le positionnement du contenu prérendu et en temps réel. Réfléchissez à la façon dont votre titre utilisera chaque canal audio.
  • Explorez et comprenez les options de compression audio. Comprenez les différences acoustiques et de taille entre les compressions XMA, xWMA et ADPCM. Pour comprendre les cibles budgétaires attendues sur XBOX One, évaluez les paramètres de qualité et de débit binaire de votre contenu.
  • Tenez compte des modèles d’utilisation du DSP accéléré par le matériel, en particulier si votre titre prévoit implémenter la simulation de l’occlusion ou de l’obstruction.

Voir aussi

Vue d’ensemble de XAudio2 Vue d’ensemble d’ADPCM Vue d’ensemble de SHAPE Vue d’ensemble de XMA2 Vue d’ensemble de xWMA
Last modified on October 6, 2026