Exemple simple :        - Prenons un morceau de musique de qualité CD audio (WAVE) d'une durée de 3 minutes environ
- L'enregistrer sur le disque dur.
- Constater sa taille importante.
- Le fichier WAVE va maintenant être converti au format MP3 (à l'aide d'un programme spécial   ex : CDexbeta)
- Comparer la taille du fichier WAVE et celle du fichier MP3
 
 

Par une simple constatation on peut tout d'abord remarquer qu'à une échelle identique et à un même point t, la courbe de fréquences du fichier MP3 est nettement moins nette que celle du fichier WAVE.
 

Seconde expérience :

Quand on examine le signal électrique à la sortie d'un microphone (piézo ou dynamique) avec un oscilloscope, on voit un signal complexe qui est en fait, composé de plusieurs sinusoïdes pures, dont les fréquences est les amplitudes sont fonction du signal d'origine. (Théorème de Fourier).

A un instant "t" donné, ce signal n'a qu'une seule information :
son amplitude.
Pour coder le "son" en binaire (
pour être ensuite transféré comme les caractères ou les images), nous allons transformer cette amplitude à l'instant "t", en une série de signaux binaires par l'intermédiaire d'un convertisseur analogique/numérique.
La précision de l'amplitude sera fonction du nombre de bits utilisés pour son codage. Pour la voix, 8 bits sont suffisants. Pour avoir une qualité HiFi, il faudra beaucoup plus de bits (16 ou 32...) .
Pour coder l'ensemble de notre signal "sonore" il faudra effectuer l'opération plusieurs fois... la théorie (
Shannon) dit qu'il faut au moins deux points pour restituer une sinusoïde.
Dans le cas de la voix, qui peut s'étendre de 30 a 10000 Hz, la majeure partie de l'énergie est centrée autour de 300 à 4000 Hz. (En téléphonie on se limite même à 3400Hz !)


Théoriquement il suffirait de 6400 échantillons pour coder (et restituer) un signal vocal... (en pratique la cadence normalisée en téléphonie est de 8000 échantillons par seconde.)
Pour le codage HiFi il faudra, bien entendu, un plus grand nombre d'échantillons.

Après échantillonnage et codage pendant un temps déterminé, il est alors possible de charger toutes ces informations dans un fichier. (.WAV)

En général, le codage "sonore" prend beaucoup de place. Dans notre cas du codage vocal, il faut 8 bits x 8000 fois par seconde soit 64Kbs...
(un enregistrement de 10 sec prendra 640 Kbits... !!! )


Il existe un autre système de codage sonore qui a une certaine analogie avec les fichiers "images" vectoriels : ce sont les fichiers MIDI (extension MID). Ces fichiers ne contiennent pas directement des sons, mais des informations qui seront passées à la carte de traitement, pour générer les sons. C'est comme un chef d'orchestre qui donne des ordres aux musiciens, lorsque c'est à eux de jouer ...
Ces fichiers sont beaucoup moins encombrants que les WAV, mais ils ne jouent que de la musique synthétique !


La musique "échantillonnée" peu être diffusée sur le WEB grâce à une méthode de compression qui permet de réduire la dimension d'un fichier dans une proportion de 1 à 10... C'est le format MP3.
Le MP3 est dérivé du MPeg-1 développé par le Fraunhofer Institute en collaboration avec Thomson-Multimédia.
La méthode de codage de MP3 consiste à supprimer tous les éléments sonores inutiles à l'oreille humaine. C'est le cas des infrasons ou des ultrasons. La compression MP3 supprime également des sons qui sont masqués par d'autres. L'algorithme de codage est tout de même relativement complexe !

Bien qu'amputée de certains éléments, la musique comprimée en MP3 a une qualité équivalente à celle d'un CD.