Strona głównaArtykułyMaskowanie Psychoakustyczne

Maskowanie Psychoakustyczne: Ciche Dźwięki, Które Twój Słuch Nie Zauważa

Jak głośny ton podnosi próg słyszalności wokół niego, dlaczego maskowanie jednoczesne, do przodu i do tyłu różnią się oraz jak kompresja MP3 przekształca to w mniejsze pliki.

mysimulator teamZaktualizowano — czerwiec 2026≈ 7 min czytania▶ Otwórz symulację

Głośny dźwięk może sprawić, że cichy zniknie

Odtwórz głośny ton o częstotliwości 1000 Hz i znacznie cichszy ton o częstotliwości 1100 Hz jednocześnie, a cichy ton może całkowicie zniknąć z wrażeń słuchowych, mimo że w izolacji byłby idealnie słyszalny. Jest to maskowanie psychoakustyczne: silny sygnał o danej częstotliwości podwyższa próg słyszalności dla sąsiednich częstotliwości, ukrywając wszystko słabsze pod krzywą maskującą rozciągającą się od głośnego tonu, szerzej po stronie wysokich częstotliwości niż niskich.

demo na żywo · powiązana symulacja● LIVE

Gdzie zachodzi maskowanie: słuchowa rura

Mechanizm rozpoczyna się na błonie basowej wewnątrz słuchowej rury, która wykonuje przybliżoną analizę mechaniczną częstotliwościową nadchodzących dźwięków – różne położenia jej długości najsilniej rezonują z różnymi częstotliwościami, zoptymalizowane dla wysokich częstotliwości w pobliżu wejścia słuchowej rury (bazą) i niskich częstotliwości w odległej części (wierzchołkiem). Głośny ton napędza szeroki obszar tej błony mocno, a pobliski, słabszy dźwięk o własnym rezonansowym regionie nakładającym się na ten sam napędzany obszar, jest fizycznie zalewany tam przed rozdzieleniem dwóch sygnałów na odrębne kanały nerwowe. Błona basowa wykazuje asymetryczne strojenie – każdy rezonansowy obszar reaguje szerzej na częstotliwości powyżej niż poniżej – co dokładnie wyjaśnia, dlaczego krzywe maskowania nachylają się w kierunku wyższych częstotliwości maskera.

Jednoczesne, przód i tył maskowanie

Maskowanie jednoczesne to przypadek opisany powyżej: masker i ton maskowany są obecne jednocześnie. Maskowanie przód jest bardziej skomplikowane: głośny ton może nadal podnieść próg dla cichego tonu odtwarzanego około 100-200 milisekund po jego zakończeniu, ponieważ układ słuchowy potrzebuje czasu na regenerację po silnym stymulowaniu. Maskowanie tył jest jeszcze bardziej skomplikowane: głośny ton może maskować nawet cichszy ton odtwarzany kilka milisekund przed jego rozpoczęciem, co przypisuje się wolniejszym czasom przetwarzania neuronalnego słabszego sygnału w porównaniu z silnym sygnałem – reprezentacja neuronalna słabszego sygnału jest tworzona, gdy silniejszy, szybszy sygnał od głośnego tonu przybywa i ją przewyższa.

Zwrot z tytułu: stratne kompresje audio

MP3, AAC i każdy inny perceptualny kodek audio wykorzystują maskowanie bezpośrednio: model psychoakustyczny, kropka za kropką, szacuje, które składniki częstotliwościowe byłyby maskowane przez głośniejsze komponenty znajdujące się obok, a więc niezauważalne od samego początku, i enkoder przydziela mniej bitów (ani w ogóle) do tych komponentów, wydając ograniczony budżet bitowy na te części spektrum, które słuchacz mógłby faktycznie usłyszeć. To właśnie w ten sposób te formaty osiągają przybliżone 10-krotne skompresowanie w stosunku do niekomprimowanego audio, zachowując prawie identyczny dźwięk podczas typowego odtwarzania – nie kompresują fali dźwiękowej wiernie, tylko eliminują dokładnie informacje, które przewiduje model maskowania, że nie możesz usłyszeć.

encoder per frame:
  1. estimate masking thresholds from the loud components present
  2. compare each frequency component's level against its local threshold
  3. quantize components below threshold coarsely or drop them
  4. spend the saved bits on components above threshold

Frequently asked questions

Dlaczego krzywa maskowania sięga dalej powyżej częstotliwości maskującej niż poniżej?

Oтраża to fizyczne strojenie błony basowej w wewnętrznym uchu, której obszary rezonansowe reagują szerzej na częstotliwości powyżej ich charakterystycznej częstotliwości niż poniżej, co sprawia, że efekt maskowania głośnego tonu rozprzestrzenia się dalej w górę częstotliwości niż w dół.

Jakie jest różnicę między maskowaniem do przodu a maskowaniem do tyłu?

Maskowanie do przodu to sytuacja, w której głośny ton podnosi próg słyszalności dla cichszego tonu, który gra po nim i trwa około 100-200 milisekund, podczas gdy uszu przywraca się wzrok. Maskowanie do tyłu to odwrotna i dziwniejsza sytuacja: głośny ton może maskować cichszy ton odtwarzany kilka milisekund przed nim, ponieważ wolniejsza obróbka neuronalna słabszego sygnału nie zakończyła się w momencie, gdy szybsza obróbka silnego sygnału ją prześciga.

Jak maskowanie zmniejsza rozmiar plików MP3?

Kodownik MP3 oblicza, które komponenty częstotliwości w każdym ramy byłyby maskowane przez głośniejsze komponenty znajdujące się obok i dlatego niewykrywalne, a następnie wydziela prawie żadnych bitów na te komponenty, zachowując jednocześnie wykrywalne komponenty, co pozwala osiągnąć znaczne redukcje rozmiaru pliku przy minimalnej utracie postrzeganej jakości.

Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Psychoacoustic Masking i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację Psychoacoustic Masking

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)