Strona główna Dźwięk i Akustyka Synteza mowy

🗣️ Synteza mowy

Poznaj fizykę mowy — rezonanse traktu głosowego, formanty i artykulację.

Dźwięk i Akustyka2DŚredni60 FPS
voice-synthesis ↗ Otwórz osobno
Interfejs samej symulacji jest w języku angielskim.

O tej symulacji

To narzędzie syntetyzuje dźwięki samogłosek, kształtując źródło głosowe (dźwięczne lub szeptane) szczytami rezonansowymi — formantami F1, F2 i F3 — uproszczonego modelu rury traktu głosowego. Wybranie ustawienia samogłoski IPA, takiego jak /a/, /i/, /u/, /e/ lub /o/, lub bezpośrednie przeciąganie suwaków formantów, jednocześnie aktualizuje widmo częstotliwości, pozycję na wykresie samogłosek i kształt traktu.

🔬 Co pokazuje

Jak trzy rezonansowe częstotliwości formantów, wytwarzane przez kształt traktu głosowego, łączą się ze źródłem głosowym, tworząc odrębne dźwięki samogłosek, wizualizowane jako widmo, wykres samogłosek F1-względem-F2 oraz diagram kształtu traktu.

🎮 Jak korzystać

Wybierz ustawienie samogłoski (/a/ /i/ /u/ /e/ /o/), dostrój suwaki F1, F2, F3, Tract Length i Pitch F0, wybierz źródło głosowe Voiced lub Whispered, a następnie naciśnij ▶ Synthesize Sound lub ■ Stop.

💡 Czy wiesz, że?

Zaledwie dwie częstotliwości formantów, F1 i F2, wystarczą, by rozróżnić niemal każdą samogłoskę mowy ludzkiej — dlatego wykres samogłosek pokazuje je wyłącznie na siatce F1-względem-F2, tym samym układzie, którego lingwiści używają dla czworokąta samogłosek IPA.

Najczęściej zadawane pytania

Czym dokładnie są formanty F1, F2 i F3?

To szczyty rezonansowej częstotliwości tworzone przez kształt traktu głosowego działającego jak rura o zmiennym przekroju — F1 wiąże się głównie z wysokością języka (otwarciem szczęki), F2 z pozycją języka przód/tył, a F3 dodaje subtelniejszy szczegół barwy, który odróżnia podobne samogłoski.

Dlaczego /i/ ma tak niskie F1, ale bardzo wysokie F2 w porównaniu z /a/?

/i/ (jak w „see”) jest wytwarzane z niemal zamkniętą szczęką i językiem wysuniętym do przodu i wysoko, co tłumi F1 (niskie otwarcie szczęki), jednocześnie gwałtownie podnosząc F2; /a/ (jak w „father”) robi odwrotnie — otwarta szczęka i nisko ułożony język podnoszą F1 i obniżają F2.

Jaka jest różnica między opcjami źródła głosowego Voiced i Whispered?

Źródło Voiced symuluje fałdy głosowe drgające okresowo z częstotliwością Pitch F0, wytwarzając brzęczące źródło harmoniczne, które trakt następnie filtruje w rozpoznawalną barwę samogłoski; źródło Whispered zastępuje ten okresowy brzęk szumem szerokopasmowym, dlatego szeptane samogłoski brzmią chropowato, ale znacznie mniej muzycznie.

Jak suwak Tract Length zmienia dźwięk?

Długość traktu głosowego odwrotnie ustala częstotliwości rezonansowe całego układu — krótszy trakt (jak u dziecka) przesuwa wszystkie formanty wyżej, a dłuższy trakt (typowy dla dorosłych mężczyzn) przesuwa je niżej, co częściowo tłumaczy, dlaczego głosy osób w różnym wieku i płci brzmią inaczej nawet przy tej „samej” samogłosce.

Dlaczego zmiana Pitch F0 nie zmienia słyszanej samogłoski?

Pitch F0 to częstotliwość drgań fałdów głosowych — określa podstawową nutę muzyczną głosu — podczas gdy tożsamość samogłoski wynika z częstotliwości formantów kształtowanych przez trakt. Te dwa parametry są w dużej mierze niezależne, dlatego można wymówić tę samą samogłoskę przy dowolnej wysokości dźwięku.

Podobne symulacje