Strona głównaArtykułyData Science

Obrobka dźwięku i przetwarzanie audio

Analiza i przetwarzanie sygnałów dźwiękowych przy użyciu ML

mysimulator teamZaktualizowano — czerwiec 2026≈ 3 min czytania▶ Otwórz symulację

🎓 Wyodrębnianie cech

MFCC

Koncept: Czynnik czepstralny częstotliwości mel. Podobny do percepncji człowieka.

Wady: Efektywne dla mowy, kompaktna reprezentacja.

Zastosowania: Recoznycja mowy, identyfikacja mówcy.

Spektrogram

Koncept: Przedstawienie czasowo-częstotliwościowe. STFT (Transformata Fouriera krótkiego okna).

Wady: Wizualne, dobrze nadają się do CNN.

Zastosowania: Klasyfikacja dźwięku, analiza muzyki.

Czterestrydyce

Koncept: Noty muzyczne (12 tonów).

Zastosowania: Analiza muzyki, wykrywanie akordów.

demo na żywo · powiązana symulacja● LIVE

/audio Processing Tasks

Znajdowanie się w mowie

Zadanie: Konwersja mowy na tekst (ASR).

Modely: Wav2Vec, Whisper, DeepSpeech, oparte na transformatorach.

Zastosowania: Asystent głosowy, transkrypcja.

Klasyfikacja dźwięku

Zadanie: Klasyczne klasyfikowanie dźwięku (gatunki muzyki, zdarzenia dźwiękowe, języki).

Modely: CNN na spektrogramach, oparte na transformatorach.

Zastosowania: detekcja gatunków muzyki, wykrywanie zdarzeń dźwiękowych.

Znajdowanie się w mówcy

Zadanie: Znalezienie się w mówcy (identyfikacja, walidacja).

Modely: uczenie głębokie dla wstawek.

Zastosowania: bezpieczeństwo, autoryzacja.

📚 Praktyczne przykłady

Przykład 1: Zrozumienie mowy za pomocą Whisper

Przygotowanie: Przygotuj pliki dźwiękowe.

Whisper: Wykorzystaj zaprezentowany model pre-wyznaczony Whisper.

Transkrypcja: Otrzymaj tekst z mowy.

Ewaluacja: Sprawdź WER na zestawie testowym.

Przykład 2: Klasyfikacja dźwięków za pomocą CNN

Cechy: Stwórz spektrogramy z dźwięków.

CNN: Trening CNN na spektrogramach.

Spróbuj na żywo

Wszystko powyżej działa w Twoim przeglądarce — otwórz Sieć przetwarzania spektrogramu dźwięku i zmieniaj parametry podczas jego działania. Nic nie należy zainstalować, nic nie wysłać, całe modelowanie mieści się w jednym oknie.

Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Audio Spectrogram Processing Grid i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację Audio Spectrogram Processing Grid

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)