🎓 Wyodrębnianie cech
MFCC
Koncept: Czynnik czepstralny częstotliwości mel. Podobny do percepncji człowieka.
Wady: Efektywne dla mowy, kompaktna reprezentacja.
Zastosowania: Recoznycja mowy, identyfikacja mówcy.
Spektrogram
Koncept: Przedstawienie czasowo-częstotliwościowe. STFT (Transformata Fouriera krótkiego okna).
Wady: Wizualne, dobrze nadają się do CNN.
Zastosowania: Klasyfikacja dźwięku, analiza muzyki.
Czterestrydyce
Koncept: Noty muzyczne (12 tonów).
Zastosowania: Analiza muzyki, wykrywanie akordów.
/audio Processing Tasks
Znajdowanie się w mowie
Zadanie: Konwersja mowy na tekst (ASR).
Modely: Wav2Vec, Whisper, DeepSpeech, oparte na transformatorach.
Zastosowania: Asystent głosowy, transkrypcja.
Klasyfikacja dźwięku
Zadanie: Klasyczne klasyfikowanie dźwięku (gatunki muzyki, zdarzenia dźwiękowe, języki).
Modely: CNN na spektrogramach, oparte na transformatorach.
Zastosowania: detekcja gatunków muzyki, wykrywanie zdarzeń dźwiękowych.
Znajdowanie się w mówcy
Zadanie: Znalezienie się w mówcy (identyfikacja, walidacja).
Modely: uczenie głębokie dla wstawek.
Zastosowania: bezpieczeństwo, autoryzacja.
📚 Praktyczne przykłady
Przykład 1: Zrozumienie mowy za pomocą Whisper
Przygotowanie: Przygotuj pliki dźwiękowe.
Whisper: Wykorzystaj zaprezentowany model pre-wyznaczony Whisper.
Transkrypcja: Otrzymaj tekst z mowy.
Ewaluacja: Sprawdź WER na zestawie testowym.
Przykład 2: Klasyfikacja dźwięków za pomocą CNN
Cechy: Stwórz spektrogramy z dźwięków.
CNN: Trening CNN na spektrogramach.
Spróbuj na żywo
Wszystko powyżej działa w Twoim przeglądarce — otwórz Sieć przetwarzania spektrogramu dźwięku i zmieniaj parametry podczas jego działania. Nic nie należy zainstalować, nic nie wysłać, całe modelowanie mieści się w jednym oknie.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Audio Spectrogram Processing Grid i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Audio Spectrogram Processing Grid