Problem z wąskim gardłem
Tradycyjne sieci rekurente (RNN) takie jak LSTM i GRU miały trudności z długimi sekwencjami ze względu na ‘problem z wąskim gardłem’. Cała sekwencja wejściowa była komprimowana do wektora kontekstu o stałej wielkości, co nieuchronnie prowadziło do utraty informacji o wcześniejszych fragmentach sekwencji.
Wprowadzenie do Uwagi: Ważone Konteksty
Mechanizmy uwagi rozwiązują to poprzez umożliwienie modelowi bezpośredniego dostępu do wszystkich poprzednich stanów ukrytych podczas przetwarzania nowego wejścia. Zamiast pojedynczego wektora kontekstu, uwaga przypisuje wagi dla każdej części sekwencji wejściowej na podstawie jej istotności.
α(i) = softmax(q(i); h_1, ..., h_T)
Samowariantowanie: Wewnętrzne Relacje Sekwencji
Samowariantowanie, popularne dzięki architekturze Transformer, oblicza wagi uwagi wewnątrz pojedynczej sekwencji. Każdy element zwraca uwagę na wszystkie inne elementy tej samej sekwencji, ucząc się wewnętrznych zależności i relacji.
Attention(Q, K, V) = softmax((QK^T)/sqrt(d_k))V
Mechanizmy Przechodzeniowe: Łączenie Sekwencji
Mechanizmy przechodzeniowe rozszerzają samouważenie (self-attention) na wiele sekwencji. Na przykład, w tłumaczeniu maszynowym, jedna sekwencja (kodownik) zwraca uwagę na drugą (dekodownik), umożliwiając dekodownikowi skupienie się na istotnych fragmentach zdania źródłowego.
Często zadawane pytania
Co to są ‘zapytanie’, ‘klucz’ i ‘wartość’ w mechanizmie uwagi (attention)?
Są to nabyte projekcje sekwencji wejściowej. Zapytanie reprezentuje, czego szukasz, klucz reprezentuje to, co jest dostępne, a wartość zawiera rzeczywiste informacje.
Dlaczego stosuje się funkcję softmax w mechanizmie uwagi?
Softmax przekształca wyniki oceny uwagi na prawdopodobieństwa, zapewniając ich sumę równą 1 i reprezentując dystrybucję nad sekwencją wejściową.
Jakie są rzeczywiste zastosowania mechanizmów uwagi?
Mechanizmy uwagi są szeroko wykorzystywane w tłumaczeniu maszynowym, generowaniu opisów obrazów, rozpoznawaniu mowy oraz w wielu innych obszarach, gdzie przetwarzanie danych sekwencyjnych jest kluczowe.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz SPH Fluid i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację SPH Fluid