Strona główna▸Artykuły▸Data Science

Uczenie Głębokie: Architektury Sieci Nervowych i Techniki Treningowe

Pełny przewodnik przez uczenie głębokie: sieci przepływnych, CNN, RNN, Transformer, mechanizmy uwagi, regularyzacja, optymalizacja i nowoczesne techniki treningowe.

mysimulator teamZaktualizowano — czerwiec 2026≈ 3 min czytania▶ Otwórz symulację

1. Sieci neuronowe przeprowadzające feedforward

Sieci neuronowe wielopoziomowe (MLP) składają się z warstw wejściowych, ukrytych i wyjściowych. Każdy neurony oblicza: z = Wx + b, a = σ(z). Funkcje aktywacji: ReLU max(0,x) ( najczęstsze), Leaky ReLU, GELU (używane w Transformerach), SiLU/Swish, Softmax (warstwa wyjściowa dla klasfikacji). Twierdzenie o uniwersalnej aproksymacji: jedna warstwa ukryta może przybliżać dowolną funkcję ciągłą (dane są odpowiednie szerokości). Trening poprzez backpropagację: zasada łańcuchowa oblicza ∂L/∂w poprzez graf obliczeniowy. Normalizacja po warstwie: normalizuje wejścia warstwy, przyspieszając trening. Normalizacja warstwowa: preferowana w Transformerach. Dropout: losowo zeruje neurony podczas treningu (p=0.1–0.5) do regularizacji.

2. Sieci neuronowe konwolucyjne

CNNs wykorzystują hierarchię przestrzenną poprzez pola odbiorcze lokalne i współdzielone wagi. Konwolucja: output[i,j] = Σ kernel[m,n] · input[i+m, j+n]. Typowa architektura: Conv → BN → ReLU → Pool, powtarzana wielokrotnie. Pooling: maksymalny pooling (najczęstszy), średnio wartościowy pooling, globalny średni pooling. Kluczowe architektury: LeNet-5 (1998), AlexNet (2012, 60M parametrów), VGG-16 (138M), GoogLeNet/Inception (6.8M, konwolucje 1×1), ResNet (skokowe połączenia, 152 warstw), DenseNet (ciemne połączenia), EfficientNet (mieszane skalowanie). Współczesne: ConvNeXt zgodny z ViT poprzez czyste konwolucje. Wykrycie obiektów: YOLO (real-time), Faster R-CNN (dwustopniowy). Segmentacja semantyczna: U-Net (encoder-decoder z skokowymi połączeniami).

demo na żywo · powiązana symulacja● LIVE

3. Sieci rekurencyjne i modele sekwencyjne

Sieci rekurencyjne przetwarzają dane sekwencyjne: h_t = σ(W_hh h_{t-1} + W_xh x_t + b). Problem znikania gradientu ogranicza ich zdolność do obsługiwania długoterminowych zależności. LSTM (Hochreiter & Schmidhuber, 1997): drzwi zapomnienia, drzwi wejściowe, drzwi wyjściowe, stan komórki — zapisuje zależności nad 100+ kroków czasowych. GRU: uproszczone LSTM z dwiema drzwiami (aktualizacja, reset), osiągające porównywalne wyniki. Sieci rekurencyjne bidirectionalne: przetwarzają sekwencje zarówno w przód, jak i w tył. Kodery-dekodery z uwzględnieniem uwagi: uwaga Bahdanau (2014) przypisuje wagę pozycjom źródłowym. Zastosowania Seq2seq: tłumaczenie maszynowe, podsumowywanie tekstu, rozpoznawanie mowy. W większości zadań NLP zastąpiły je transformery, ale nadal są istotne dla aplikacji streamingowych/online.

4. Transformery & Uwaga

Architektura transformera (Vaswani et al., 2017, „Attention Is All You Need“). Samouwaga: Attention(Q,K,V) = softmax(QKᵀ/√d_k)V. Wielokanaenna uwaga: równoległa uwaga z różnymi nauczonymi projekcjami. Kodeks pozycyjny: sinusoidalny lub nauczona wstawka. Tylko kodownik: BERT (bidirectional, 340M parametrów, MLM + NSP przygotowanie). Tylko koder: seria GPT (autoregressive, GPT-4 szacowane 1,8T parametrów). Kodownik-koder: T5, BART. Transformery wizualne (ViT): pakiety obrazu jako tokeny, 16×16 pakiety. Zasady skalowania: L ∝ N^{-0,076} (strata vs parametry). Flash Uwaga: uwaga z świadomej pamięci wejściowej, 2-4 razy szybsza. Mieszanka ekspertów (MoE): Mixtral 8×7B, rzadka aktywacja.

5. Trening na skalę

Optymalizacja: najczęściej używany Adam (β₁=0.9, β₂=0.999) i AdamW (oddzielone decay wagi). Harmonogramy learning rate: ciepłodawka + zanurzanie kosinusowe. Przycięcie gradientów: zapobiega eksplodującym gradientom (norma maksimum 1.0). Wysokiej precyzji mieszana: obliczenia w FP16/BF16 z wagami głównymi w FP32 — przyspieszenie o czynnik 2, zmniejszenie pamięci o 50%. Trening dystrybucyjny: równoległość danych (DDP), równoległość modelu (pipeline, tensor), etapy optymalizatora ZeRO (DeepSpeed). sprzęt: NVIDIA H100 (989 TFLOPS FP16), Google TPU v5p. Koszt treningu: GPT-4 szacowany na około 100 milionów dolarów, Llama 3 405B: 30.8 miliona godzin GPU na H100. Techniki: akumulacja gradientów, przeszczepianie gradientów (trading obliczeń za pamięć), dyliżancja.

Spróbuj to na żywo

Wszystko powyżej działa w twoim przeglądarce — otwórz Dimensionality Reduction: PCA, t-SNE & UMAP i zmieniaj parametry podczas jego działania. Nic nie instalujesz, nic nie przesyłasz, cała modelizacja mieści się w jednym oknie.

▶ Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Dimensionality Reduction: PCA, t-SNE & UMAP i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację Dimensionality Reduction: PCA, t-SNE & UMAP

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)