Strona główna▸Artykuły▸Sieci neuronowe konwolucyjne

Znajdowanie znaków drogowych w Wielkiej Brytanii za pomocą CNN: od niestandardowej architektury do MobileNetV2

Jak sieci neuronowe konwolucyjne klasyczne rozpoznawają znaki drogowe dla systemów asystencji jazdy i pojazdów oświetlonych, porównując niestandardową CNN z uczeniem przenośnym przy użyciu MobileNetV2 na zbiorze danych ze 140 klas znaków drogowych.

mysimulator teamZaktualizowano — czerwiec 2026≈ 5 min czytania▶ Otwórz symulację

Dlaczego rozpoznawanie znaków drogowych ma znaczenie dla pomocy w jazdzie

Rozpoznawanie automatyczne znaków drogowych stanowi centrum systemów asystencji w jazdzie zaawansowanej (ADAS) i pojazdów samodzielnych — pojazd, który nie jest w stanie zgodnie czytać znaku ograniczenia prędkości ani znaku daje-passage, nie powinien decydować o tym, kiedy przyspieszyć albo zwolnić. Znaki drogowe w Wielkiej Brytanii są zdefiniowane przez Przepisy i ogólne dyrektywy dotyczące znaków drogowych (TSRGD), które ogólnie podzielone są na ostrzeżenia (trójkątne, czerwony obręcz), regulacyjne/zabraniające znaki (okrągłe, czerwona obręcz), obowiązkowe znaki (okrągłe, niebieska obręcz) i priorytetowe znaki — kategorie te, podobnie jak w większości Europy, przystosowane są do Konwencji Wiedeńskiej na temat znaków drogowych.

Zdjęcia etykietowane z specyficznymi dla Wielkiej Brytanii znakami są rzadko dostępne, dlatego projekty tego typu zwykle trenują na zestawie danych German Traffic Sign Recognition Benchmark (GTSRB) — 43 klasy znaków i około 50 000 obrazów. Ponieważ projektory designów znaków w Europie są podobne pod kątem tej samej konwencji, GTSRB może służyć jako dobre proxy zestaw danych, z dodatkowym dostosowywanie dla Wielkiej Brytanii, gdy dostępne stają się rzeczywiste obrazy z tego kraju.

Przetwarzanie obrazów do małego i zgodnego wejścia

Każdy obraz jest zmniejszony do skompaktowanego rozmiaru 48×48 pikseli (dostatecznie mały, aby umożliwić szybkie wnioskowanie, ale wystarczająco duży, aby zachować kształty i cyfry, które oddzielają jedne znaki drogowe od innych). Wartości pikseli są normalizowane do zakresu [0,1]. Dodatkowy krok przetwarzania obrazów zastosowuje CLAHE (Contrast Limited Adaptive Histogram Equalisation) do kanału jasności po konwersji na przestrzeń barw LAB — to zwiększa lokalną kontrastowość, co sprawia, że znak fotografowany w płaskim i chmurnym świetle jest równie czytelny dla modelu jak ten fotografowany pod słońcem. Ponieważ klasy znaków drogowych są naturalnie niezbalansowane (np. ogólne ograniczenia prędkości pojawiają się znacznie częściej na rzeczywistych drógach niż rzadkie ostrzeżenia), obliczona jest class_weight='balanced' i przekazana do treningu, co prowadzi do tego, że funkcja straty kary bardziej zaangażuje błędy dla rzadszych klasy, zapobiegając modelowi naukowemu nauczeniu się zawsze przewidywania najbardziej popularnego znaku drogowego.

Zwiększanie danych z krytycznym wyjątkiem

Aby pomóc modelowi generalizować poza dokładne kąty kamery i warunki w zestawie treningowym, obrazy są losowo obracane (±15°), przesuwane, skręcone, zoomowane i dostosowywane do jasności podczas treningu. Jedna standardowa metoda zwiększania danych jest świadomie wyłączona: odwracanie poziomie. Odwracanie znaku drogowego — strzałki w lewo lub polecenia zachowania się na prawo — powoduje fizycznie niemyslny lub aktywnie błądowy etykiet, ponieważ obraz odbity już nie reprezentuje rzeczywistego znaku, który kierowca mógłby spotkać. Jest to dobry ogólne nauczanie dla projektów wizji komputerowej: wyborz zwiększania danych muszą przestrzegać semantyki określonej dziedziny, a nie być skopiowane z genericznego pipeline klasyfikacji obrazów.

Dwie architektury: niestandardowy CNN i MobileNetV2

Projekt buduje i porównuje dwie rodziny modeli. Pierwsza to niestandardowy CNN z czterema blokami konwolucyjnymi o rosnącej głębokości (32 → 64 → 128 → 256 filtrów), każdy zastępujący batch normalizację, aktywację ReLU, maksymalną wycieczkę i dropout przed małym klasyfikatorem gęstym. Druga używa MobileNetV2 poprzez nauczenie przeniesione: sieci przetrainowanej na ImageNet, z zamarzniętymi początkowymi warstwami i tylko ostatnimi 30 warstwami oraz nowym klasyfikatorem gęstym dostosowanym do znaków drogowych.

MobileNetV2 jest wybrany specjalnie ze względu na swoje konwolucje separowane w głęboką i bloki odwrotnie residualne, które sprawiają, że ma ono ułamek parametrów konwolucyjnego CNN typowego o podobnej głębokości — kluczowe dla modelu, który musi działać w czasie rzeczywistym (cel: powyżej 30 klatek na sekundę) na małych, wbudowanych systemach samochodowych zamiast GPU centrum danych. Obie modele są treningowe za pomocą optimizatora Adam, straty krzyżowej kategorii, oraz callbacków do zatrzymania wczesnego, zapisywania najlepszych wag i zmniejszania optymalizacji uczącej przy stabilizacji straty walidacyjnej.

Obie modele są treningowe za pomocą optimizatora Adam, straty krzyżowej kategorii, oraz callbacków do zatrzymania wczesnego, zapisywania najlepszych wag i zmniejszania optymalizacji uczącej przy stabilizacji straty walidacyjnej.

Evaluacja: jedynie dokładność nie wystarcza dla systemu bezpieczeństwa

Poza ogólnej dokładności, model oceniany jest na podstawie dokładności top-3 i top-5 (czy poprawny znak jest wśród kilku najlepszych propozycji modelu, co jest przydatnym kontekstem dla systemu, który może łączyć przewidywania CNN z innymi danymi czujnikowymi) oraz pełnej macierzy konfuzji 43×43, która ukazuje dokładnie, jakie pary znaków są najczęściej zamieszczane. Dla zastosowania krytycznego dla bezpieczeństwa, ważne jest nie tylko ile błędy wystąpiło, ale i jakie: zamieszczanie dwóch podobnych ostrzegawczych znaków to mniejsza problematyczność niż zamieszczanie znaku STOP jako innego znaku, lub niepoprawne odczytywanie limitu prędkości (30 km/h, 50 km/h, 80 km/h) w sposób, który mógłby prowadzić do niebezpiecznej zalecenia prędkości. W dowolnym rzeczywistym procesie wdrożenia_audit byłoby konieczne szczegółowo ocenianie macierzy konfuzji dla tych krytycznych pary znaków, a nie poleganie na jednej liczbie agregowanej dokładności.

Często zadawane pytania

Dlaczego trening na zestawie danych niemieckich (GTSRB) dla projektu rozpoznawania znaków drogowych w Wielkiej Brytanii?

Zdjęcia z etykietami, zebrane z drogi, i ukazujące znaki z Wielkiej Brytanii na skalę potrzebną dla uczenia głębokiego są rzadko dostępne, podczas gdy GTSRB oferuje około 50 000 dobrze etykietowanych obrazów poziomu 43. Ponieważ znaki drogowe w Wielkiej Brytanii i Niemczech obywatelskiego porządku są podległe Konwencji Wiedeńskiej na temat znaków drogowych i mają podobne kształty, kolory i konwencje układu, GTSRB służy jako silny proxy do treningu wstępnych, z akceptowalnymi obrazami z Wielkiej Brytanii używanymi do dostosowywania pośredniego.

Dlaczego deaktywowano augmentację odzwrotnego obracania dla rozpoznawania znaków drogowych?

Wiele znaków drogowych ma kierunkowość — obrót pionowej strzałki na lewo do poziomego staje się strzałka na prawo, a znak zachowuj się w prawym kierunku odzwrotnie staje się zachowuj się w lewym. Trening na odwróconych wersjach tych znaków uczy modelu nieprawidłowych powiązań między kształtem a znaczeniem, ponieważ obraz odbity już nie odpowiada żadnemu znaku, który kierowca mógłby spotkać na drodze.

Dlaczego używać MobileNetV2 zamiast większej i bardziej dokładnej CNN dla tej zadania?

System asystujący w jazdzie musi klasyfikować znaki w czasie rzeczywistym z pojazdu ruchomego, często na zaawansowanej sprzęcie o ograniczonych obliczeniowych i energetycznych budżetach. Mobilne sieci neuronowe typu MobileNetV2 z kompresją separowanych konvolucji głębokich znacząco zmniejszają liczbę parametrów oraz opóźnienie inferencyjne w porównaniu do konwencjonalnej CNN o podobnej głębokości, co sprawia, że są znacznie bardziej odpowiednie do zastosowań w czasie rzeczywistym i w pojazdach, nawet jeśli większa sieć mogłaby uzyskać lepszą dokładność w laboratorium.

Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz UK Traffic Sign Recognition: CNN vs MobileNetV2 i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację UK Traffic Sign Recognition: CNN vs MobileNetV2

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)