Momentowy zadanie wizyjne, wykonane na skalę
Każdy raz, gdy system asystencyjny samochodowy czyta znak prędkości i dostosowuje zaleconą prędkość jazdy, lub kiedy pojazd badawczy odtwarza zrównoważoną prędkość podczas zbliżania się do skrzyżowania, komputerowe modely wzroku wykonują coś, czego ludzie biorą za granted: szybkie spojrzenie na mały, często częściowo ukryty, czasem uszkodzony znak i natychmiastowe zrozumienie jego znaczenia. W Wielkiej Brytanii ta zadanie ma własny regulacyjny tło — znaki drogowe są zarządzane przez Ustawę o znakach drogowych i ogólne kierunki (TSRGD), która ustala kształty i kolory, które mają prawny sens: trójkąty z czerwonym obramowaniem dla ostrzeżeń, okręgi z czerwonym obramowaniem dla zabrania, okręgi niebieskie dla obowiązujących instrukcji, a prostokątne znaki dla ogólnej informacji. Ta struktura jest na faktycznie pomocna dla modelu, ponieważ kształty i kolory sam w sobie ograniczają, jakie rodzaj znaku model szuka przed nawet czytaniem konkretnego symbolu lub liczby wewnątrz.
Dlaczego zestaw referencyjny europejski stanowi racjonalne miejsce do rozpoczęcia
Z powodu tego, że Wielka Brytania, podobnie jak większość Europy, ścisłe jest zgodna z Konwencją Wiedniowską na Temat Znaków Drogowych i Sygnałów, zestawy referencyjne stworzone dla innych krajów europejskich — a zwłaszcza zestaw referencyjny niemieckiego rozpoznawania znaków drogowych (GTSRB), zawierającego ponad 50 tysięcy obrazów z 43 klas znaków, zdobytych pod różnymi warunkami oświetlenia, pogody i kątów widzenia — stanowią prawdziwy użyteczny proxy do budowania i testowania podstawowej linii rozpoznawczej, nawet jeśli system produkcyjny przeznaczony specjalnie dla drog brytyjskich w końcu potrzebuje dostosowania na znaki specyficzne dla Wielkiej Brytanii, aby zwrócić uwagę na różnice w exact designach znaków i dowolnych znakach unikatowych dla Wielkiej Brytanii.
Wybieranie architektury zaprojektowanej na szybkość, nie tylko dokładność
Znajdowanie znaków drogowych ma ograniczenie, którego inne zadania wizji komputerowej nie dzielą tak aktywnie: musi działać w czasie rzeczywistym, idealnie powyżej 30 klatek na sekundę, na sprzęcie wbudowanym w poruszający się pojazd zamiast GPU centrum danych. To dlatego architektury lekkie, takie jak MobileNetV2, są tak ważne w tym kontekście. Jego kluczowa technika polega na konwolucji separowalnej po głębokości, która dzieli standardową konwolucję na dwie znacznie tańsze etapy — jeden filtrujący każdy kanał wejściowy niezależnie, a drugi łączący wyniki za pomocą małej liczby konvolucji 1x1 — co znacznie zmniejsza liczbę obliczeń i parametrów w porównaniu do standardowej warstwy konwolucyjnej o podobnej mocy reprezentacyjnej. Wsparte to blokami odwrotnymi, które utrzymują mały obciążenie pamięciowe sieci, MobileNetV2 (oraz podobne efektywne architektury) naturalnie pasuje do zastosowań na krawędzi, takich jak NVIDIA Jetson lub nawet Raspberry Pi, gdzie cięższa sieć, np. VGG16 lub pełna ResNet, byłaby po prostu za wolna lub zużywałaby za dużo energii.
Specyficzne sposoby, w których model rozpoznawania znaków może zacząć się błądzić
Nie każda niepoprawna klasa jest równie poważna. Zmieszanie znaku ograniczenia prędkości 30 mph z 50 mph jest groźnym błędem materialnie, w przeciwieństwie do zmieszania dwóch podobnych ostrzeżeń, więc ocena dla tej zadania przekracza pojedynczy ogólne miarę dokładności i obejmuje celowe sprawdzenia: jak często znak zatrzymki jest zmieszany z innym znakiem, ile razy różne ograniczenia prędkości są zamieniane miejscami, a — ponieważ niektóre znaki są kierunkowe, takie jak strzałki lub wskazówka jednostronne — jak dobrze model zachowuje się w odniesieniu do rozróżniania lewo/prawo i kierunku. Ten ostatni punkt jest też przyczyną tego, dlaczego obrót poziomy, standardowy technikę uzupełniającą dla wielu innych zadań obrazowych, jest świadomie unikany podczas treningu na znakach drogowych: obracanie strzałki skrętu w lewo poziomo przekształca ją w strzałę skrętu w prawo, co uczy modelu nieprawidłowej asocjacji, gdy etykieta nie jest obracana razem z obrazem, a nawet ostrożne obracanie etykiet w kodzie wprowadza własne ryzyko błędów do ochrony przed nimi.
Od dokładności na zestawie referencyjnym do rzeczywistej wdrożenia
Model osiągający dokładność 95% i powyżej oraz szybkość inferencji prawie natychmiastową na zestawie referencyjnym jest silnym wynikiem, ale nadal to jedno kroku oddalone od czegoś gotowego do użycia na drogach Wielkiej Brytanii. Rzeczywiste wdrożenie wymaga rozwiązywania detekcji obiektów oraz klasyfikacji — najpierw znalezienia, gdzie właściwie w ramce filmu znajduje się znak, ponieważ rzeczywiste nagrania niemal nigdy nie przedstawiają znaku spokojnie obramowanego i centralnie ułożonego tak jak obrazy z zestawu referencyjnego — oraz robustności do brytyjskich specyficznych warunków, takich jak ciągłe deszcze, słabe światło podczas zimowego dnia, a także konkretną kombinację pogodową brytyjską, która obejmuje uszkodzone lub zablokowane znaki drogowe. Spółki pracujące nad samodzielnym sterowaniem i zaawansowanym asystentem do jazdy w Wielkiej Brytanii — od estabilizowanych uczestników rynku do nowych start-upów zautomatyzowanych pojazdów, oraz publiczne organy takie jak Centrum dla połączonego i samodzielnego sterowania — traktują te rodzaje testów robustności na rzeczywistych przypadkach brzegowych jako jedno z najtrudniejszych i najważniejszych dla bezpieczeństwa części całego problemu samodzielnej jazdy — znacznie trudniejszego niż osiągnięcie wysokiej dokładności na czystym, skorelowanym zestawie referencyjnym.
Często zadawane pytania
Czym jest zestaw danych GTSRB i dlaczego używa się zbiornika niemieckiego dla projektu w Wielkiej Brytanii?
Zestaw German Traffic Sign Recognition Benchmark to duży, dobrze założony publiczny zbiór danych liczący około 50 000 etykietowanych obrazów znaków drogowych poziomu klasyfikacji 43. Ponieważ znaki drogowe w Wielkiej Brytanii i Niemczech ogólnie obojętnie na Konwencji Wiedeńskiej dotyczącej znaków drogowych, to jest praktycznym punktem wyjścia do prototypowania, choć rzeczywista implementacja w Wielkiej Brytanii wymagałaby dostosowania pod kątem znaków specyficznych dla kraju.
Dlaczego użyto modelu ciężkożarzącego MobileNetV2 zamiast większej sieci?
Bo model musi działać w czasie rzeczywistym na sprzęcie umieszczonej w poruszającym się pojazdzie, co wymaga skrajnych ograniczeń w zakresie mocy i opóźnień. Profundyczne separowane convolucje MobileNetV2 znacznie zredukują obliczeniową ilość porównującą się z convoliucjami standardowymi, zastępując mały utratę dokładności dużym zwinięciem w prędkości i efektywności.
Dlaczego tutaj unikano odwracania poziomo jako techniki przyspieszającej zbior cze danych?
Bo może niewyraźnie zmieniać znaczenie znaków kierunkowych, na przykład konwertując strzałkę w lewo na strzałkę w prawo, co uczy modelu nieprawidłowej asocjacji — chyba że etykietki byłyby bardzo dokładnie odwrócone, aby dopasować — ryzyko, które zazwyczaj jest uważane za niewartość przyjmowania pod uwagę innych przyspieszających zbiorów danych, które osiągają podobne korzyści dla ogólnej generalizacji.
Czym jest TSRGD?
Zakładanie transportowe i ogólnych kierunków to regulamin Wielkiej Brytanii, który definiuje które znaki drogowe są prawomocne i co ich kształty, kolory i symbole znaczą, tworząc podstawę regulacyjną, na której opiera się projekt i użycie znaków drogowych w Wielkiej Brytanii.
▶ Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz How Computer Vision Learns to Recognise Road Signs i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.