Słuchanie oczami
Odtwórz dźwięk "ba" i pokaż wideo z ust wyraźnie artykułującym "ga", a większość słuchaczy zgłasza, że słyszą trzeci dźwięk – "da", który nie pasuje ani do ścieżki audio, ani do ścieżki wideo samodzielnie. Odkryto to przez Harry'ego McGurka i Johna MacDonalda w 1976 roku (początkowo przypadkowo, podczas dubbingu niezgodnych infant-directed speech dla niezwiązanego badania), a efekt McGurka jest jednym z najbardziej solidnych dowodów w psychologii, że percepcja mowy jest w naturalny sposób wieloźródłowa: mózg nie tylko słyszy fonemy, ale integruje dźwięk z widocznym ruchem artykulacyjnym i robi to automatycznie, nawet u osób, które dokładnie wiedzą, co się dzieje i starają się nie dać się nabrać.
Dlaczego fuzja ląduje na "da"
Konkretna, zfusowana percepcja nie jest przypadkowa. Samogłoski są częściowo zdefiniowane przez miejsce artykulacji – gdzie w ustach zachodzi zamykanie. /b/ to labialny (szwy się ze sobą łączą), /g/ to gardłowy (tył języka oparty o miękki podniebienie), a /d/ to dziągiewkowy (język oparty o krawędź górnych zębów) – akustycznie i wizualnie pomiędzy pozostałymi dwoma. Kiedy uszy raportują sygnał labialny, a oczy raportują sygnał gardłowy, prawdopodobne wnioskowanie mózgu przy połączeniu obu strumieni często ląduje na pośrednim miejscu dziągiewkowym, co prowadzi do klasycznego fuzji dźwięku /b/ + obrazu /g/ → postrzegania /d/. Inne parowania audio-wizualne produkują kombinacyjne reakcje zamiast fuzji (np. dźwięk /g/ + obraz /b/ jest często słyszany jako "bga"), co jest jednym z powodów, dla których badacze traktują efekt McGurka jako dowód na rzeczywistą integrację percepcyjną, a nie po prostu tego, że mózg wybiera kanał, w którym ufa bardziej.
Kombinacja wskazówek bayesowska
Współczesne ujęcie obliczeniowe traktuje percepcji mowy jako kombinację wskazówek bayesowską: mózg posiada hałaśliwe, niepewne oszacowania fonemu wypowiadanego z kanału słuchowego i oddzielnie z kanału wizualnego, a następnie łączy je wagi, przybliżone do wiarygodności każdego kanału – formalizacja zbliżona do ogólnego zasobu optymalnej multisensorycznej integracji udowodnionego w wielu domenach percepcyjnych (np. ocena wielkości i lokalizacji wizualno-dotykowej).
fused percept ∝ likelihood(audio | phoneme) × likelihood(video | phoneme)
× prior(phoneme)
when audio strongly implies /b/ and video strongly implies /g/,
neither channel dominates outright — the posterior often peaks at the
intermediate place of articulation, /d/, rather than at either input
Przetrwa wiedzę o sztuczki
W przeciwieństwie do wielu iluzji poznawczych, które osłabiają się po wyjaśnieniu, efekt McGurk utrzymuje się w dużym stopniu niezmierzony nawet wtedy, gdy słuchacz jest poinformowany dokładnie co się dzieje i aktywnie próbuje usłyszeć prawdziwą sylabę audio – to silne dowody na to, że fuzja mowy audiowizualna zachodzi na wczesnym, głównie automatycznym etapie przetwarzania percepcyjnego, a nie późniejszym, poddającym się poznawczemu wpływowi etapie świadomego osądu.
Zamknięcie oczu natychmiast to usuwa, ponieważ zależy całkowicie od obecności i uwagi skierowanej na wizualny input artykulacyjny.
Nie jest to uniwersalne i klinicznie informatywny aspekt.
Podatność na efekt McGurka zależy od języka, kultury i wieku (zazwyczaj jest słabsza u młodych dzieci oraz w niektórych populacjach języków tonalnych, a różni się między językami o różnych fonemach i różnym poziomie ekspozycji na native audiovisual speech). Jej siła stała się narzędziem badawczym: zmniejszona podatność na efekt McGurka jest badana jako marker zaburzonych integracji audiowizualnych w spektrum autyzmu, a efekt ten jest wykorzystywany szerzej do badania, jak i kiedy mózg rozwijający się zaczyna łączyć wskazówki słuchowe i wizualne mowy w jeden postrzeganie, ponieważ niemowlęta wykazują zmniejszoną fuzję w porównaniu z dorosłymi.
Często zadawane pytania
Co dokładnie jest iluzją efektu McGurka?
Jest to iluzja percepcji mowy, a nie słuchania lub widzenia w izolacji. Zmieszane syczące i wizualne sylaby (np. audio "ba" nadane na film z ustami wyraźnie mówiącymi "ga") łączą się w trzeci odbiór, zwykle "da", demonstrując, że mózg automatycznie integruje dźwięk i ruch warg, zamiast traktować je jako oddzielne kanały.
Czy można wytrenować się, aby przestać doświadczać efektu McGurka?
Nie niezawodnie. Fuzja utrzymuje się nawet u słuchaczy, którzy dokładnie wiedzą, która sylaba została wypowiedziana w audio i aktywnie próbują ją poprawnie zgłosić, co jest uważane za dowód, że integracja mowy audiowizualnej zachodzi wczesnie i automatycznie w przetwarzaniu percepcyjnym, a nie jako późna, poprawialna ocena.
Dlaczego niezgodne ba/ga zwykle jest postrzegane jako da konkretnie?
Spółgłoski różnią się miejscem artykulacji: /b/ jest produkowana przez usta (dwiema wargami), /g/ przez tylną część języka (niedźwiedzi) a /d/ przez język przy szczycie za zębami (zębaty) – akustycznie i wizualnie między pozostałymi dwoma. Kiedy uszy sugerują dwuwargowe, a oczy sugerują niedźwiedzie, najlepsza kombinowana ocena mózgu często ląduje w pośrednim miejscu artykulacji zębatym, produkując "da".
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz McGurk Effect i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację McGurk Effect