Як багато інформації ви отримуєте, знаючи X?
Взаємна інформація I(X;Y) відповідає на точну версію питання, яке люди задають неформально: наскільки спостереження одного випадкового значення зменшує вашу невизначеність щодо іншого? Вона будується безпосередньо на основі Шеннонівської ентропії та має гарно симетричне визначення — ви можете обчислити її трьома повністю різними способами і завжди отримати одне й те саме число, що є доказом того, що концепція захоплює щось реальне, а не артефакт розрахунку.
I(X;Y) = H(X) - H(X|Y) // uncertainty in X, minus what's left once you know Y
= H(Y) - H(Y|X) // symmetric — same value, computed the other direction
= H(X) + H(Y) - H(X,Y) // via the joint entropy of the pair together
// all three formulas give the SAME number: I(X;Y) = I(Y;X), always
Загальна ентропія
Найчистіший інтуїтивний образ – це діаграма Вейна двох перехресних кіл, одне для H(X) та одне для H(Y). Загальна площа, яку покриває їх об’єднання, є спільною ентропією H(X,Y) — невизначеність пари, розглянутої разом. Частина кола X, що не вкрита колом Y, є умовною ентропією H(X|Y) — те, що залишається невидим про X навіть після повного знання Y. А перетин обох кіл дорівнює точно взаємній інформації I(X;Y) — невизначеності щодо X, яка зникає при спостереженні Y, яка, за симметричним визначенням вище, ідентична невизначеності щодо Y, що зникає при спостереженні X.
|-------- H(X) --------|
| |
| H(X|Y) | I(X;Y) | H(Y|X) |
| | | |
|-------- H(Y) --------|
H(X,Y) = H(X|Y) + I(X;Y) + H(Y|X) (the whole union, no double-counting)
Два екстреми, обчислюється вручну
Якщо X і Y повністю незалежні – знання одного нічого не говорить про інший – тоді за визначенням p(x,y) = p(x)p(y) для кожної пари, що змушує H(X,Y) = H(X) + H(Y), а підставляючи це у вищезазначену формулу отримуємо I(X;Y) = H(X) + H(Y) - H(X,Y) = 0. Комунікація між X і Y дорівнює нулю, що є одним зі стандартних формальних визначень статистичної незалежності.
Якщо Y є детермінованою, зворотньою функцією від X – скажімо, Y завжди точно дорівнює X, або завжди точно не дорівнює X для бінарної змінної – знання X повністю усуває невизначеність щодо Y, отже H(Y|X) = 0, а комунікація між X і Y згортається до свого максимального можливого значення для пари: I(X;Y) = H(Y) - H(Y|X) = H(Y). Для двох змінних з однаковим entropy H(X) = H(Y) = 1 біт (як дві ідеально корельовані чесні монети), це означає, що I(X;Y) = 1 повний біт – вся невизначеність однієї змінної пояснюється іншою.
Чому взаємна інформація ловить те, що проґав кореляційний коефіцієнт Пірсона
Коефіцієнт Пірсона, звичайний статистичний показник, виявляє лише лінійні зв’язки — він може бути рівним нулю між двома змінними, якщо вони ідеально та детерміновано пов’язані, але нелінійно. Класичним прикладом є Y = X^2, коли X симетрично розподілено навколо нуля: коефіцієнт обчислює 0 (лінійний компонент справді скасовується в симметричному діапазоні), але Y повністю визначається X з нульовою фактичною невизначеністю після знання X. Взаємна інформація не має цього «сліпого» місця, оскільки вона побудована на основі повної спільної ймовірності p(x,y), а не її лінійного проектування — I(X;Y) для того ж Y = X^2 стосунка дає сильний позитивний результат, правильно повідомляючи, що Y повністю передбачувана з X, але не лінійно.
KL дивергенція: одна й та ж техніка, але як відстань
Існує другий, еквівалентний спосіб визначення взаємної інформації, який розкриває її суть: відхилення Кульбака-Лейблера між фактичним спільною розподілом p(x,y) та гіпотетичним спільним розподілом, який би ви отримали, якби X і Y дійсно були незалежними, p(x)*p(y):
I(X;Y) = D_KL( p(x,y) || p(x)*p(y) ) = сума по x,y від p(x,y) * log2( p(x,y) / (p(x)*p(y)) ) // D_KL(P || Q) в цілому вимірює, наскільки різні розподіли P // відносно посилального розподілу Q, в бітах — завжди >= 0, і точно // дорівнює 0 лише тоді, коли P і Q ідентичні // отже, взаємна інформація буквально: "наскільки далеко фактичний спільний // розподіл від світу, де X і Y не впливають один на одного"
Оскільки KL дивергенція завжди невід’ємна та дорівнює 0 лише тоді, коли два розподіли однакові, це миттєво доводить, що взаємна інформація ніколи не може бути від’ємною — I(X;Y) >= 0 завжди, з точністю до рівності — факт, який не очевидний з визначення за допомогоюentropy-subtraction, але випливає безпосередньо з погляду на KL-дивергенцію.
I(X;Y) = D_KL( p(x,y) || p(x)*p(y) )
= sum over x,y of p(x,y) * log2( p(x,y) / (p(x)*p(y)) )
// D_KL(P || Q) in general measures how different distribution P is
// from a reference distribution Q, in bits — always >= 0, and exactly
// 0 only when P and Q are identical
// so mutual information is literally: "how far is the real joint
// distribution from the world where X and Y don't affect each other at all"
Де застосовується взаємна інформація
Взаємна інформація проявляється там, де питання «Наскільки пов’язані ці дві речі без припущення лінійного моделювання?» є ключовим», а саме у виборі ознак у машинному навчанні. Оцінка ознак за допомогою взаємної інформації ранжує потенційні вхідні ознаки залежно від їхньої взаємної інформації з міткою цілі, що дозволяє захопити нелінійні зв’язків, які не помітить фільтр на основі кореляції. Алгоритми дерев рішень (ID3, C4.5) визначають, яку ознаку розділити на кожному вузлі, вибираючи ту, яка має найбільший коефіцієнт інформації — що є взаємною інформацією між цією ознакою та міткою класу. У нейронауці та геномі взаємна інформація між стимулом і нейронним імпульсом або між рівнями експресії двох генів є стандартним інструментом, оскільки біологічні зв’язки зазвичай нелінійні, і коефіцієнт кореляції, що базується на лінійних моделях, систематично недооцінює ступінь взаємозв’язку між двома сигналами.
Часті запитання
Що означає, якщо взаємна інформація між двома змінними дорівнює рівно нулю?
Це означає, що дві змінні статистично незалежні – знання значення однієї не дає жодної інформації щодо іншої, в будь-якій формі, лінійній чи ні. Це один із стандартних формальних визначень незалежності, яке безпосередньо випливає з того, що сума спільних ентропій незалежних змінних завжди дорівнює сумі їхніх індивідуальних ентропій.
Чому дві змінні можуть мати нульову кореляцію, але високу взаємну інформацію?
Pearsonova кореляція вимірює лише лінійний зв'язок і може бути рівною нулю навіть для змінних, які ідеально пов’язані нелінійною функцією, наприклад, Y = X в квадраті в межах симетричного діапазону X. Взаємна інформація будується на основі повної спільних ймовірнісної функції розподілу, а не її лінійного проектування, тому вона правильно визначає, що Y повністю залежить від X, навіть якщо пряма лінія не відображає цю залежність.
Як взаємна інформація пов'язана з дивергенцією Кільда-Малеґа?
Взаємна інформація дорівнює точно дивергенції Кільда-Малеґа між справжньою спільною ймовірнісною функцією розподілу X і Y та гіпотетичною спільною ймовірнісною функцією розподілу, яку б отримали, якби X і Y були незалежними. Це переосмислення пояснює, чому взаємна інформація завжди невід’ємна – дивергенція Кільда-Малеґа ніколи не може бути від'ємною, і вона дорівнює нулю лише тоді, коли дві порівнювані функції розподілу є однаковими, тобто лише при справжній незалежності.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Mutual Information і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Mutual Information