🔬 Типи атак
White-box атаки
Повний доступ до моделі (архітектура, ваги). FGSM, PGD використовують градієнти. Сильніші за black-box, але потребують доступу. Дослідження, тестування.
Black-box атаки
Без доступу до моделі, тільки queries. Transfer attacks (з іншої моделі), query-based attacks. Більш реалістичні для реальних систем.
Targeted vs Untargeted
Targeted: конкретний неправильний клас. Untargeted: будь-який неправильний клас. Targeted складніші, але небезпечніші. Обидва важливі для захисту.
🎯 Методи атак
FGSM
Fast Gradient Sign Method: однокрокова атака через sign градієнта. Швидка, проста. Базовий метод. Використовується для швидкого тестування.
PGD
Projected Gradient Descent: ітеративна атака з проекцією на допустиму область. Сильніша за FGSM. Стандартний для тестування стійкості.
Transfer Attacks
Атаки з однієї моделі переносяться на іншу. Black-box підхід. Показує, що атаки узагальнюються між моделями. Небезпека для production систем.
💻 Захист
Adversarial Training
Навчання на adversarial examples для покращення стійкості. Додає атаковані приклади до тренувального набору. Популярний метод, але не повністю захищає.
Detection
Виявлення adversarial examples перед класифікацією. Статистичні методи, детектори. Можливість відхилення підозрілих вхідних даних.
Certified Defenses
Математичні гарантії стійкості до атак. Формальна верифікація. Складність для deep learning, активні дослідження. Найнадійніший захист.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Hash Function Avalanche Visualizer