ГоловнаСтаттіComputer Science

Адверсаріальні атаки

Уразливості та захист AI

mysimulator teamОновлено — липень 2026≈ 3 хв читання▶ Відкрити симуляцію

🔬 Типи атак

White-box атаки

Повний доступ до моделі (архітектура, ваги). FGSM, PGD використовують градієнти. Сильніші за black-box, але потребують доступу. Дослідження, тестування.

Black-box атаки

Без доступу до моделі, тільки queries. Transfer attacks (з іншої моделі), query-based attacks. Більш реалістичні для реальних систем.

Targeted vs Untargeted

Targeted: конкретний неправильний клас. Untargeted: будь-який неправильний клас. Targeted складніші, але небезпечніші. Обидва важливі для захисту.

жива демонстрація · пов'язана симуляція● LIVE

🎯 Методи атак

FGSM

Fast Gradient Sign Method: однокрокова атака через sign градієнта. Швидка, проста. Базовий метод. Використовується для швидкого тестування.

PGD

Projected Gradient Descent: ітеративна атака з проекцією на допустиму область. Сильніша за FGSM. Стандартний для тестування стійкості.

Transfer Attacks

Атаки з однієї моделі переносяться на іншу. Black-box підхід. Показує, що атаки узагальнюються між моделями. Небезпека для production систем.

💻 Захист

Adversarial Training

Навчання на adversarial examples для покращення стійкості. Додає атаковані приклади до тренувального набору. Популярний метод, але не повністю захищає.

Detection

Виявлення adversarial examples перед класифікацією. Статистичні методи, детектори. Можливість відхилення підозрілих вхідних даних.

Certified Defenses

Математичні гарантії стійкості до атак. Формальна верифікація. Складність для deep learning, активні дослідження. Найнадійніший захист.

Спробуйте наживо

Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.

▶ Відкрити симуляцію Hash Function Avalanche Visualizer

Що ви знайшли?

Додати кроки відтворення (опційно)