📋 TL;DR - Основні моменти
AI безпека - захист машинного навчання та штучного інтелекту
Adversarial Examples - ворожі приклади для обману ML моделей
Model Poisoning - отруєння моделей під час навчання
Privacy-Preserving ML - машинне навчання з захистом приватності
AI етика - етичні аспекти штучного інтелекту
Bias та Fairness - упередження та справедливість в AI
Explainable AI - пояснюваний штучний інтелект
🤖 Що таке AI безпека?
Безпека штучного інтелекту (AI Security) — це комплекс заходів, технологій та політик, спрямованих на захист систем машинного навчання, нейронних мереж та штучного інтелекту від кіберзагроз, маніпуляцій та зловживань.
AI безпека включає захист від adversarial атак, забезпечення приватності даних, запобігання упередженості моделей, захист інтелектуальної власності та забезпечення етичного використання AI технологій.
⚔️ Adversarial Examples
Що таке Adversarial Examples?
Adversarial Examples — це спеціально створені вхідні дані, які виглядають нормально для людини, але призводять до неправильних передбачень машинного навчання. Ці атаки можуть бути дуже незначними (наприклад, зміна кількох пікселів у зображенні).
Типи Adversarial атак
1. White-box атаки
FGSM (Fast Gradient Sign Method) - швидкий метод градієнтного знаку
PGD (Projected Gradient Descent) - проективний градієнтний спуск
C&W Attack - атака Carlini & Wagner
DeepFool - глибокий обман
JSMA - атака Якобіана
2. Black-box атаки
Transfer Attacks - атаки переносу
Substitute Model Attacks - атаки на заміщуючі моделі
ZOO (Zeroth Order Optimization) - оптимізація нульового порядку
One-pixel Attack - атака одного пікселя
Boundary Attack - атака на межу
3. Physical атаки
Adversarial Patches - ворожі патчі
3D Adversarial Objects - 3D ворожі об'єкти
Lighting Attacks - атаки освітлення
Camera Attacks - атаки камери
Sticker Attacks - атаки наклейок
Методи захисту від Adversarial атак
1. Adversarial Training
Data Augmentation - розширення даних
Robust Training - стійке навчання
Ensemble Methods - ансамбльові методи
Certified Defenses - сертифіковані захисти
2. Detection Methods
Anomaly Detection - виявлення аномалій
Input Preprocessing - попередня обробка вхідних даних
Feature Squeezing - стиснення ознак
MagNet - магнітний детектор
3. Defensive Distillation
Knowledge Distillation - дистиляція знань
Temperature Scaling - масштабування температури
Soft Labels - м'які мітки
Robustness - стійкість
☠️ Model Poisoning
Що таке Model Poisoning?
Model Poisoning — це атака, при якій зловмисник вводить отруєні дані в процес навчання машинного навчання, щоб зламати або маніпулювати поведінкою моделі. Це може призвести до неправильних передбачень або навіть до backdoor атак.
Типи Model Poisoning
1. Data Poisoning
Label Flipping - перевертання міток
Feature Poisoning - отруєння ознак
Backdoor Attacks - атаки через бекдор
Clean Label Attacks - атаки з чистими мітками
2. Model Poisoning
Gradient Poisoning - отруєння градієнтів
Parameter Poisoning - отруєння параметрів
Update Poisoning - отруєння оновлень
Federated Learning Attacks - атаки на федеративне навчання
Backdoor атаки
Принцип роботи
Trigger Injection - введення тригера
Target Label - цільова мітка
Stealth - прихованість
Activation - активація
Типи тригерів
Pixel Triggers - піксельні тригери
Patch Triggers - патч-тригери
Noise Triggers - шумові тригери
Semantic Triggers - семантичні тригери
Методи захисту від Model Poisoning
1. Data Validation
Outlier Detection - виявлення викидів
Data Sanitization - санітаризація даних
Source Verification - верифікація джерела
Integrity Checking - перевірка цілісності
2. Robust Training
Differential Privacy - диференційна приватність
Byzantine-robust Aggregation - візантійсько-стійка агрегація
Anomaly Detection - виявлення аномалій
Model Verification - верифікація моделі
🔒 Privacy-Preserving Machine Learning
Диференційна приватність (Differential Privacy)
Основні принципи
ε-Differential Privacy - ε-диференційна приватність
Privacy Budget - бюджет приватності
Composition - композиція
Post-processing - пост-обробка
Механізми захисту
Laplace Mechanism - механізм Лапласа
Gaussian Mechanism - гаусів механізм
Exponential Mechanism - експоненційний механізм
Report Noisy Max - шумовий максимум
Federated Learning
Архітектура
Central Server - центральний сервер
Local Clients - локальні клієнти
Model Updates - оновлення моделі
Aggregation - агрегація
Протоколи безпеки
Secure Aggregation - безпечна агрегація
Homomorphic Encryption - гомоморфне шифрування
Secure Multi-party Computation - безпечні багатосторонні обчислення
Differential Privacy - диференційна приватність
Homomorphic Encryption
Типи гомоморфного шифрування
Partially Homomorphic - частково гомоморфне
Somewhat Homomorphic - дещо гомоморфне
Fully Homomorphic - повністю гомоморфне
Leveled Homomorphic - рівневе гомоморфне
Застосування в ML
Private Inference - приватний висновок
Private Training - приватне навчання
Secure Aggregation - безпечна агрегація
Encrypted Neural Networks - зашифровані нейронні мережі
⚖️ AI етика та справедливість
Bias в машинному навчанні
Типи упередженості
Historical Bias - історична упередженість
Representation Bias - упередженість представлення
Measurement Bias - упередженість вимірювання
Aggregation Bias - упередженість агрегації
Evaluation Bias - упередженість оцінки
Джерела упередженості
Training Data - дані навчання
Algorithm Design - дизайн алгоритму
Feature Selection - вибір ознак
Model Architecture - архітектура моделі
Evaluation Metrics - метрики оцінки
Fairness в AI
Визначення справедливості
Demographic Parity - демографічна паритетність
Equalized Odds - зрівняні шанси
Equal Opportunity - рівні можливості
Calibration - калібрування
Individual Fairness - індивідуальна справедливість
Методи забезпечення справедливості
Pre-processing - попередня обробка
In-processing - обробка під час навчання
Post-processing - пост-обробка
Adversarial Debiasing - вороже зменшення упередженості
Explainable AI (XAI)
Методи пояснення
LIME (Local Interpretable Model-agnostic Explanations) - локальні пояснення
SHAP (SHapley Additive exPlanations) - адитивні пояснення Шеплі
Grad-CAM - градієнтні пояснення
Integrated Gradients - інтегровані градієнти
Counterfactual Explanations - контрфактичні пояснення
Типи пояснень
Global Explanations - глобальні пояснення
Local Explanations - локальні пояснення
Feature Importance - важливість ознак
Decision Rules - правила прийняття рішень
Attention Maps - карти уваги
🛡️ Захист AI систем
Архітектурні захисти
1. Defense in Depth
Input Validation - валідація вхідних даних
Model Monitoring - моніторинг моделі
Anomaly Detection - виявлення аномалій
Response Systems - системи реагування
2. Robust Architecture
Ensemble Methods - ансамбльові методи
Diversity - різноманітність
Redundancy - надлишковість
Fail-safe Mechanisms - механізми безпечного відмовного режиму
Операційні захисти
1. Model Security
Model Encryption - шифрування моделі
Access Control - контроль доступу
Version Control - контроль версій
Integrity Checking - перевірка цілісності
2. Data Security
Data Encryption - шифрування даних
Data Anonymization - анонімізація даних
Data Minimization - мінімізація даних
Data Retention - зберігання даних
Моніторинг та детекція
1. Real-time Monitoring
Performance Monitoring - моніторинг продуктивності
Accuracy Monitoring - моніторинг точності
Bias Monitoring - моніторинг упередженості
Drift Detection - виявлення дрифту
2. Threat Detection
Adversarial Detection - виявлення ворожих атак
Anomaly Detection - виявлення аномалій
Intrusion Detection - виявлення вторгнень
Behavioral Analysis - аналіз поведінки
📋 Регулятивні вимоги
GDPR та AI
Права суб'єктів даних
Right to Explanation - право на пояснення
Right to Human Review - право на людський огляд
Right to Object - право на заперечення
Right to Rectification - право на виправлення
Вимоги до AI систем
Transparency - прозорість
Accountability - відповідальність
Fairness - справедливість
Privacy by Design - приватність з самого початку
EU AI Act
Категорії ризику
Minimal Risk - мінімальний ризик
Limited Risk - обмежений ризик
High Risk - високий ризик
Unacceptable Risk - неприйнятний ризик
Вимоги для високоризикових систем
Risk Management - управління ризиками
Data Governance - управління даними
Technical Documentation - технічна документація
Record Keeping - ведення записів
Transparency - прозорість
Human Oversight - людський нагляд
Accuracy - точність
Robustness - стійкість
📊 Метрики AI безпеки
Метрики безпеки
Adversarial Robustness - стійкість до ворожих атак
Privacy Leakage - витік приватності
Bias Metrics - метрики упередженості
Fairness Metrics - метрики справедливості
Explainability Score - оцінка пояснюваності
Метрики продуктивності
Accuracy - точність
Precision - прецизійність
Recall - повнота
F1-Score - F1-оцінка
AUC-ROC - площа під кривою ROC
Метрики надійності
Model Drift - дрифт моделі
Data Drift - дрифт даних
Concept Drift - дрифт концепції
Performance Degradation - деградація продуктивності
Failure Rate - частота відмов
🎓 Висновок
Безпека штучного інтелекту є критично важливою областю, яка поєднує технічні, етичні та регулятивні аспекти для забезпечення безпечного та відповідального використання AI технологій.
Розуміння adversarial атак, model poisoning, privacy-preserving методів та етичних аспектів AI є ключовим для розробки безпечних та справедливих AI систем.
Регулятивні вимоги, такі як GDPR та EU AI Act, надають структурований підхід до забезпечення безпеки, приватності та етичного використання AI технологій.
Майбутнє AI безпеки пов'язане з розвитком нових методів захисту, покращенням explainability, забезпеченням справедливості та інтеграцією з традиційними системами безпеки.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Network Packet Routing і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Network Packet Routing