ГоловнаСтаттіCybersecurity

Безпека штучного інтелекту: захист ML моделей, атаки на AI та етичні аспекти

Безпека штучного інтелекту (AI Security) — це комплекс заходів, технологій та політик, спрямованих на захист систем машинного навчання, нейронних мереж та штучного інтелекту від кіберзагроз, маніпуляцій та зловживань.

mysimulator teamОновлено — липень 2026≈ 5 хв читання▶ Відкрити симуляцію

📋 TL;DR - Основні моменти

AI безпека - захист машинного навчання та штучного інтелекту

Adversarial Examples - ворожі приклади для обману ML моделей

Model Poisoning - отруєння моделей під час навчання

Privacy-Preserving ML - машинне навчання з захистом приватності

AI етика - етичні аспекти штучного інтелекту

Bias та Fairness - упередження та справедливість в AI

Explainable AI - пояснюваний штучний інтелект

🤖 Що таке AI безпека?

Безпека штучного інтелекту (AI Security) — це комплекс заходів, технологій та політик, спрямованих на захист систем машинного навчання, нейронних мереж та штучного інтелекту від кіберзагроз, маніпуляцій та зловживань.

AI безпека включає захист від adversarial атак, забезпечення приватності даних, запобігання упередженості моделей, захист інтелектуальної власності та забезпечення етичного використання AI технологій.

⚔️ Adversarial Examples

Що таке Adversarial Examples?

Adversarial Examples — це спеціально створені вхідні дані, які виглядають нормально для людини, але призводять до неправильних передбачень машинного навчання. Ці атаки можуть бути дуже незначними (наприклад, зміна кількох пікселів у зображенні).

Типи Adversarial атак

1. White-box атаки

FGSM (Fast Gradient Sign Method) - швидкий метод градієнтного знаку

PGD (Projected Gradient Descent) - проективний градієнтний спуск

C&W Attack - атака Carlini & Wagner

DeepFool - глибокий обман

JSMA - атака Якобіана

2. Black-box атаки

Transfer Attacks - атаки переносу

Substitute Model Attacks - атаки на заміщуючі моделі

ZOO (Zeroth Order Optimization) - оптимізація нульового порядку

One-pixel Attack - атака одного пікселя

Boundary Attack - атака на межу

3. Physical атаки

Adversarial Patches - ворожі патчі

3D Adversarial Objects - 3D ворожі об'єкти

Lighting Attacks - атаки освітлення

Camera Attacks - атаки камери

Sticker Attacks - атаки наклейок

Методи захисту від Adversarial атак

1. Adversarial Training

Data Augmentation - розширення даних

Robust Training - стійке навчання

Ensemble Methods - ансамбльові методи

Certified Defenses - сертифіковані захисти

2. Detection Methods

Anomaly Detection - виявлення аномалій

Input Preprocessing - попередня обробка вхідних даних

Feature Squeezing - стиснення ознак

MagNet - магнітний детектор

3. Defensive Distillation

Knowledge Distillation - дистиляція знань

Temperature Scaling - масштабування температури

Soft Labels - м'які мітки

Robustness - стійкість

☠️ Model Poisoning

Що таке Model Poisoning?

Model Poisoning — це атака, при якій зловмисник вводить отруєні дані в процес навчання машинного навчання, щоб зламати або маніпулювати поведінкою моделі. Це може призвести до неправильних передбачень або навіть до backdoor атак.

Типи Model Poisoning

1. Data Poisoning

Label Flipping - перевертання міток

Feature Poisoning - отруєння ознак

Backdoor Attacks - атаки через бекдор

Clean Label Attacks - атаки з чистими мітками

2. Model Poisoning

Gradient Poisoning - отруєння градієнтів

Parameter Poisoning - отруєння параметрів

Update Poisoning - отруєння оновлень

Federated Learning Attacks - атаки на федеративне навчання

Backdoor атаки

Принцип роботи

Trigger Injection - введення тригера

Target Label - цільова мітка

Stealth - прихованість

Activation - активація

Типи тригерів

Pixel Triggers - піксельні тригери

Patch Triggers - патч-тригери

Noise Triggers - шумові тригери

Semantic Triggers - семантичні тригери

Методи захисту від Model Poisoning

1. Data Validation

Outlier Detection - виявлення викидів

Data Sanitization - санітаризація даних

Source Verification - верифікація джерела

Integrity Checking - перевірка цілісності

2. Robust Training

Differential Privacy - диференційна приватність

Byzantine-robust Aggregation - візантійсько-стійка агрегація

Anomaly Detection - виявлення аномалій

Model Verification - верифікація моделі

🔒 Privacy-Preserving Machine Learning

Диференційна приватність (Differential Privacy)

Основні принципи

ε-Differential Privacy - ε-диференційна приватність

Privacy Budget - бюджет приватності

Composition - композиція

Post-processing - пост-обробка

Механізми захисту

Laplace Mechanism - механізм Лапласа

Gaussian Mechanism - гаусів механізм

Exponential Mechanism - експоненційний механізм

Report Noisy Max - шумовий максимум

Federated Learning

Архітектура

Central Server - центральний сервер

Local Clients - локальні клієнти

Model Updates - оновлення моделі

Aggregation - агрегація

Протоколи безпеки

Secure Aggregation - безпечна агрегація

Homomorphic Encryption - гомоморфне шифрування

Secure Multi-party Computation - безпечні багатосторонні обчислення

Differential Privacy - диференційна приватність

Homomorphic Encryption

Типи гомоморфного шифрування

Partially Homomorphic - частково гомоморфне

Somewhat Homomorphic - дещо гомоморфне

Fully Homomorphic - повністю гомоморфне

Leveled Homomorphic - рівневе гомоморфне

Застосування в ML

Private Inference - приватний висновок

Private Training - приватне навчання

Secure Aggregation - безпечна агрегація

Encrypted Neural Networks - зашифровані нейронні мережі

жива демонстрація · пов'язана симуляція● LIVE

⚖️ AI етика та справедливість

Bias в машинному навчанні

Типи упередженості

Historical Bias - історична упередженість

Representation Bias - упередженість представлення

Measurement Bias - упередженість вимірювання

Aggregation Bias - упередженість агрегації

Evaluation Bias - упередженість оцінки

Джерела упередженості

Training Data - дані навчання

Algorithm Design - дизайн алгоритму

Feature Selection - вибір ознак

Model Architecture - архітектура моделі

Evaluation Metrics - метрики оцінки

Fairness в AI

Визначення справедливості

Demographic Parity - демографічна паритетність

Equalized Odds - зрівняні шанси

Equal Opportunity - рівні можливості

Calibration - калібрування

Individual Fairness - індивідуальна справедливість

Методи забезпечення справедливості

Pre-processing - попередня обробка

In-processing - обробка під час навчання

Post-processing - пост-обробка

Adversarial Debiasing - вороже зменшення упередженості

Explainable AI (XAI)

Методи пояснення

LIME (Local Interpretable Model-agnostic Explanations) - локальні пояснення

SHAP (SHapley Additive exPlanations) - адитивні пояснення Шеплі

Grad-CAM - градієнтні пояснення

Integrated Gradients - інтегровані градієнти

Counterfactual Explanations - контрфактичні пояснення

Типи пояснень

Global Explanations - глобальні пояснення

Local Explanations - локальні пояснення

Feature Importance - важливість ознак

Decision Rules - правила прийняття рішень

Attention Maps - карти уваги

🛡️ Захист AI систем

Архітектурні захисти

1. Defense in Depth

Input Validation - валідація вхідних даних

Model Monitoring - моніторинг моделі

Anomaly Detection - виявлення аномалій

Response Systems - системи реагування

2. Robust Architecture

Ensemble Methods - ансамбльові методи

Diversity - різноманітність

Redundancy - надлишковість

Fail-safe Mechanisms - механізми безпечного відмовного режиму

Операційні захисти

1. Model Security

Model Encryption - шифрування моделі

Access Control - контроль доступу

Version Control - контроль версій

Integrity Checking - перевірка цілісності

2. Data Security

Data Encryption - шифрування даних

Data Anonymization - анонімізація даних

Data Minimization - мінімізація даних

Data Retention - зберігання даних

Моніторинг та детекція

1. Real-time Monitoring

Performance Monitoring - моніторинг продуктивності

Accuracy Monitoring - моніторинг точності

Bias Monitoring - моніторинг упередженості

Drift Detection - виявлення дрифту

2. Threat Detection

Adversarial Detection - виявлення ворожих атак

Anomaly Detection - виявлення аномалій

Intrusion Detection - виявлення вторгнень

Behavioral Analysis - аналіз поведінки

📋 Регулятивні вимоги

GDPR та AI

Права суб'єктів даних

Right to Explanation - право на пояснення

Right to Human Review - право на людський огляд

Right to Object - право на заперечення

Right to Rectification - право на виправлення

Вимоги до AI систем

Transparency - прозорість

Accountability - відповідальність

Fairness - справедливість

Privacy by Design - приватність з самого початку

EU AI Act

Категорії ризику

Minimal Risk - мінімальний ризик

Limited Risk - обмежений ризик

High Risk - високий ризик

Unacceptable Risk - неприйнятний ризик

Вимоги для високоризикових систем

Risk Management - управління ризиками

Data Governance - управління даними

Technical Documentation - технічна документація

Record Keeping - ведення записів

Transparency - прозорість

Human Oversight - людський нагляд

Accuracy - точність

Robustness - стійкість

📊 Метрики AI безпеки

Метрики безпеки

Adversarial Robustness - стійкість до ворожих атак

Privacy Leakage - витік приватності

Bias Metrics - метрики упередженості

Fairness Metrics - метрики справедливості

Explainability Score - оцінка пояснюваності

Метрики продуктивності

Accuracy - точність

Precision - прецизійність

Recall - повнота

F1-Score - F1-оцінка

AUC-ROC - площа під кривою ROC

Метрики надійності

Model Drift - дрифт моделі

Data Drift - дрифт даних

Concept Drift - дрифт концепції

Performance Degradation - деградація продуктивності

Failure Rate - частота відмов

🎓 Висновок

Безпека штучного інтелекту є критично важливою областю, яка поєднує технічні, етичні та регулятивні аспекти для забезпечення безпечного та відповідального використання AI технологій.

Розуміння adversarial атак, model poisoning, privacy-preserving методів та етичних аспектів AI є ключовим для розробки безпечних та справедливих AI систем.

Регулятивні вимоги, такі як GDPR та EU AI Act, надають структурований підхід до забезпечення безпеки, приватності та етичного використання AI технологій.

Майбутнє AI безпеки пов'язане з розвитком нових методів захисту, покращенням explainability, забезпеченням справедливості та інтеграцією з традиційними системами безпеки.

Спробуйте наживо

Усе, що вище, працює прямо у вашому браузері — відкрийте Network Packet Routing і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.

▶ Відкрити симуляцію Network Packet Routing

Що ви знайшли?

Додати кроки відтворення (опційно)