🔬 Основні концепції
Розподілене навчання
Дані залишаються у клієнтів (пристрої, організації), моделі навчаються локально. Тільки оновлення моделі (градієнти, ваги) відправляються на центральний сервер для агрегації. Дані ніколи не виходять з пристрою.
FedAvg (Federated Averaging)
Стандартний алгоритм: клієнти навчаються локально, сервер агрегує оновлення через зважене середнє. Простий, ефективний. База для багатьох алгоритмів. Адаптується до різнорідності даних, систем.
Heterogeneity
Федеративні системи мають різнорідність: різні розподіли даних (non-IID), різні обчислювальні ресурси, мережеві з'єднання. Алгоритми мають враховувати це для стабільного навчання.
🎯 Безпека та приватність
Differential Privacy
Додавання шуму до градієнтів для запобігання витоку інформації. Гарантує, що окремі дані не можуть бути виведені з оновлень. Баланс між приватністю та продуктивністю. Різні рівні приватності.
Secure Aggregation
Криптографічні протоколи для безпечної агрегації без розкриття індивідуальних оновлень. Multi-party computation, homomorphic encryption. Додаткова приватність за компроміс з обчисленнями.
Gradient Leakage
Градієнти можуть містити інформацію про дані. Атаки можуть відновити дані з градієнтів. Захист: differential privacy, gradient clipping, secure aggregation. Активні дослідження.
💻 Алгоритми
FedAvg
Клієнти навчаються локально E епох, сервер агрегує через зважене середнє (за розміром даних). Простий, ефективний. Адаптується до різнорідності. База для багатьох покращень.
FedProx
Додає proximity term для зменшення variance через різнорідність. Стабільніше навчання на non-IID даних. Покращення збіжності.
FedSGD
Federated SGD: клієнти обчислюють градієнти, сервер агрегує та оновлює. Менш ефективний за FedAvg, але простіший. Рідко використовується.
Personalized FL
Персоналізовані моделі для кожного клієнта через local fine-tuning або meta-learning. Краще для сильно різнорідних даних. Баланс між глобальною та локальною моделями.
🏭 Застосування
Мобільні пристрої
Навчання клавіатур, рекомендацій без відправки тексту. Google Gboard, Apple використовує для покращення Siri. Користувачі отримують покращення без компромісу приватності.
Медицина
Навчання на даних з різних лікарень без об'єднання даних. Compliance з HIPAA, GDPR. Можливість використати великі розподілені набори даних при збереженні конфіденційності.
Фінанси
Навчання на даних різних банків без обміну даними. Fraud detection, кредитне скорингування. Compliance з фінансовими регуляціями.
IoT
Навчання на даних з різних сенсорів без централізації. Менше мережевого трафіку, приватність. Важливо для edge computing.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Hash Function Avalanche Visualizer