Концепції
Low-Rank Adaptation (LoRA), QLoRA з 4-бітною квантизацією, адаптери для окремих шарів.
Практики
Вибір шарів для LoRA, lr/schedule, gradient checkpointing, змішування адаптерів і злиття у повну матрицю.
Інференс
Завантаження бази + адаптери, компатибельність з платами, обʼєднання для швидкості, AOT-компіляція.
Гайд з прикладами
Приклад: Донавчання інструкцій LoRA
Заморозити базову модель; додати LoRA на Q/K/V і out-проєкції.
Тренувати з lr 1e-4, невеликим r (8–16), 3–5 епох.
Оцінити якість; експортувати адаптери/злиту модель.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Hash Function Avalanche Visualizer і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Hash Function Avalanche Visualizer