Основні положення лінійної регресії
Найпростішим чином лінійна регресія намагається підігнати пряму лінію через дані. Ця лінія представляє собою найкращу залежність відношення між незалежною змінною (наприклад, температура, витрати на рекламу) та залежною змінною (наприклад, продажі, врожайність). Рівняння для простої лінійної регресії таке: y = mx + b, де 'y' - прогнозоване значення залежної змінної, 'x' - значення незалежної змінної, 'm' - нахил лінії, а 'b' - ордината початку.
y = mx + b
Концепція похибки
Регресійні моделі не є ідеальними. Завжди буде певний ступінь похибки між прогнозованим значенням та фактично спостережуваним. Ця похибка часто відображається як залишки – різниця між спостережуваним та прогнозованим значеннями. Мінімізація цих помилок є ключовою метою регресійного аналізу.
Одиничне регресування
При декількох незалежних змінних використовується *багатохільне* регресування. Рівняння становить: y = β₀ + β₁x₁ + β₂x₂ + ... + ε, де β₀ – це перетин, а β₁, β₂, тощо – коефіцієнти для кожної незалежної змінної, а ε – термін помилки. Це дозволяє оцінити окремі та комбіновані ефекти кількох факторів на залежну змінну.
y = β₀ + β₁x₁ + β₂x₂ + ... + ε
Оцінка моделі
Оцінювання якості регресійної моделі є важливим. Метрики, такі як R-квадрат (що представляє собою частку поясненої дисперсії моделлю) та Середньоквадратична помилка (RMSE, що вимірює середній розмір похибок), часто використовуються для оцінки відповідності моделі та її прогнозуючої точності.
Часті запитання
Що таке R-квадрат?
R-квадрат вимірює, наскільки добре лінія регресії відповідає даним. Значення 1 вказує на ідеальну відповідність, а значення, близькі до 0, свідчать про погану відповідність.
Як RMSE пов'язаний із моделлю?
RMSE представляє середню відстань між кожним спостережуваним значенням та його відповідним прогнозованим значенням – нижче RMSE означає краще підігнану модель.
Чи можу я використовувати регресію з категоріальними змінними?
Так, але зазвичай потрібно використовувати такі методики, як кодування двійників або one-hot encoding для представлення категоріальних змінних числово в рівнянні регресії.
Спробуйте наживо
Усе, що вище, працює прямо у вашому браузері — відкрийте Solow Growth Model і змінюйте параметри під час роботи. Нічого не встановлюється, нічого не завантажується на сервер, уся модель живе в одній вкладці.
▶ Відкрити симуляцію Solow Growth Model