Podstawy regresji liniowej
Najprostszym przypadkiem regresji liniowej jest próba dopasowania prostej linii do punktów danych. Ta linia reprezentuje najlepsze dopasowanie zależności między zmienną niezależną (na przykład temperatura, wydatki na reklamę) a zmienną zależną (na przykład sprzedaż, odcienie zbioru). Równanie regresji liniowej prostej ma postać: y = mx + b, gdzie 'y' to przewidywana wartość zmiennej zależnej, 'x' to wartość zmiennej niezależnej, 'm' to nachylenie linii, a 'b' to punkt przecięcia się osi Y.
y = mx + b
Koncept błędu
Modeli regresji nie są idealne. Zawsze będzie istniał pewien stopień błędu między przewidywaną wartością a rzeczywistą obserwowaną wartością. Ten błąd często przedstawiany jest jako residua – różnica między obserwowanymi i przewidzianymi wartościami. Minimalizacja tych błędów stanowi kluczowe zadanie w analizie regresji.
Regresja wielokrotne
Gdy masz wiele zmiennych niezależnych, używasz *wielokrotnej* regresji. Równanie przybiera postać: y = β₀ + β₁x₁ + β₂x₂ + ... + ε, gdzie β₀ to przecinek, β₁, β₂ itd., są współczynnikami dla każdej zmiennej niezależnej, a ε reprezentuje składnik błędu. Dopuszcza ono ocenę indywidualnych i zintegrowanych efektów wielu czynników na zmiennej zależnej.
y = β₀ + β₁x₁ + β₂x₂ + ... + ε
Evaluacja modelu
ocena jakości modelu regresji jest kluczowa. Miary takie jak R-squared (pokazujący proporcję wariancji wyjaśnionej przez model) i Wurzel Sredniego Kwadratu Błędu (RMSE, mierzący średnią wielkość błędu) są powszechnie używane do oceny dopasowania modelu oraz dokładności prognoz.
Często zadawane pytania
Czym jest R-squared?
R-squared mierzy jak dobrze linię regresji dopasowuje dane. Wartość 1 oznacza idealne dopasowanie, podczas gdy wartości bliższe 0 wskazują na słabe dopasowanie.
Jak RMSE powiązać z modelem?
RMSE reprezentuje średnią odległość między każdym obserwowanym wartością a odpowiednią dla niej przewidywaną wartością – niższy RMSE sugeruje lepsze dopasowanie modelu.
Czy mogę używać regresji z zmiennymi kategorycznymi?
Tak, ale w przeciwieństwie do tego będziesz musiał wykorzystać techniki takie jak kodowanie dummy lub jednokrotne kodowanie, aby przedstawić zmienne kategoryczne numerycznie w ramach równania regresji.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Solow Growth Model i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Solow Growth Model