snažíme se z hodnot jedné proměnné nebo lineární kombinace více proměnných predikovat hodnoty další proměnné

dva typy proměnných: predikovaná (závislá) proměnná a prediktory (nezávisle proměnné)

závislá proměnná se označuje také jako regresand, nezávislá jako regresor

predikovaná proměnná se označuje Y, prediktory X1 , X2 …Xn

pouze 1 prediktor – jednoduchá regrese

více prediktorů – mnohonásobná regrese

Jednoduchá regresní analýza

Příklad - Jak souvisí vzdělání respondenta se vzděláním otce?

tj. jak dobře můžeme předpovědět počet let formálního vzdělání respondenta z údaje o počtu let vzdělání jeho otce?

snažíme se najít rovnici tzv. regresní přímky

regresní přímka je taková přímka, od které je vzdálenost bodů (představujících naměřená data) co nejmenší

taková přímka, která nejlépe vystihuje data

jednou z metod, jak regresní přímku nalézt, je metoda nejmenších čtverců

je zvolena taková přímka, kdy platí, že součet čtverců vzdáleností jednotlivých bodů od přímky je minimální (když vezmeme jednu hodnotu, umocníme → dostaneme čtverec, neboli čtverečnou hodnotu)

Předpoklady regresní analýzy

dostatečná variabilita všech proměnných

rozdělení hodnot proměnných je normální

u malých výběrů zkontrolovat extrémní hodnoty

vztahy mezi Y a každou X jsou lineární

zkontrolovat scatter plotem

vzájemné korelace mezi prediktory nejsou příliš vysoké (tzv. problém multikolinearity)

pokud ano, je vhodné buď některou z nich vyřadit, nebo z nich vytvořit např. faktorovou analýzou jeden skór

rozdělení reziduálních hodnot (reziduálů) je normální

zkontrolovat analýzou reziduálů – histogramem, pravděpodobnostním grafem

Obecná rovnice regresní přímky

Y’ = a + bX

a je konstanta (predikovaná hodnota Y, když hodnota X je 0)

b je směrnice regresní přímky (úhel přímky vzhledem k ose; kolikrát se Y zvětší s každou jednotkou X);

rozdíl mezi naměřenou a predikovanou hodnotou = reziduální hodnota predikce, chyba predikce (e)

b=rxy∗sysxa=y―−b⋅x―

v příkladu vychází rovnice regresní přímky

*Y’ = 9,93 + 0,32 X

Mnohonásobná regresní analýza

predikujeme závislou proměnnou z více prediktorů

vliv každého z prediktorů na závislou proměnnou je kontrolován pro vliv všech ostatních prediktorů (jde tedy o vliv „očištěný“ od vlivů ostatních proměnných – počítáme tzv. parciální koeficienty)

příklad – kromě vzdělání otce (X1) může mít na dosažené vzdělání vliv také počet dalších dětí v rodině (X2)

-      rovnice regresní přímky je Y’ = a + b1X1 + b2X2

-      Y’ = 10,68 + 0,30* X1 – 0,13* X2

-      vliv vzdělání otce (b=0,30) je o něco menší než u jednoduché regresní analýzy (b=0,32) – je kontrolován pro počet dalších dětí v rodině, který je zřejmě mírně ovlivněn také vzděláním otce

-      vliv počtu dětí v rodině je záporný – tj. čím více dětí, tím nižší vzdělání

-   β pro vzdělání otce je 0,43

-      pro počet dětí v rodině -0,13

-      větší vliv má tedy vzdělání otce než počet dětí v rodině

·       kromě regresních koeficientů je počítán také tzv. koeficient mnohonásobné korelace – korelace všech prediktorů se závislou proměnnou; ozn. R

Testování hypotéz v regresní analýze

jsou testovány 2 typy hypotéz

  1. zda se R průkazně liší od 0

testuje se analýzou rozptylu (porovnává rozptyl vysvětlený regresním modelem a reziduální rozptyl)

  1. zda se regresní koeficienty β průkazně liší od 0

testuje se t-testem

Reziduály

Shrnutí

Účel

Regresní analýza je statistická technika používaná k modelování vztahu mezi závislou proměnnou (response variable) a jednou nebo více nezávislými proměnnými (predictor variables).

Účely regresní analýzy zahrnují:

Predikce: Použití modelu k předpovědi hodnot závislé proměnné na základě hodnot nezávislých proměnných.

Modelování: Vytvoření matematického modelu, který popisuje vztah mezi proměnnými.

Identifikace vlivu: Zjištění, které nezávislé proměnné mají významný vliv na závislou proměnnou.

Kvantifikace vztahů: Odhad velikosti vlivu nezávislých proměnných na závislou proměnnou.

Obecná rovnice regresní funkce

Obecná rovnice lineární regresní funkce je:

y=β0+β1x1+βn​xn​+ϵ

kde:

Jak se interpretují regresní koeficienty

Intercept (β0​): Hodnota závislé proměnné, když jsou všechny nezávislé proměnné rovny nule.

Regresní koeficienty (βi​): Odhadují změnu závislé proměnné yy při jednotkové změně nezávislé proměnné xi​, když ostatní proměnné jsou konstantní. Např. β1​ udává změnu v y při zvýšení x1​ o jednu jednotku, pokud ostatní proměnné zůstávají nezměněny.

Co je to koeficient mnohonásobné korelace?

Koeficient mnohonásobné korelace, označovaný jako R nebo R2 v kontextu mnohonásobné lineární regrese, měří sílu a směr lineárního vztahu mezi jednou závislou proměnnou a více nezávislými proměnnými.

R: Koeficient mnohonásobné korelace, který je odmocninou R2.

R2 Koeficient determinace, který udává podíl variability závislé proměnné vysvětlené modelem. Hodnoty se pohybují mezi 0 a 1, kde vyšší hodnoty naznačují lepší model.

Předpoklady regresní analýzy

Pro správné použití a interpretaci lineární regresní analýzy je důležité dodržet následující předpoklady:

  1. Linearita: Vztah mezi závislou a nezávislými proměnnými je lineární.
  2. Normalita reziduí: Rezidua (chyby) modelu jsou normálně rozdělená.
  3. Homoskedasticita: Variance reziduí je konstantní pro všechny hodnoty nezávislých proměnných.
  4. Nezávislost reziduí: Rezidua jsou nezávislá na sobě (neexistuje autokorelace).
  5. Nepřítomnost multikolinearity: Nezávislé proměnné nejsou silně korelované mezi sebou, aby se zabránilo problémům s interpretací koeficientů.

Dodržení těchto předpokladů je klíčové pro validitu a spolehlivost výsledků regresní analýzy.