Bivariační analýza (dvourozměrné distribuce)
Vzorečky na statistiku#Binomický rozdělovací vzorec
- rozdělení dvou prom., třídění druhého stupně (druhostupňové třídění)
- sledování vztahů dvou prom. (vztah výšky a váhy, finančního ohodnocení a spokojenosti v práci, únavy a výkonu)
- Typy vztahů: shoda, protiklad, nezávislost
Shoda
pozitivní souvislost - nízké hodnoty jedné se potkávají s nízkými hodnotami druhé, podobné potkávání u vysokých hodnot
Protiklad
negativní souvislost - nízké s vysokými a naopak
Nezávislost
neexistenci souvislosti - nepozorujeme pravidelnost
Možnosti zpracování
Tabulkové (kontingenční), krostabulace
Grafické znázornění - bodový graf
Numerické charakteristiky - korelační a kontingenční koeficienty
Tabulkové zpr.
nezávislá a závislá prom
Nejčastěji bývá závislá nalevo v řádcích a nezávislá (vysvětlující) ve sloupcích
| Osobní pohoda | muž | žena | Sum |
|---|---|---|---|
| 1 nespokojen | 5 (41%) | 2 (22%) | 7 |
| 2 | 5 (41%) | 1 (11%) | 6 |
| 3 spokojen | 2 (16%) | 6 (66%) | 8 |
| Sum | 12 (100%) | 9 (100%) | 21 |
Interpretace tabulek
závislá - ovlivňována, způsobována (nejčastěji v řádcích)
nezávislá - ovlivňuje, vysvětluje závislou (sloupce)
Směr kauzality je vždy věcí teorie, nelze ji určit z dat samotných
Explanační interpretace dvourozměrné tabulky
- osoby rozdělíme do podskupin podle úrovní nezávislé proměnné (muži/ženy)
- Každá podsk. popsána podle hodnot proměnné (např. osobní pohoda)
- Tabulku čteme tak, že porovnáváme navzájem podskupiny nezávislé proměnné (muži/ženy) podle hodnot závislé proměnné (osobní pohoda). Smysluplné je porovnávat distribuce napříč kategoriemi nezávislé proměnné
Relativní četnosti
- Rela. Řádkové četn. poměr hodnoty v políčku a součtu řádku násobený 100. Součet v každém řádku reprezentuje 100%
- Sloupcové - poměr hodnoty v políčku a součtu sloupce násobený 100. Součet v každém sloupci reprezentuje 100 %
- Relativní celkové četnosti = poměr hodnoty v políčku a celkového součtu násobený 100
Souvislost znaků v tabulce (dvě závislé proměnné)
- Seskupení vysokých hodnot na diagonále tabulky naznačuje, že existuje souvislost mezi prom. (o závislých pro.)
- Souvislost může mít i jinou formu, např. v každém sloupci jsou pozorování nahromaděna do jediného pole, jehož pozice je pro každý sloupec jiná
Korelace
vztah (souvislost, asociace) mezi dvěma proměnnými, jejichž hodnoty jsou uspořádány ve dvojicích
-
Neznámá sama o sobě příčinný (kauzální) vztah!
-
Sílu tohoto vztahu určuje korelační koeficient (napč. Pearson, Spearman, Kendall)
-
Umožňuje odvodit procento společné variability
-
Dvě proměnné (označují se X a Y ) - ptáme se, zda jsou nezávislé, nebo existuje mazi nimi souvislost (korelace) a jak je silná
-
Součinový korelační koeficient (Pearson) r
-
Pořadový korelační koeficient (Spearman) rs 𝛒 (ró)
-
Kendallovo
(tau)
Korelační koeficient
-
Určuje stupeň vztahu mezi dvěma proměnnými. Je vyjadřován číslem s hodnotou mezi 0 a 1 (resp. 0 až -1). Žádný vztah znamená 0. ´plná kladní závislost je 1. Úplná záporná je -1
-
S růstem hodnoty r od 0 k 1 (nebo -1) se míra těsnosti vztahu zvyšuje
-
Hodnota korelačního koeficientu mezi výsledky dosaženými v prvním roce studia na univerzitě a výsledky v ročníku druhém je 0,75. Tento výsledek ukazuje na kladnou a těsnou (silnou) závislost)
-
hodnoty k. koe. od 0,1 do 0,3 znamenají slabý vztah proměnných
-
hodnoty nad 0,3 až 0,6 středně silný vztah
-
hodnoty nad 0,6 silný vztah dvou proměnných
-
Uvedené platí jak pro kladné tak záporné hodnoty korelací
Interpretace hodnot korelačního koeficientu v sociálních vědách (detailnější členění)
0,01 - 0,09 triviální, žádná
0,10 - 0,29 nízká až střední
0,30-0,49 střední až podstatní
0,50-0, 69 podstatná až velmi silná
0,70 - 0,89 velmi silná
0,90 - 0,99 téměř perfektní
Důležité vlastnosti korelačního koeficientu
- Platí -1 -< r -< +1
- Jestliže |r| = 1, leží všechny body na přímce
- Jestliže r = 0, nazýváme X a Y nekorelované proměnné. Dvě náhodné proměnné jsou tím více korelovány, čím blíže je hodnota r k číslům +1 nebo -1. V tom případě lze vztah obou proměnných dobře vyjádřit
Druhou mocninou koeficientu korelace je koeficient determinace, jeho stonásobek udává, z kolika procent jsou změny hodnoty závisle proměnné Y vysvětlovány hodnotami nezávisle proměnné (proměnných), tj. vypočtenou regresní funkcí.
Stupnice těsnosti závislosti podle koeficientu determinace je zhruba takto:
r2 < 10 %těsnost nízká
10 % r2 < 25 %těsnost mírná
25 % r2 < 50 %těsnost význačná
50 % r2 < 80 %těsnost velká
80 % r2 těsnost velmi vysoká
Regresní a korelační analýza
-
zkoumání a hodnocení závislostí mezi kvantitativními (metrickými) statistickými
znaky, zpravidla označovanými jako proměnné. -
volné (statistické) závislosti, které v biologickém, sociálně-vědním i ekonomickém výzkumu
téměř výhradně převládají.
Volnou (nebo statistickou) závislostí rozumíme takový vztah
proměnných, kdy stejné hodnotě Xi nezávisle proměnné X při
opakovaném měření neodpovídá vždy shodná hodnota závisle
proměnné Y, ale celé pole rozdílných hodnot proměnné Y.
Se změnou hodnot nezávisle proměnné X (event. proměnných XI,
Xk) se mění i úroveň hodnot (tj. střed pole hodnot) závisle proměnné Y.
Při regresní a korelační analýze prakticky vždy
řešíme dvě základní úlohy:
Změřit těsnost zkoumané závislosti, tzv. korelaci.
Vyjadřujeme a hodnotíme ji podle vypočtených hodnot
charakteristik korelace a determinace.
Zjistit a vhodně vyjádřit průměrný průběh závislosti, tzv.
regresi. Vyjadřujeme ji výpočtem parametrů vhodné
regresní funkce.
Protože regresní a korelační analýzu provádíme téměř vždy
s daty naměřenými na výběrovém souboru statistických
jednotek, je možno považovat získané výsledky pouze za
odhady pro shodné závislosti v základním (populačním)
souboru.

