Wybór testu statystycznego wygląda na decyzję wymagającą wiedzy, której nie masz. W rzeczywistości jest to seria siedmiu rozstrzygnięć, z których każde ma dwie lub trzy możliwe odpowiedzi. Kiedy przejdziesz je po kolei, test zostaje wybrany sam — nie ma tu miejsca na intuicję ani na „a co poleca promotor”.
Ten przewodnik prowadzi przez wszystkie siedem kroków, kończy się tabelą decyzyjną i gotowym akapitem, który możesz wkleić do rozdziału metodologicznego. Zakładamy, że masz już zebrane dane albo przynajmniej wiesz, co zamierzasz mierzyć.
Krok 1. Określ skalę pomiaru każdej zmiennej
Rezultat kroku: lista twoich zmiennych z przypisaną skalą.
To jest jedyne rozstrzygnięcie, które naprawdę decyduje o wszystkim, co dalej. Rozróżniamy cztery poziomy pomiaru:
- Nominalna — kategorie bez porządku: płeć, kierunek studiów, województwo. Możesz tylko zliczać.
- Porządkowa — kategorie z porządkiem, ale bez równych odstępów: wykształcenie, pozycja w rankingu, pojedyncza pozycja skali Likerta.
- Przedziałowa — równe odstępy, umowne zero: temperatura w skali Celsjusza, wynik standaryzowany.
- Ilorazowa — równe odstępy i bezwzględne zero: wiek, dochód, czas, liczba punktów.
W praktyce prac dyplomowych spór toczy się prawie wyłącznie o skalę Likerta. Zasada, która przechodzi przez recenzje bez problemu: pojedyncze pytanie z pięciostopniową odpowiedzią traktuj jako porządkowe, a sumę lub średnią z kilkunastu pozycji tworzących jedną skalę — jako przedziałową. Jeżeli zdecydujesz inaczej, napisz o tym wprost w metodologii i uzasadnij; problemem nie jest wybór, tylko przemilczenie go.
Praktyczna wskazówka: wypisz zmienne w tabeli o trzech kolumnach — nazwa, skala, rola w pytaniu badawczym (zależna, niezależna, kontrolna). Ta tabela zajmuje pięć minut, a przy pisaniu rozdziału z wynikami oszczędza godziny, bo od razu widać, które zestawienia w ogóle mają sens.

Krok 2. Nazwij typ pytania badawczego
Rezultat kroku: jedno zdanie zaczynające się od „Sprawdzam, czy…”.
Prawie każde pytanie w pracy dyplomowej należy do jednego z czterech typów:
- Różnica — czy grupy różnią się pod względem jakiejś cechy? („Czy studenci stacjonarni i niestacjonarni różnią się poziomem stresu egzaminacyjnego?”)
- Związek — czy dwie cechy współwystępują? („Czy liczba godzin nauki wiąże się z oceną z obrony?”)
- Przewidywanie — czy na podstawie jednej lub kilku cech można przewidzieć inną? To pytanie o regresję.
- Struktura — czy zbiór pytań mierzy jeden wymiar, czy kilka? To pytanie o analizę czynnikową lub rzetelność.
Jeżeli twoje pytanie nie mieści się w żadnym z tych czterech, jest najprawdopodobniej pytaniem opisowym, a nie testowym — i wtedy nie potrzebujesz testu, tylko tabeli częstości i miar tendencji centralnej. To całkowicie poprawna praca. Wymuszanie testu na pytaniu opisowym jest częstszym błędem niż jego brak.
Krok 3. Ustal, czy porównywane grupy są niezależne czy zależne
Rezultat kroku: słowo „niezależne” albo „zależne” dopisane do pytania z kroku 2.
Grupy są niezależne, gdy każda osoba trafia do dokładnie jednej z nich (kobiety kontra mężczyźni, grupa eksperymentalna kontra kontrolna). Są zależne, gdy te same osoby są mierzone więcej niż raz (pomiar przed i po szkoleniu) albo gdy osoby są dobrane w pary.
To rozróżnienie pomija się zaskakująco często, a konsekwencja jest poważna: użycie testu dla grup niezależnych do pomiarów powtarzanych zawyża błąd i zwykle prowadzi do wyniku nieistotnego tam, gdzie efekt istnieje.
Krok 4. Policz grupy i pomiary
Rezultat kroku: liczba — 2 albo więcej niż 2.
Dwie grupy prowadzą do rodziny testów t i ich odpowiedników. Trzy i więcej — do analizy wariancji i jej odpowiedników. Nie da się „obejść” tej granicy, wykonując kilka porównań po dwie grupy: każde dodatkowe porównanie zwiększa ryzyko wyniku fałszywie istotnego. Jeżeli masz trzy grupy, wykonaj jeden test dla wszystkich trzech, a dopiero potem — jeśli wyjdzie istotny — testy szczegółowe z korektą.
Krok 5. Sprawdź założenia
Rezultat kroku: decyzja „test parametryczny” albo „test nieparametryczny”.
Testy parametryczne wymagają, w uproszczeniu, dwóch rzeczy: zmiennej co najmniej przedziałowej oraz rozkładu zbliżonego do normalnego w porównywanych grupach. Przy porównaniach międzygrupowych dochodzi jeszcze jednorodność wariancji.
Normalność sprawdza się testem Shapiro-Wilka (przy mniejszych próbach) lub Kołmogorowa-Smirnowa, a jednorodność wariancji — testem Levene’a. W obu przypadkach wynik nieistotny jest tym, na który liczysz: oznacza brak podstaw do odrzucenia założenia.
Uwaga praktyczna, która oszczędza sporo nerwów: przy dużych próbach testy normalności wykrywają nawet drobne, nieistotne merytorycznie odchylenia i niemal zawsze wychodzą istotne. Dlatego oprócz testu warto obejrzeć histogram i wykres kwantylowy oraz sprawdzić skośność i kurtozę. Jeżeli rozkład wygląda symetrycznie, a test protestuje wyłącznie z powodu wielkości próby, opisz to w metodologii i uzasadnij wybór testu parametrycznego.
Krok 5a. Uporządkuj braki danych i wartości odstające, zanim policzysz cokolwiek
Rezultat kroku: zdanie o tym, ile obserwacji weszło do analizy i dlaczego.
Ten krok jest w poradnikach pomijany, a w recenzjach wychwytywany. Zanim uruchomisz jakikolwiek test, musisz podjąć dwie decyzje i obie opisać.
Braki danych. Ustal, ile ich jest i czy rozkładają się losowo. Jeżeli pojedyncze osoby pominęły jedno pytanie, zwykle wystarczy analiza na dostępnych przypadkach. Jeżeli natomiast braki koncentrują się w jednym pytaniu albo w jednej podgrupie — na przykład wszystkie osoby powyżej pewnego wieku pominęły pytanie o dochód — to sam wzorzec braków jest ustaleniem badawczym i należy go opisać, a nie po cichu usunąć. Kluczowe jest podanie w pracy dwóch liczb: ilu osobom rozdano narzędzie i ile obserwacji weszło ostatecznie do analizy.
Wartości odstające. Obejrzyj wykres pudełkowy każdej zmiennej ilościowej. Obserwacja skrajna nie jest automatycznie błędem — bywa najciekawszym przypadkiem w całym zbiorze. Usuwaj ją tylko wtedy, gdy masz podstawę merytoryczną, na przykład fizycznie niemożliwą wartość albo oczywistą pomyłkę przy wprowadzaniu danych. Usunięcie obserwacji dlatego, że „psuła wynik”, jest naruszeniem rzetelności badawczej, nawet jeśli nikt tego nie sprawdzi. Bezpieczne rozwiązanie przy wątpliwościach: policz test w obu wariantach, z obserwacją i bez niej, i napisz w wynikach, czy wnioski się zmieniają.
Krok 6. Odczytaj test z tabeli
Rezultat kroku: nazwa testu.
Mając odpowiedzi z kroków 1–5, znajdź swój wiersz:
| Sytuacja | Test parametryczny | Odpowiednik nieparametryczny |
|---|---|---|
| 2 grupy niezależne, zmienna ilościowa | test t dla prób niezależnych | test U Manna-Whitneya |
| 2 pomiary tych samych osób | test t dla prób zależnych | test kolejności par Wilcoxona |
| 3+ grupy niezależne | jednoczynnikowa ANOVA | test Kruskala-Wallisa |
| 3+ pomiary tych samych osób | ANOVA z powtarzanymi pomiarami | test Friedmana |
| 2 zmienne nominalne (tabela krzyżowa) | — | test chi-kwadrat niezależności |
| Związek 2 zmiennych ilościowych | korelacja Pearsona | korelacja rho Spearmana |
| Przewidywanie zmiennej ilościowej | regresja liniowa | — |
| Przewidywanie zmiennej dwukategorialnej | regresja logistyczna | — |
| Spójność wewnętrzna skali | alfa Cronbacha | — |
Jeden warunek dodatkowy dotyczy testu chi-kwadrat: wymaga on odpowiednio licznych oczekiwanych liczebności w komórkach tabeli. Jeżeli twoja tabela ma wiele komórek o bardzo małych liczebnościach, połącz kategorie albo sięgnij po dokładny test Fishera. Program statystyczny zwykle ostrzega o tym w przypisie pod wynikiem — przeczytaj ten przypis, zanim skopiujesz tabelę do pracy.
Druga pułapka dotyczy korelacji. Współczynnik Pearsona mierzy wyłącznie zależność liniową. Jeżeli związek między zmiennymi ma kształt litery U — co w badaniach nad stresem, motywacją czy obciążeniem pracą zdarza się często — Pearson pokaże wartość bliską zeru mimo silnego, oczywistego związku. Dlatego przed policzeniem korelacji zawsze obejrzyj wykres rozrzutu. To jedno spojrzenie ratuje przed wnioskiem „nie stwierdzono związku” w sytuacji, w której związek jest wyraźny, tylko nie prosty.
Krok 7. Zapisz decyzję w rozdziale metodologicznym
Rezultat kroku: akapit, którego recenzent nie zakwestionuje.
Rozdział metodologiczny ma udokumentować drogę, a nie tylko punkt docelowy. Wzór zapisu, który wystarcza:
Zmienna zależna została zmierzona na skali ilościowej jako suma pozycji kwestionariusza. Ze względu na porównanie dwóch niezależnych grup i spełnione założenie o normalności rozkładu w obu grupach (test Shapiro-Wilka, wyniki nieistotne) oraz jednorodności wariancji (test Levene’a, wynik nieistotny) zastosowano test t dla prób niezależnych. Przyjęto poziom istotności α = 0,05. Dla wyniku istotnego obliczono wielkość efektu.
Trzy elementy są tu obowiązkowe: uzasadnienie wyboru testu, podanie przyjętego poziomu istotności i raportowanie wielkości efektu. To ostatnie jest dziś standardem w większości dyscyplin, a jego brak to najczęstsza uwaga recenzenta do rozdziału z wynikami. Sam poziom istotności mówi tylko, czy efekt jest odróżnialny od przypadku; nie mówi, czy jest duży. Progi interpretacyjne wielkości efektu są umowne i różnią się między dyscyplinami, więc zacytuj te przyjęte w twojej — nie przepisuj ich z pierwszego znalezionego poradnika.
Zanim przejdziesz do liczenia, upewnij się, że twój rozdział metodologiczny opisuje też dobór próby i narzędzie. Jeżeli dopiero go budujesz, przyda się zestawienie danych GUS o polskim szkolnictwie wyższym, z którego można wyprowadzić charakterystykę populacji, do której odnosisz swoją próbę.
A jeśli masz już wybrany test i policzone wyniki, ale zdania nie chcą się układać, możesz napisać rozdział metodologiczny w Tesify — struktura jest gotowa, ty uzupełniasz treść merytoryczną.
Najczęściej zadawane pytania
Czy skalę Likerta można analizować testem t?
Sumę lub średnią z kilkunastu pozycji tworzących jedną skalę — tak, i jest to praktyka powszechnie akceptowana. Pojedynczą pozycję z pięcioma odpowiedziami lepiej analizować testem nieparametrycznym. W obu przypadkach uzasadnij decyzję w metodologii, powołując się na sposób konstrukcji narzędzia, a nie na wygodę obliczeniową.
Co zrobić, gdy rozkład nie jest normalny?
Wybierz odpowiednik nieparametryczny z ostatniej kolumny tabeli. Nie jest to gorszy wybór ani przyznanie się do porażki — to po prostu test o innych założeniach. Alternatywą jest transformacja zmiennej, ale wtedy musisz interpretować wyniki na przekształconej skali, co komplikuje opis i bywa źródłem nieporozumień na obronie.
Ile osób potrzebuję, żeby test miał sens?
Nie ma jednej liczby; zależy ona od spodziewanej wielkości efektu, przyjętej mocy i poziomu istotności. Liczebność wyznacza się przed badaniem, w analizie mocy — i właśnie tak należy ją opisać w metodologii. Podawanie okrągłej liczby bez uzasadnienia jest słabym punktem większości prac. Jeżeli badanie już się odbyło, a analizy mocy nie było, uczciwym rozwiązaniem jest omówienie ograniczeń w dyskusji.
Czy muszę kupować program statystyczny?
Nie. Wszystkie testy z tabeli wykonasz w bezpłatnym oprogramowaniu, na przykład w jamovi lub JASP, które mają graficzny interfejs i nie wymagają programowania. Wiele uczelni udostępnia też komercyjne pakiety w ramach licencji dla studentów — sprawdź to na stronie swojego centrum informatycznego, zanim za cokolwiek zapłacisz.
Wynik wyszedł nieistotny. Czy praca jest do wyrzucenia?
Nie. Brak istotnej różnicy jest wynikiem badania, a nie jego brakiem. Rzetelnie opisany wynik negatywny, wraz z dyskusją nad możliwymi przyczynami (za mała próba, nietrafne narzędzie, faktyczny brak efektu), broni się na obronie lepiej niż naciągana istotność.
Czy mogę zrobić kilka testów t zamiast analizy wariancji?
Lepiej nie. Każde dodatkowe porównanie zwiększa prawdopodobieństwo, że jakiś wynik wyjdzie istotny przez przypadek. Wykonaj jeden test dla wszystkich grup, a porównania szczegółowe przeprowadź dopiero po nim, z odpowiednią korektą.
Który test wybrać, gdy zmienna zależna jest porządkowa, a grupy trzy?
Test Kruskala-Wallisa. Jest to nieparametryczny odpowiednik jednoczynnikowej analizy wariancji i nie wymaga założenia o normalności rozkładu.
Czy istotny wynik oznacza, że jedna rzecz powoduje drugą?
Nie. Żaden z testów w tabeli nie wykazuje przyczynowości. Wykazują współwystępowanie albo różnicę między grupami. O przyczynie można mówić tylko wtedy, gdy sam plan badania na to pozwala — czyli przy losowym przydziale do warunków. W badaniu ankietowym przeprowadzonym jednorazowo wniosek przyczynowy jest zawsze nadinterpretacją, niezależnie od tego, jak niskie wyszło p.
