Bank Danych Lokalnych GUS udostępnia dane w 33 obszarach tematycznych dla 4694 jednostek terytorialnych, a jego interfejs programistyczny jest otwarty i nie wymaga rejestracji ani klucza. Dla ogromnej części prac dyplomowych oznacza to, że dane potrzebne do rozdziału empirycznego już istnieją — i są dokładniejsze niż wszystko, co da się zebrać własną ankietą w trzy tygodnie.
Ten tekst jest o danych zastanych: kiedy warto po nie sięgnąć zamiast prowadzić badanie własne, gdzie ich szukać i jak opisać ich pochodzenie tak, żeby recenzent nie miał zastrzeżeń.
Kiedy dane zastane biją badanie własne
Praca oparta na danych zastanych nie jest pracą „gorszą” ani „na skróty”. Jest innym typem pracy, i w trzech sytuacjach jest wyborem wyraźnie lepszym.
Po pierwsze, gdy twoje pytanie dotyczy zjawiska w skali kraju, województwa albo powiatu. Żadna studencka ankieta nie da wiarygodnego obrazu bezrobocia w powiecie — a statystyka publiczna daje go dla wszystkich powiatów naraz, w szeregu czasowym.
Po drugie, gdy interesuje cię zmiana w czasie. Badanie jednorazowe pokazuje jeden moment. Dane zastane sięgają wstecz o kilkanaście lat, co pozwala postawić pytanie o trend, a nie tylko o stan.
Po trzecie, gdy dostęp do respondentów jest realnie trudny — bo trzeba by pytać lekarzy, sędziów albo przedsiębiorców, a odsetek odpowiedzi w takich grupach bywa bliski zeru.
Jest też sytuacja odwrotna, w której dane zastane nie pomogą: gdy pytasz o postawy, motywacje, przekonania albo doświadczenia. Statystyka publiczna liczy zdarzenia i stany, a nie to, co ludzie myślą. Jeżeli twoje pytanie zaczyna się od „dlaczego respondenci uważają”, żadna baza tego nie zawiera i badanie własne jest jedyną drogą.
Bank Danych Lokalnych: co tam jest
BDL jest największą bazą danych regionalnych statystyki publicznej. Dane są uporządkowane w 33 obszary tematyczne, wśród których znajdują się między innymi: Ludność, Rynek pracy, Ceny, Finanse publiczne, Ochrona zdrowia, opieka społeczna i świadczenia na rzecz rodziny, Kultura, Przemysł i budownictwo, Nauka i technika, Gospodarka mieszkaniowa i komunalna, Podmioty gospodarki narodowej, Organizacja państwa i wymiar sprawiedliwości, Leśnictwo i łowiectwo oraz Narodowe Spisy Powszechne.
Drugim wymiarem jest terytorium. Baza obejmuje 4694 jednostki terytorialne, ułożone hierarchicznie od poziomu zerowego, którym jest Polska, przez regiony, województwa, podregiony i powiaty aż po gminy. Dzięki tej hierarchii możesz porównywać jednostki tego samego szczebla albo zestawiać jedną gminę z jej powiatem i województwem.
To zestawienie dwóch wymiarów — 33 obszary razy tysiące jednostek razy szereg lat — jest tym, co czyni BDL narzędziem dla pracy dyplomowej. Pytanie „czy gminy o wyższych dochodach własnych mają lepiej rozwiniętą infrastrukturę kulturalną” jest do rozstrzygnięcia w jedno popołudnie, bez zbierania czegokolwiek.
API: dane bez klikania
BDL udostępnia otwarty interfejs programistyczny. Zapytanie o listę obszarów tematycznych ma postać adresu z parametrem formatu i języka i zwraca dane w formacie JSON, bez logowania i bez klucza dostępu. Analogicznie pobiera się listę jednostek terytorialnych oraz same wartości wskaźników.
Nie musisz umieć programować, żeby z tego skorzystać. Adres zapytania można wkleić do przeglądarki i zobaczyć wynik, a większość arkuszy kalkulacyjnych i środowisk statystycznych potrafi pobrać dane wprost z takiego adresu. Jeżeli pracujesz w R, istnieją gotowe pakiety obsługujące to API.
Przewaga API nad ręcznym pobieraniem plików jest jedna, ale istotna: odtwarzalność. Zapisane zapytanie jest dokumentacją tego, skąd wzięły się liczby. Gdy promotor poprosi o dołożenie jednego roku albo jednego powiatu, zmieniasz parametr zamiast powtarzać całą sesję klikania. To ta sama zasada, o której piszemy w kontekście wyboru programu do analizy statystycznej — analiza, której nie da się powtórzyć, jest analizą tymczasową.

Publikacje tematyczne GUS: tablice, nie tylko komunikaty
Drugim źródłem są opracowania tematyczne publikowane na stronie GUS. Kluczowa wskazówka praktyczna: nie zatrzymuj się na informacji sygnalnej. Do każdej publikacji dołączane są tablice w formatach XLSX i CSV, a to właśnie one zawierają dane w rozbiciu, którego potrzebujesz.
Przykład z obszaru szkolnictwa wyższego: obok kilkustronicowej informacji sygnalnej publikowana jest tablica ze studentami i absolwentami według województw, uczelni, grup, podgrup i nazw kierunków studiów. Informacja sygnalna poda ci wartość ogólnopolską; tablica pozwoli napisać pracę o jednej uczelni albo jednym kierunku. Same wartości zbiorcze zebraliśmy w zestawieniu danych o studentach w Polsce.
Uwaga nawigacyjna: nie zgaduj adresów podstron GUS. Struktura odnośników zawiera identyfikatory numeryczne i podmiana roku w adresie prowadzi do zupełnie innej publikacji, która otworzy się poprawnie i nie zasygnalizuje błędu. Zawsze przechodź przez spis obszarów tematycznych.
Dane resortowe i rejestry branżowe
Poza statystyką publiczną istnieje warstwa, do której studenci sięgają rzadko, a która często zawiera dokładnie to, czego potrzebują: dane gromadzone przez poszczególne resorty i instytucje w ramach ich zadań ustawowych.
Przykładem najbliższym tematyce uczelnianej jest Zintegrowany System Informacji o Nauce i Szkolnictwie Wyższym POL-on, na którego podstawie GUS ustala liczbę działających uczelni. Analogiczne systemy dziedzinowe prowadzą inne resorty — dane o zamówieniach publicznych, o wymiarze sprawiedliwości, o ochronie środowiska czy o rynku pracy powstają jako produkt uboczny administrowania i bywają bogatsze niż opracowania zbiorcze.
Reguła wyszukiwania jest prosta: zastanów się, która instytucja musi zbierać te dane, żeby wykonywać swoje zadania. Jeżeli jakaś czynność wymaga rejestracji, zgłoszenia albo sprawozdania, gdzieś istnieje jej rejestr. To pytanie prowadzi do źródeł szybciej niż wpisywanie tematu w wyszukiwarkę.
Jak sprawdzić, czy źródło nadaje się do cytowania
Zanim zbudujesz rozdział na jakimkolwiek zbiorze, przejdź przez cztery pytania. Zajmuje to kwadrans i ratuje przed sytuacją, w której na tydzień przed obroną okazuje się, że podstawa empiryczna pracy jest nie do obrony.
- Kto jest gestorem danych? Instytucja odpowiedzialna za zbiór musi być nazwana z imienia. „Dane z internetu” nie jest źródłem. Jeżeli nie potrafisz wskazać podmiotu, który te dane wytworzył, nie używaj ich.
- Za jaki okres i według jakiego stanu? Dane roczne bywają podawane według stanu na konkretny dzień albo jako suma z całego roku. To dwie różne wielkości i mieszanie ich w jednym zestawieniu jest błędem.
- Czy to wyniki wstępne czy ostateczne? Publikacje statystyczne często ukazują się najpierw w wersji wstępnej. Jeżeli cytujesz wersję wstępną, napisz o tym — inaczej twoje liczby przestaną się zgadzać z bazą, gdy ktoś je sprawdzi po korekcie.
- Czy definicja odpowiada twojemu pytaniu? To pytanie zadaje się na końcu, ale rozstrzyga najczęściej. Wskaźnik o pasującej nazwie może mierzyć coś innego, niż zakładasz.
Trzy pułapki, na które trzeba uważać
Portal, który wygląda na działający, a nie da się z niego nic odczytać. Część serwisów publicznych to aplikacje jednostronicowe: strona ładuje się poprawnie, ale jej treść powstaje dopiero w przeglądarce. Konsekwencja dla ciebie jest praktyczna — takich stron nie zarchiwizujesz prostym zapisem i nie pobierzesz automatycznie. Jeżeli serwis ma udokumentowane API, korzystaj z niego; jeżeli nie, pobierz plik do eksportu i zapisz go lokalnie razem z datą pobrania.
Definicja zmiennej, która nie jest tym, czym się wydaje. „Liczba studentów”, „bezrobotny”, „gospodarstwo domowe” — każde z tych pojęć ma w statystyce publicznej precyzyjną definicję, często odbiegającą od potocznej. Zanim użyjesz wskaźnika, przeczytaj jego definicję w metainformacjach. To najczęstsze źródło błędnych wniosków w pracach opartych na danych zastanych.
Zmiana metodologii w środku szeregu czasowego. Jeżeli w twoim wykresie pojawia się nagły skok, sprawdź najpierw, czy nie zmieniła się definicja albo klasyfikacja, a dopiero potem szukaj wyjaśnienia merytorycznego. Instytucje statystyczne odnotowują takie zmiany w uwagach metodologicznych — i to jest jedyne miejsce, w którym to znajdziesz.
Jak opisać dane zastane w rozdziale metodologicznym
Rozdział metodologiczny pracy opartej na danych zastanych zawiera te same elementy co przy badaniu własnym, ale wypełnione inną treścią. Zamiast opisu narzędzia opisujesz źródło: nazwę bazy, gestora danych, zakres czasowy, poziom agregacji i datę pobrania. Zamiast doboru próby opisujesz kryteria selekcji jednostek: które gminy, lata i wskaźniki weszły do analizy i dlaczego pominąłeś pozostałe.
Data pobrania jest obowiązkowa. Bazy statystyczne są aktualizowane, a wartości bywają korygowane z wyników wstępnych na ostateczne. Bez daty pobrania nikt nie odtworzy twojego zbioru, nawet mając dostęp do tej samej bazy. Pozostałe elementy rozdziału opisaliśmy w tekście o tym, jak napisać rozdział metodologiczny.
W sekcji ograniczeń wskaż to, co przy danych zastanych jest nieuniknione: nie miałeś wpływu na to, co i jak zmierzono. Dane powstały w innym celu niż twoje pytanie badawcze i mogą nie obejmować zmiennych, które teoretycznie powinny znaleźć się w modelu.
Jeżeli masz już pobrane pliki, a brakuje ci struktury tekstu, możesz zbudować pracę w Tesify — narzędzie prowadzi przez kolejne rozdziały i pilnuje, żeby każde źródło trafiło do bibliografii. Treść merytoryczna pozostaje twoja w stu procentach.
Najczęściej zadawane pytania
Czy praca na danych zastanych jest akceptowana na obronie?
Tak, jest to pełnoprawny typ pracy empirycznej, powszechny zwłaszcza w ekonomii, gospodarce przestrzennej, socjologii i naukach o zarządzaniu. Warunkiem jest własna analiza, a nie samo przytoczenie cudzych zestawień.
Czy korzystanie z API BDL wymaga rejestracji?
Nie. Interfejs jest otwarty i odpowiada na zapytania bez klucza dostępu. Przy bardzo intensywnym pobieraniu warto jednak zapoznać się z zasadami korzystania opublikowanymi przez GUS.
Jak zacytować dane pobrane z bazy statystycznej?
Podaj nazwę bazy, instytucję ją prowadzącą, identyfikator lub nazwę wskaźnika, zakres terytorialny i czasowy oraz datę dostępu. Przy własnych przeliczeniach dodaj adnotację o opracowaniu własnym na podstawie danych źródłowych.
Czy mogę połączyć dane zastane z własną ankietą?
Tak i bywa to bardzo mocne rozwiązanie: dane publiczne opisują kontekst, a ankieta dostarcza zmiennych, których statystyka publiczna nie zbiera. Opisz wtedy oba źródła osobno i wyjaśnij, na jakim poziomie je łączysz.
Co zrobić, gdy dla mojej gminy brakuje danych?
Braki na najniższym poziomie agregacji zwykle wynikają z tajemnicy statystycznej — wartości nie publikuje się, gdy mogłaby ujawnić dane pojedynczego podmiotu. Rozwiązaniem jest przejście o szczebel wyżej albo połączenie jednostek w grupy. Nie zastępuj brakującej wartości zerem.
Czy dane z BDL są aktualne?
Zależy od wskaźnika. Część jest publikowana rocznie z opóźnieniem wynikającym z cyklu sprawozdawczego, część kwartalnie lub półrocznie. Zawsze sprawdź ostatni dostępny rok dla konkretnego wskaźnika, zanim zaplanujesz zakres czasowy analizy.
Czy potrzebuję zgody na wykorzystanie danych publicznych w pracy?
Dane publikowane przez statystykę publiczną można wykorzystywać, podając źródło zgodnie z zasadami wskazanymi przez instytucję. Inaczej wygląda sytuacja przy danych jednostkowych i mikrodanych, których udostępnianie odbywa się w odrębnym trybie i wymaga wniosku.
Od czego zacząć, jeśli nie mam jeszcze tematu?
Odwróć kolejność: przejrzyj listę obszarów tematycznych i sprawdź, co jest mierzone dla twojego regionu. Temat wyrastający z dostępnych danych ma tę przewagę, że na pewno da się go zbadać — czego nie można powiedzieć o temacie wymyślonym najpierw.
Ile wskaźników powinienem wziąć do analizy?
Tyle, ile wynika z pytania badawczego, i ani jednego więcej. Pokusa przy danych zastanych jest odwrotna niż przy ankiecie: skoro wszystko jest dostępne za darmo, łatwo pobrać kilkadziesiąt zmiennych i zacząć szukać w nich zależności. Taka analiza prawie zawsze znajdzie coś istotnego przez przypadek. Wybierz wskaźniki przed pobraniem danych i zapisz tę listę — to twoja ochrona przed wnioskiem, którego nie da się obronić.
