Masz nagrane wywiady i musisz zamienić je w tekst, zanim w ogóle zaczniesz kodowanie. Poniżej porównanie pięciu rozwiązań, które realnie radzą sobie z polszczyzną, według czterech kryteriów: obsługa języka polskiego, darmowy zakres, to gdzie trafia nagranie z Twoim respondentem, oraz ile pracy zostaje po stronie człowieka.
Tabela porównawcza
| Kryterium | Whisper (lokalnie) | Word / Microsoft 365 | Good Tape | Notta | Sonix |
|---|---|---|---|---|---|
| Polski | Tak, model wielojęzyczny | Tak — „Polski (Polska)” na liście ponad 80 ustawień regionalnych | Deklarowane 100 języków | Nie potwierdzone na stronie cennika | Tak — osobna strona „Transcribe Polish audio and video” |
| Gdzie trafia nagranie | Nigdzie — liczy się na Twoim komputerze | OneDrive, folder „Pliki transkrybowane” | Serwery w UE, deklaracja zgodności z RODO i ISO 27001 | Chmura dostawcy | Chmura dostawcy |
| Darmowy zakres | Cały — licencja MIT | 300 minut miesięcznie w standardowej subskrypcji | Wersja próbna bez karty | 120 minut miesięcznie, do 3 minut na nagranie | 30 minut próbnych bez karty |
| Koszt dalej | Czas i sprzęt | W cenie subskrypcji | Plany Pro i Business | Pro 8,17 USD/mies. przy płatności rocznej | Od 10 USD za godzinę lub 25 USD/mies. |
| Próg wejścia | Wysoki — wiersz poleceń | Bardzo niski | Niski | Bardzo niski | Niski |
Wszystkie ceny podajemy za stronami dostawców z sierpnia 2026 roku i mogą się zmienić — sprawdź je przed zakupem.
Kryteria, które przyjęliśmy
Pierwsze kryterium jest oczywiste: narzędzie musi rozumieć polski, łącznie z odmianą i z tym, że rozmówca się zacina. Drugie jest mniej oczywiste i ważniejsze — nagranie wywiadu to dane osobowe Twojego respondenta, często wraz z głosem, imieniem i szczegółami z życia. Zasady pisania prac dyplomowych Wydziału Nauk o Zdrowiu Akademii Bialskiej im. Jana Pawła II formułują to wprost: „We wszystkich badaniach ankietowych, opartych na analizie dokumentacji medycznej lub pracach kazuistycznych należy uwzględnić zapisy Ustawy o Ochronie Danych Osobowych (Dz.U. z 2019 r. poz. 1781 z póź.zm.) oraz regulaminy wewnętrzne jednostek systemu ochrony zdrowia”. Wrzucenie takiego pliku do losowego serwisu online jest decyzją, a nie drobiazgiem technicznym.
Trzecie kryterium to darmowy zakres, bo student zwykle ma od kilku do kilkunastu godzin materiału i nie ma budżetu. Czwarte — ile pracy zostaje po maszynie. Żaden z tych systemów nie odda gotowej transkrypcji do wklejenia; każdy oddaje szkic.
Poza zestawieniem zostaje pytanie, czy wywiad był w ogóle właściwą metodą. Jeżeli wahasz się między rozmową a kwestionariuszem, kolejność jest odwrotna niż tu opisana: najpierw narzędzie badawcze, potem narzędzie do transkrypcji. Procedurę budowy kwestionariusza opisujemy osobno w poradniku o tym, jak przygotować ankietę do pracy dyplomowej.
Whisper — darmowy, prywatny, wymagający
Whisper to model rozpoznawania mowy udostępniony przez OpenAI na licencji MIT: „Whisper’s code and model weights are released under the MIT License”. Kluczowa konsekwencja praktyczna jest taka, że uruchamiasz go na własnym komputerze i nagranie nigdzie nie wyjeżdża — to jedyne rozwiązanie w tym zestawieniu, przy którym pytanie o przetwarzanie danych respondenta po prostu nie powstaje.
Do wyboru jest sześć rozmiarów modelu; im większy, tym dokładniejszy i wolniejszy.
| Model | Parametry | Wymagana pamięć VRAM | Względna szybkość |
|---|---|---|---|
| tiny | 39 M | ~1 GB | ~10x |
| base | 74 M | ~1 GB | ~7x |
| small | 244 M | ~2 GB | ~4x |
| medium | 769 M | ~5 GB | ~2x |
| large | 1550 M | ~10 GB | 1x |
| turbo | 809 M | ~6 GB | ~8x |
Model turbo dokumentacja opisuje jako „an optimized version of large-v3 that offers faster transcription speed with a minimal degradation in accuracy” — dla polskich wywiadów to zwykle najlepszy kompromis, jeśli masz kartę graficzną z 6 GB pamięci. Modele z końcówką .en pomiń: są tylko dla angielskiego.
Dokumentacja zastrzega, że „Whisper’s performance varies widely depending on the language”, a rozkład błędów według języków publikuje jako wykres, a nie tabelę liczb. Nie podajemy więc konkretnej wartości WER dla polskiego — nie da się jej odczytać z dokumentacji z pewnością wystarczającą do zacytowania w pracy.
Werdykt: najlepszy wybór, jeśli masz wrażliwe nagrania albo dużo materiału i nie boisz się wiersza poleceń.

Word i Microsoft 365 — narzędzie, które prawdopodobnie już masz
Funkcja Transkrybuj jest wbudowana w Worda i najczęściej mieści się w licencji, którą uczelnia daje studentowi. Microsoft podaje, że obsługuje „ponad 80 ustawień regionalnych”, a na ich liście jest „Polski (Polska)”. Limity są jawne: „maksymalnie 300 minut przekazywanego dźwięku miesięcznie” w standardowej subskrypcji i „maksymalnie 30 000 minut” z licencją Microsoft Copilot. Obsługiwane formaty to „.wav, .mp4, .m4a, .mp3”.
Dwa zastrzeżenia, które łatwo przeoczyć. Po pierwsze, dostępność: „Ta funkcja jest obecnie dostępna tylko w programie Word dla Microsoft 365 w systemie Windows w dzierżawach komercyjnych”, a w wersji przeglądarkowej wymaga „nowej przeglądarki Microsoft Edge lub Chrome”. Jeżeli masz konto prywatne albo pracujesz na Macu, może się nie pojawić. Po drugie, dane: „Nagrania będą przechowywane w folderze Pliki transkrybowane na OneDrive. Możesz je tam usunąć” — czyli plik z głosem respondenta ląduje w chmurze i to Ty musisz po sobie posprzątać.
Werdykt: pierwsze narzędzie do sprawdzenia, bo zwykle nic nie kosztuje. 300 minut to około pięciu godzinnych wywiadów miesięcznie.
Good Tape — kiedy zależy Ci na tym, gdzie leżą pliki
Good Tape deklaruje obsługę 100 języków i jako jedyny w tym zestawieniu robi z lokalizacji danych argument sprzedażowy: „All transcription files are stored securely in the EU, fully GDPR-compliant, and ISO 27001 certified” oraz „We never train AI models on your data”. Dla pracy opartej na wywiadach z ludźmi to jest realna różnica przy opisie procedury w rozdziale metodycznym — możesz napisać, gdzie plik był przetwarzany.
Strona główna nie podaje limitów planu darmowego (mówi o wersji próbnej: „No credit card required. Cancel anytime”), a szczegóły planów Free, Pro i Business odsyła do osobnego cennika. Nie podajemy więc liczb, których nie potwierdziliśmy u źródła.
Werdykt: rozsądny kompromis między wygodą chmury a ostrożnością wobec danych respondentów.
Notta — najniższy próg wejścia, najostrzejszy limit
Notta udostępnia „120 transcription minutes/month” w planie darmowym, ale z twardym ograniczeniem „Up to 3 minutes per conversation”. Trzy minuty to nie jest wywiad — to jest test. Plan Pro kosztuje „$8.17 USD/month” przy płatności rocznej (razem „$97.99”) i daje „1,800 transcription minutes/month” oraz „Up to 5 hours per recording”.
Na stronie cennika nie znaleźliśmy potwierdzenia, jakie języki obsługuje sama transkrypcja — lista w stopce dotyczy wersji językowych serwisu, a to nie to samo. Zanim zapłacisz, sprawdź polski na jednym krótkim pliku.
Werdykt: wygodne, jeśli masz budżet i dużo krótkich nagrań; darmowy plan jest do pracy dyplomowej praktycznie bezużyteczny przez limit trzech minut.
Sonix — rozliczenie za godzinę materiału
Sonix deklaruje „54+ languages” w transkrypcji i prowadzi osobną stronę „Transcribe Polish audio and video”, więc polski jest potwierdzony wprost. Model cenowy jest inny niż u konkurencji: „Pay As You Go” za „$10/hr”, a plany abonamentowe to „Core” za „$25/mo” lub „$275/yr”, „Advanced” za „$50/mo” i „Pro” za „$80/mo”. Konto startowe daje „30 min free trial” i „No credit card required”.
Rozliczenie za godzinę bywa dla studenta korzystniejsze niż abonament: jeżeli masz dwanaście godzin materiału i skończysz w dwa tygodnie, płacisz raz.
Werdykt: najprzewidywalniejszy koszt przy jednorazowym, dużym zrywie transkrypcyjnym.

Czego żadne z tych narzędzi nie zrobi za Ciebie
- Nie rozpozna, kto mówi, w sposób, któremu można ufać bez sprawdzenia. Przy dwóch głosach o podobnej barwie etykiety mówców trzeba poprawić ręcznie.
- Nie zapisze wahań, pauz i śmiechu, a w analizie jakościowej to bywa dane, nie szum. Jeżeli Twoja metoda tego wymaga, dopisujesz je sam.
- Nie zanonimizuje transkryptu. Imiona, nazwy firm i miejscowości musisz zamienić na kody sam, zanim plik trafi gdziekolwiek dalej.
- Nie poradzi sobie z żargonem branżowym i skrótami — te wymagają jednego przejścia z listą poprawek „znajdź i zamień”.
- Nie zwolni Cię z odsłuchania nagrania. Przejście po transkrypcie ze słuchawkami jest pierwszym etapem analizy, a nie stratą czasu.
Dla kogo które narzędzie
| Twoja sytuacja | Wybierz |
|---|---|
| Wywiady dotyczą zdrowia, pracy albo innych danych wrażliwych | Whisper lokalnie |
| Masz licencję Microsoft 365 z uczelni i do pięciu godzin materiału | Word — Transkrybuj |
| Chcesz wygody chmury, ale musisz opisać w metodzie, gdzie leżą pliki | Good Tape |
| Kilkanaście godzin nagrań do zrobienia w dwa tygodnie | Sonix, rozliczenie godzinowe |
| Krótkie nagrania i potrzeba aplikacji mobilnej | Notta, plan płatny |
Rekomendacja końcowa
Zacznij od Worda, bo prawdopodobnie już za niego zapłaciłeś, i sprawdź na jednym wywiadzie, czy funkcja w ogóle jest dostępna w Twojej licencji. Jeżeli limit 300 minut Ci nie wystarczy albo nagrania są wrażliwe, przejdź na Whisper uruchamiany lokalnie — jest darmowy i rozwiązuje problem danych osobowych u źródła. Płatnej chmury używaj wtedy, gdy liczy się czas, a nagrania nie zawierają danych, których nie chciałbyś wysłać poza własny dysk.
Gotowy transkrypt to dopiero materiał wejściowy — dalej idzie kodowanie, a to już inna klasa narzędzi niż pakiety statystyczne, które porównujemy w zestawieniu programów do analizy statystycznej w pracy dyplomowej. Samą procedurę doboru rozmówców i opisu narzędzia badawczego rozkładamy w poradniku o tym, jak napisać rozdział metodologiczny. Jeżeli Twoje badanie dotyczy zdrowia, sprawdź najpierw, czy wymaga zgody komisji bioetycznej — decyzja o narzędziu do transkrypcji bywa częścią wniosku.
Tesify przejmuje część, która zaczyna się po transkrypcji: porządkuje strukturę rozdziału z wynikami, pilnuje spójności terminów między cytatami a analizą i trzyma przypisy w jednym formacie. Zacznij pisać pracę w Tesify i wykorzystaj odzyskany czas na odsłuchanie nagrań, a nie na formatowanie.
Najczęstsze pytania
Czy mogę wgrać nagranie wywiadu do darmowego serwisu online?
Technicznie tak, formalnie to jest przetwarzanie danych osobowych respondenta i musi mieścić się w tym, na co respondent wyraził zgodę oraz w regulaminach jednostki, w której prowadzisz badanie. Jeśli nie masz pewności, wybierz transkrypcję lokalną — przy Whisperze nagranie nie opuszcza Twojego komputera.
Ile trwa transkrypcja godzinnego wywiadu?
Automat robi to w kilka–kilkanaście minut, ale korekta zajmuje zwykle więcej niż samo nagranie. Realny budżet czasu to około 1,5–2 godziny pracy na każdą godzinę materiału, i to jest liczba, którą warto wpisać do harmonogramu.
Czy transkrypcja musi być dosłowna?
Zależy od przyjętej metody. W analizie treści zwykle wystarczy zapis dosłowny bez znaczników pauz; w analizie konwersacyjnej potrzebna jest transkrypcja szczegółowa. Decyzję opisujesz w rozdziale metodycznym razem z uzasadnieniem.
Czy Word rozpozna, kto mówi?
Funkcja Transkrybuj rozdziela wypowiedzi na mówców, ale etykiety trzeba nazwać i poprawić samodzielnie. Przy nagraniu z hałasem w tle rozdzielenie bywa zawodne.
Jakie formaty pliku przyjmuje Word?
Microsoft podaje: „Funkcja Transkrybuj obsługuje obecnie formaty .wav, .mp4, .m4a, .mp3”. Dyktafon w telefonie zwykle zapisuje w jednym z nich albo pozwala wybrać.
Czy transkrypt trzeba dołączyć do pracy?
Regulaminy różnią się w tej kwestii. Często do pracy trafia tylko wybór cytatów, a pełne transkrypty zostają u autora jako materiał do wglądu. Ustal to z promotorem przed zebraniem materiału, bo od tego zależy treść zgody, którą podpisuje respondent.
Czy Whisper wymaga karty graficznej?
Mniejsze modele uruchomisz na samym procesorze, tylko wolniej. Dokumentacja podaje zapotrzebowanie na pamięć VRAM od około 1 GB dla modelu tiny do około 10 GB dla large; model turbo potrzebuje około 6 GB.
Czy automatyczna transkrypcja liczy się jako użycie sztucznej inteligencji, które trzeba zadeklarować?
Coraz częściej tak — to narzędzie oparte na modelu uczonym maszynowo, użyte na etapie opracowania materiału badawczego. Zapisz w rozdziale metodycznym nazwę i wersję narzędzia, etap, na którym go użyłeś, oraz to, że transkrypt został przez Ciebie sprawdzony ze słuchu, a następnie sprawdź w regulaminie dyplomowania swojej uczelni, czy nie narzuca własnego wzoru takiej deklaracji.
Czy warto płacić za transkrypcję wykonaną przez człowieka?
Przy kilkunastu godzinach nagrań koszt zwykle przekracza budżet studenta, a poprawianie automatu i tak wymaga odsłuchania. Zlecenie samej transkrypcji nie narusza zasady samodzielności pracy, ale zapisz ten fakt w opisie procedury.
