Programy do transkrypcji wywiadów po polsku: Whisper, Word, Good Tape, Notta i Sonix — porównanie 2026

Masz nagrane wywiady i musisz zamienić je w tekst, zanim w ogóle zaczniesz kodowanie. Poniżej porównanie pięciu rozwiązań, które realnie radzą sobie z polszczyzną, według czterech kryteriów: obsługa języka polskiego, darmowy zakres, to gdzie trafia nagranie z Twoim respondentem, oraz ile pracy zostaje po stronie człowieka.

Tabela porównawcza

Kryterium Whisper (lokalnie) Word / Microsoft 365 Good Tape Notta Sonix
Polski Tak, model wielojęzyczny Tak — „Polski (Polska)” na liście ponad 80 ustawień regionalnych Deklarowane 100 języków Nie potwierdzone na stronie cennika Tak — osobna strona „Transcribe Polish audio and video”
Gdzie trafia nagranie Nigdzie — liczy się na Twoim komputerze OneDrive, folder „Pliki transkrybowane” Serwery w UE, deklaracja zgodności z RODO i ISO 27001 Chmura dostawcy Chmura dostawcy
Darmowy zakres Cały — licencja MIT 300 minut miesięcznie w standardowej subskrypcji Wersja próbna bez karty 120 minut miesięcznie, do 3 minut na nagranie 30 minut próbnych bez karty
Koszt dalej Czas i sprzęt W cenie subskrypcji Plany Pro i Business Pro 8,17 USD/mies. przy płatności rocznej Od 10 USD za godzinę lub 25 USD/mies.
Próg wejścia Wysoki — wiersz poleceń Bardzo niski Niski Bardzo niski Niski

Wszystkie ceny podajemy za stronami dostawców z sierpnia 2026 roku i mogą się zmienić — sprawdź je przed zakupem.

Kryteria, które przyjęliśmy

Pierwsze kryterium jest oczywiste: narzędzie musi rozumieć polski, łącznie z odmianą i z tym, że rozmówca się zacina. Drugie jest mniej oczywiste i ważniejsze — nagranie wywiadu to dane osobowe Twojego respondenta, często wraz z głosem, imieniem i szczegółami z życia. Zasady pisania prac dyplomowych Wydziału Nauk o Zdrowiu Akademii Bialskiej im. Jana Pawła II formułują to wprost: „We wszystkich badaniach ankietowych, opartych na analizie dokumentacji medycznej lub pracach kazuistycznych należy uwzględnić zapisy Ustawy o Ochronie Danych Osobowych (Dz.U. z 2019 r. poz. 1781 z póź.zm.) oraz regulaminy wewnętrzne jednostek systemu ochrony zdrowia”. Wrzucenie takiego pliku do losowego serwisu online jest decyzją, a nie drobiazgiem technicznym.

Trzecie kryterium to darmowy zakres, bo student zwykle ma od kilku do kilkunastu godzin materiału i nie ma budżetu. Czwarte — ile pracy zostaje po maszynie. Żaden z tych systemów nie odda gotowej transkrypcji do wklejenia; każdy oddaje szkic.

Poza zestawieniem zostaje pytanie, czy wywiad był w ogóle właściwą metodą. Jeżeli wahasz się między rozmową a kwestionariuszem, kolejność jest odwrotna niż tu opisana: najpierw narzędzie badawcze, potem narzędzie do transkrypcji. Procedurę budowy kwestionariusza opisujemy osobno w poradniku o tym, jak przygotować ankietę do pracy dyplomowej.

Whisper — darmowy, prywatny, wymagający

Whisper to model rozpoznawania mowy udostępniony przez OpenAI na licencji MIT: „Whisper’s code and model weights are released under the MIT License”. Kluczowa konsekwencja praktyczna jest taka, że uruchamiasz go na własnym komputerze i nagranie nigdzie nie wyjeżdża — to jedyne rozwiązanie w tym zestawieniu, przy którym pytanie o przetwarzanie danych respondenta po prostu nie powstaje.

Do wyboru jest sześć rozmiarów modelu; im większy, tym dokładniejszy i wolniejszy.

Model Parametry Wymagana pamięć VRAM Względna szybkość
tiny 39 M ~1 GB ~10x
base 74 M ~1 GB ~7x
small 244 M ~2 GB ~4x
medium 769 M ~5 GB ~2x
large 1550 M ~10 GB 1x
turbo 809 M ~6 GB ~8x

Model turbo dokumentacja opisuje jako „an optimized version of large-v3 that offers faster transcription speed with a minimal degradation in accuracy” — dla polskich wywiadów to zwykle najlepszy kompromis, jeśli masz kartę graficzną z 6 GB pamięci. Modele z końcówką .en pomiń: są tylko dla angielskiego.

Dokumentacja zastrzega, że „Whisper’s performance varies widely depending on the language”, a rozkład błędów według języków publikuje jako wykres, a nie tabelę liczb. Nie podajemy więc konkretnej wartości WER dla polskiego — nie da się jej odczytać z dokumentacji z pewnością wystarczającą do zacytowania w pracy.

Werdykt: najlepszy wybór, jeśli masz wrażliwe nagrania albo dużo materiału i nie boisz się wiersza poleceń.

Dwie drogi nagrania z wywiadu: transkrypcja lokalna na własnym komputerze albo w chmurze
Pierwsza decyzja nie dotyczy dokładności, tylko tego, czy nagranie z Twoim respondentem w ogóle opuszcza Twój komputer.

Word i Microsoft 365 — narzędzie, które prawdopodobnie już masz

Funkcja Transkrybuj jest wbudowana w Worda i najczęściej mieści się w licencji, którą uczelnia daje studentowi. Microsoft podaje, że obsługuje „ponad 80 ustawień regionalnych”, a na ich liście jest „Polski (Polska)”. Limity są jawne: „maksymalnie 300 minut przekazywanego dźwięku miesięcznie” w standardowej subskrypcji i „maksymalnie 30 000 minut” z licencją Microsoft Copilot. Obsługiwane formaty to „.wav, .mp4, .m4a, .mp3”.

Dwa zastrzeżenia, które łatwo przeoczyć. Po pierwsze, dostępność: „Ta funkcja jest obecnie dostępna tylko w programie Word dla Microsoft 365 w systemie Windows w dzierżawach komercyjnych”, a w wersji przeglądarkowej wymaga „nowej przeglądarki Microsoft Edge lub Chrome”. Jeżeli masz konto prywatne albo pracujesz na Macu, może się nie pojawić. Po drugie, dane: „Nagrania będą przechowywane w folderze Pliki transkrybowane na OneDrive. Możesz je tam usunąć” — czyli plik z głosem respondenta ląduje w chmurze i to Ty musisz po sobie posprzątać.

Werdykt: pierwsze narzędzie do sprawdzenia, bo zwykle nic nie kosztuje. 300 minut to około pięciu godzinnych wywiadów miesięcznie.

Good Tape — kiedy zależy Ci na tym, gdzie leżą pliki

Good Tape deklaruje obsługę 100 języków i jako jedyny w tym zestawieniu robi z lokalizacji danych argument sprzedażowy: „All transcription files are stored securely in the EU, fully GDPR-compliant, and ISO 27001 certified” oraz „We never train AI models on your data”. Dla pracy opartej na wywiadach z ludźmi to jest realna różnica przy opisie procedury w rozdziale metodycznym — możesz napisać, gdzie plik był przetwarzany.

Strona główna nie podaje limitów planu darmowego (mówi o wersji próbnej: „No credit card required. Cancel anytime”), a szczegóły planów Free, Pro i Business odsyła do osobnego cennika. Nie podajemy więc liczb, których nie potwierdziliśmy u źródła.

Werdykt: rozsądny kompromis między wygodą chmury a ostrożnością wobec danych respondentów.

Notta — najniższy próg wejścia, najostrzejszy limit

Notta udostępnia „120 transcription minutes/month” w planie darmowym, ale z twardym ograniczeniem „Up to 3 minutes per conversation”. Trzy minuty to nie jest wywiad — to jest test. Plan Pro kosztuje „$8.17 USD/month” przy płatności rocznej (razem „$97.99”) i daje „1,800 transcription minutes/month” oraz „Up to 5 hours per recording”.

Na stronie cennika nie znaleźliśmy potwierdzenia, jakie języki obsługuje sama transkrypcja — lista w stopce dotyczy wersji językowych serwisu, a to nie to samo. Zanim zapłacisz, sprawdź polski na jednym krótkim pliku.

Werdykt: wygodne, jeśli masz budżet i dużo krótkich nagrań; darmowy plan jest do pracy dyplomowej praktycznie bezużyteczny przez limit trzech minut.

Sonix — rozliczenie za godzinę materiału

Sonix deklaruje „54+ languages” w transkrypcji i prowadzi osobną stronę „Transcribe Polish audio and video”, więc polski jest potwierdzony wprost. Model cenowy jest inny niż u konkurencji: „Pay As You Go” za „$10/hr”, a plany abonamentowe to „Core” za „$25/mo” lub „$275/yr”, „Advanced” za „$50/mo” i „Pro” za „$80/mo”. Konto startowe daje „30 min free trial” i „No credit card required”.

Rozliczenie za godzinę bywa dla studenta korzystniejsze niż abonament: jeżeli masz dwanaście godzin materiału i skończysz w dwa tygodnie, płacisz raz.

Werdykt: najprzewidywalniejszy koszt przy jednorazowym, dużym zrywie transkrypcyjnym.

Wydrukowana transkrypcja wywiadu poprawiana ręcznie przed kodowaniem
Automat oddaje szkic. Przejście po nim ze słuchawkami jest tą częścią pracy, której nie da się zlecić maszynie — i to na niej opiera się później kodowanie.

Czego żadne z tych narzędzi nie zrobi za Ciebie

  • Nie rozpozna, kto mówi, w sposób, któremu można ufać bez sprawdzenia. Przy dwóch głosach o podobnej barwie etykiety mówców trzeba poprawić ręcznie.
  • Nie zapisze wahań, pauz i śmiechu, a w analizie jakościowej to bywa dane, nie szum. Jeżeli Twoja metoda tego wymaga, dopisujesz je sam.
  • Nie zanonimizuje transkryptu. Imiona, nazwy firm i miejscowości musisz zamienić na kody sam, zanim plik trafi gdziekolwiek dalej.
  • Nie poradzi sobie z żargonem branżowym i skrótami — te wymagają jednego przejścia z listą poprawek „znajdź i zamień”.
  • Nie zwolni Cię z odsłuchania nagrania. Przejście po transkrypcie ze słuchawkami jest pierwszym etapem analizy, a nie stratą czasu.

Dla kogo które narzędzie

Twoja sytuacja Wybierz
Wywiady dotyczą zdrowia, pracy albo innych danych wrażliwych Whisper lokalnie
Masz licencję Microsoft 365 z uczelni i do pięciu godzin materiału Word — Transkrybuj
Chcesz wygody chmury, ale musisz opisać w metodzie, gdzie leżą pliki Good Tape
Kilkanaście godzin nagrań do zrobienia w dwa tygodnie Sonix, rozliczenie godzinowe
Krótkie nagrania i potrzeba aplikacji mobilnej Notta, plan płatny

Rekomendacja końcowa

Zacznij od Worda, bo prawdopodobnie już za niego zapłaciłeś, i sprawdź na jednym wywiadzie, czy funkcja w ogóle jest dostępna w Twojej licencji. Jeżeli limit 300 minut Ci nie wystarczy albo nagrania są wrażliwe, przejdź na Whisper uruchamiany lokalnie — jest darmowy i rozwiązuje problem danych osobowych u źródła. Płatnej chmury używaj wtedy, gdy liczy się czas, a nagrania nie zawierają danych, których nie chciałbyś wysłać poza własny dysk.

Gotowy transkrypt to dopiero materiał wejściowy — dalej idzie kodowanie, a to już inna klasa narzędzi niż pakiety statystyczne, które porównujemy w zestawieniu programów do analizy statystycznej w pracy dyplomowej. Samą procedurę doboru rozmówców i opisu narzędzia badawczego rozkładamy w poradniku o tym, jak napisać rozdział metodologiczny. Jeżeli Twoje badanie dotyczy zdrowia, sprawdź najpierw, czy wymaga zgody komisji bioetycznej — decyzja o narzędziu do transkrypcji bywa częścią wniosku.

Tesify przejmuje część, która zaczyna się po transkrypcji: porządkuje strukturę rozdziału z wynikami, pilnuje spójności terminów między cytatami a analizą i trzyma przypisy w jednym formacie. Zacznij pisać pracę w Tesify i wykorzystaj odzyskany czas na odsłuchanie nagrań, a nie na formatowanie.

Najczęstsze pytania

Czy mogę wgrać nagranie wywiadu do darmowego serwisu online?

Technicznie tak, formalnie to jest przetwarzanie danych osobowych respondenta i musi mieścić się w tym, na co respondent wyraził zgodę oraz w regulaminach jednostki, w której prowadzisz badanie. Jeśli nie masz pewności, wybierz transkrypcję lokalną — przy Whisperze nagranie nie opuszcza Twojego komputera.

Ile trwa transkrypcja godzinnego wywiadu?

Automat robi to w kilka–kilkanaście minut, ale korekta zajmuje zwykle więcej niż samo nagranie. Realny budżet czasu to około 1,5–2 godziny pracy na każdą godzinę materiału, i to jest liczba, którą warto wpisać do harmonogramu.

Czy transkrypcja musi być dosłowna?

Zależy od przyjętej metody. W analizie treści zwykle wystarczy zapis dosłowny bez znaczników pauz; w analizie konwersacyjnej potrzebna jest transkrypcja szczegółowa. Decyzję opisujesz w rozdziale metodycznym razem z uzasadnieniem.

Czy Word rozpozna, kto mówi?

Funkcja Transkrybuj rozdziela wypowiedzi na mówców, ale etykiety trzeba nazwać i poprawić samodzielnie. Przy nagraniu z hałasem w tle rozdzielenie bywa zawodne.

Jakie formaty pliku przyjmuje Word?

Microsoft podaje: „Funkcja Transkrybuj obsługuje obecnie formaty .wav, .mp4, .m4a, .mp3”. Dyktafon w telefonie zwykle zapisuje w jednym z nich albo pozwala wybrać.

Czy transkrypt trzeba dołączyć do pracy?

Regulaminy różnią się w tej kwestii. Często do pracy trafia tylko wybór cytatów, a pełne transkrypty zostają u autora jako materiał do wglądu. Ustal to z promotorem przed zebraniem materiału, bo od tego zależy treść zgody, którą podpisuje respondent.

Czy Whisper wymaga karty graficznej?

Mniejsze modele uruchomisz na samym procesorze, tylko wolniej. Dokumentacja podaje zapotrzebowanie na pamięć VRAM od około 1 GB dla modelu tiny do około 10 GB dla large; model turbo potrzebuje około 6 GB.

Czy automatyczna transkrypcja liczy się jako użycie sztucznej inteligencji, które trzeba zadeklarować?

Coraz częściej tak — to narzędzie oparte na modelu uczonym maszynowo, użyte na etapie opracowania materiału badawczego. Zapisz w rozdziale metodycznym nazwę i wersję narzędzia, etap, na którym go użyłeś, oraz to, że transkrypt został przez Ciebie sprawdzony ze słuchu, a następnie sprawdź w regulaminie dyplomowania swojej uczelni, czy nie narzuca własnego wzoru takiej deklaracji.

Czy warto płacić za transkrypcję wykonaną przez człowieka?

Przy kilkunastu godzinach nagrań koszt zwykle przekracza budżet studenta, a poprawianie automatu i tak wymaga odsłuchania. Zlecenie samej transkrypcji nie narusza zasady samodzielności pracy, ale zapisz ten fakt w opisie procedury.