**Transkrypcja wywiadu: poziomy dosłowności i zapis**
Source: https://sozai.app/pl/how-to-transcribe-an-interview/

[Poradniki](https://sozai.app/pl/category/poradniki/)

# Transkrypcja wywiadu: poziomy dosłowności, etykiety rozmówców i zapis

paź 2, 2026  • 10 min read • 11 views  • Ostatnia aktualizacja: paź 2, 2026

![Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook](https://sozai.app/wp-content/uploads/post-how-to-transcribe-an-interview-1280x720.webp)

> ### Najważniejsze
>
>
>
> Zanim wpiszesz pierwsze słowo, zdecyduj o poziomie dosłowności: pełna transkrypcja dosłowna zachowuje każde „yyy” i każdy przerwany początek zdania, transkrypcja czysta oddaje sens bez wtrętów, a wersja redagowana poprawia składnię na potrzeby czytania. Wybierz zapis pauz, nakładających się głosów i fragmentów niesłyszalnych, umieść go jako legendę na początku dokumentu i konsekwentnie opisuj rozmówców. Przy pisaniu ręcznym poradnik historii mówionej Texas Tech University Libraries podaje sześć godzin pisania na godzinę nagrania, a przewodnik kursowy Cornell University — od czterech do sześciu. Automatyczna transkrypcja daje pierwszą wersję w kilka minut; praca człowieka przesuwa się z pisania na sprawdzanie tekstu z nagraniem.

Masz nagranie. Ktoś potrzebuje teraz transkrypcji, którą da się zacytować, zakodować albo oddać do zaliczenia, a pierwsze pytanie nie brzmi „jakiej aplikacji użyć?”, tylko „ile z tej wypowiedzi zachować?”.

Wtrącenia i przerwane zdania mają znaczenie w analizie konwersacji i w niektórych kontekstach prawnych; wszędzie indziej to szum. Ten artykuł omawia trzy poziomy dosłowności, zapis pauz i nakładających się głosów, czas potrzebny na ręczną pracę oraz to, co automatyczna transkrypcja robi dobrze, a co źle, na prawdziwym nagraniu.

## Jak najłatwiej zrobić transkrypcję wywiadu?

Najpierw przepuść nagranie przez silnik zamiany mowy na tekst, potem popraw nazwiska, wyrywkowo porównaj tekst z dźwiękiem i dodaj zapis, którego wymaga twój projekt. To szybsze niż pisanie od pustej kartki i właśnie to większość ludzi ma na myśli, mówiąc „najłatwiej”. Przepisywanie od zera całej godziny rozmowy słowo po słowie to wolna droga, a nie łatwa.

Przy krótkim fragmencie ten pierwszy etap wykona nasze narzędzie w przeglądarce, [transkrypcja wywiadu online](https://sozai.app/pl/tools/transcribe-interview/), bez zakładania konta: wgrywasz nagranie, a ono przepisuje pierwsze 5 minut, oznacza każdą wypowiedź jako Speaker A, Speaker B itd. ze znacznikiem czasu i samo wykrywa język spośród 99 języków. Pliki do 25 MB przechodzą bez zmian; dłuższe nagrania są przycinane do 5 minut w przeglądarce, zanim cokolwiek zostanie wysłane. Dźwięk i transkrypcja są usuwane u dostawcy zaraz po zwróceniu wyniku, a na jednym urządzeniu możesz zrobić trzy podglądy dziennie.

To wystarczy, żeby ocenić, czy narzędzie nadaje się do danego nagrania. Jeśli potrzebujesz całego wywiadu naraz, z opisanymi wypowiedziami od początku do końca i każdą transkrypcją zapisaną potem w przeszukiwalnej bibliotece, robi to aplikacja SozAI — pierwsze 30 minut jest za darmo. Pełny opis znajdziesz w tekście [jak działa transkrypcja wywiadów](https://sozai.app/pl/interview-transcription/) albo od razu [pobierz aplikację](https://sozai.app/pl/download/).

## Czym różni się transkrypcja dosłowna od czystej?

Pełna transkrypcja dosłowna zachowuje każde słowo tak, jak padło: wtrącenia, przerwane początki zdań, powtórzenia, jąkanie i słyszalny śmiech. Transkrypcja czysta zachowuje słowa i sens wypowiedzi, ale pomija wtrącenia, przerwane zdania i przypadkowe powtórzenia. Wersja redagowana idzie krok dalej i porządkuje gramatykę oraz szyk zdań, żeby dobrze się czytała — dlatego właśnie przestaje być dowodem tego, co faktycznie powiedziano.

- Pełna dosłowna: analiza konwersacji, część prac prawnych i dowodowych.
- Czysta: większość badań jakościowych, dziennikarstwo, badania użytkowników.
- Redagowana: publikowane artykuły w formie pytań i odpowiedzi.

| Poziom | Co zachowuje | Typowe zastosowanie |
| --- | --- | --- |
| Pełna dosłowna | Każde słowo tak, jak padło: wtrącenia, przerwane zdania, powtórzenia, jąkanie, słyszalne dźwięki | Analiza konwersacji, część prac prawnych i dowodowych |
| Czysta | Słowa i sens wypowiedzi, bez wtrąceń i przerwanych zdań | Większość badań jakościowych, dziennikarstwo, badania użytkowników |
| Redagowana | Uporządkowana gramatyka i szyk zdań na potrzeby czytania | Publikowane artykuły w formie pytań i odpowiedzi |

Jeśli transkrypcja trafi do projektu badawczego, a nie do publikacji, zdecyduj o tym przed pierwszym wywiadem, a nie po piątym — zmiana poziomu w trakcie oznacza przerabianie wcześniejszych transkrypcji. Stronę badawczą, czyli zgodę, anonimizację i przechowywanie, omawia tekst [transkrypcja wywiadów do badań](https://sozai.app/pl/interview-transcript-for-research/).

## Jak napisać transkrypcję wywiadu?

Zacznij od legendy: poziom dosłowności, używane symbole i sposób oznaczania rozmówców, zapisane na górze dokumentu przed pierwszą linią wypowiedzi. Każdy, kto później koduje lub cytuje transkrypcję, będzie jej potrzebował — ty też, za kilka tygodni, gdy zapomnisz, co miało znaczyć (.).

Najbardziej znany system szczegółowych transkrypcji pochodzi od Gail Jefferson i został opisany w jej tekście [Glossary of transcript symbols with an introduction](https://doi.org/10.1075/pbns.125.02jef) (2004). Jak podsumowują to [Clift, Kendrick, Raymond i Robinson (2024)](https://eprints.whiterose.ac.uk/id/eprint/237652/1/Clift_Kendrick_Raymond_Robinson._2024_-_Jeffersonian_Transcription_conventions.pdf), lewy nawias kwadratowy oznacza miejsce, w którym zaczyna się nakładanie wypowiedzi, znak równości łączy wypowiedzi bez przerwy między nimi, liczba w nawiasie, na przykład (0.5), to odmierzona cisza w sekundach, a (.) oznacza pauzę zbyt krótką, by ją mierzyć. Źródła nie są zgodne co do tego, jak krótka jest mikropauza, więc jeśli twoja legenda używa (.), niech wyjaśnia, co przez to rozumiesz.

Większość projektów wywiadowych nie potrzebuje takiej szczegółowości i lepiej się bez niej czyta. Wystarczy konwencja z nawiasami, która obejmuje to, co faktycznie się zdarza: [inaudible 00:12:31] dla fragmentu, którego nie da się zrozumieć, ze znacznikiem czasu, żeby go potem znaleźć; [crosstalk] tam, gdzie dwie osoby mówią jednocześnie; [laughs] i inne zdarzenia niemowne w nawiasach kwadratowych; oraz etykieta rozmówcy na początku każdej wypowiedzi.

| Symbol | Znaczenie | System |
| --- | --- | --- |
| [ | Miejsce, w którym zaczyna się nakładanie wypowiedzi | Jefferson |
| = | Wypowiedzi połączone bez przerwy (latching) | Jefferson |
| (0.5) | Odmierzona cisza, w sekundach | Jefferson |
| (.) | Pauza zbyt krótka, by ją mierzyć | Jefferson |
| [inaudible 00:12:31] | Fragment, którego nie da się zrozumieć, ze znacznikiem czasu | Nawiasowy |
| [crosstalk] | Dwie osoby mówiące naraz | Nawiasowy |
| [laughs] | Dźwięk niemowny | Nawiasowy |

Poza zapisem, [wytyczne UK Data Service dotyczące transkrypcji](https://dam.ukdataservice.ac.uk/media/187730/transcriptiondm25april2013.pdf) mówią, że transkrypcja powinna mieć unikalny identyfikator, jednolity układ w całym projekcie, znaczniki rozmówców oznaczające zmiany mówiącego i zachowane podziały wierszy — drobiazgi, ale dzięki nim później można znaleźć i porównać transkrypcje, zamiast czytać je wszystkie od nowa.

Etykiety rozmówców to imiona, których oprogramowanie do transkrypcji nie może znać — spodziewaj się Speaker A i Speaker B, które zmienisz ręcznie, gdy już wiadomo, kto jest kim. [Spójne oznaczanie rozmówców](https://sozai.app/pl/who-said-what-transcript/) pokazuje, jak zrobić to w całym projekcie, żeby imiona nie rozjeżdżały się między plikami.

Anonimizuj na bieżąco, nie na końcu: zamieniaj imiona i dane identyfikujące na spójne zastępniki, takie jak [Participant 2] czy [city], od razu w transkrypcji, a legendę przypisującą zastępniki do prawdziwych nazwisk trzymaj w osobnym pliku. Nagrywanie osoby niemal wszędzie wymaga jej zgody, a komisja etyczna zwykle chce mieć tę zgodę na piśmie; przepisanie nagrania tego wymogu nie zmienia.

## Ile trwa transkrypcja wywiadu?

Ręcznie licz godziny, nie minuty. [Poradnik historii mówionej Texas Tech University Libraries](https://guides.library.ttu.edu/c.php?g=1275281&p=9356352) podaje, że nawet doświadczeni transkrybenci zwykle pracują w tempie sześciu godzin pisania na godzinę nagrania. [Przewodnik kursowy Cornell University](https://courses2.cit.cornell.edu/fit117/CP_T.htm) podaje mniej, od czterech do sześciu godzin na godzinę nagrania — różnica wynika głównie z jakości dźwięku i ilości dodawanego po drodze zapisu.

Automatyczna transkrypcja zmienia to, na co idzie czas, ale go nie likwiduje. Pierwsza wersja wraca w kilka minut; zostaje odsłuchanie jej z nagraniem, poprawienie nazwisk i terminów, naprawienie przypisań, gdzie etykiety się pomyliły, oraz dodanie zapisu, którego wymaga projekt. Przy godzinnym wywiadzie to nadal realna praca, tylko innego rodzaju — [ile naprawdę trwa transkrypcja](https://sozai.app/pl/how-long-will-transcription-take/) rozkłada to dokładniej.

## Czy ChatGPT potrafi zrobić transkrypcję wywiadu?

To, czy chatbot zamieni plik audio na tekst, zależy od produktu, ale transkrypcja wywiadu to coś więcej niż tekst: znaczniki czasu, do których można wrócić, i zmiany mówiącego, którym można zaufać — a właśnie do tego zbudowano silnik transkrypcji. Chatbot sprawdza się dopiero po tym kroku, przy porządkowaniu, streszczaniu lub przeformatowaniu transkrypcji, którą już masz.

Tak czy inaczej automatyczny tekst trzeba sprawdzić z nagraniem, zanim go zacytujesz, a tego etapu nie usuwa żadne narzędzie.

Ile sprawdzania wymaga dany silnik, bywa bardzo różne. [Jak dokładna jest transkrypcja AI](https://sozai.app/pl/how-accurate-is-ai-transcription/) opisuje, czego się spodziewać i gdzie błędy zwykle się skupiają.

## W czym myli się prawdziwa automatyczna transkrypcja

Automatyczna transkrypcja to wersja robocza, a najlepiej zobaczyć, co to znaczy, uruchamiając ją i czytając z nagraniem. 2 października 2026 zrobiliśmy dokładnie to, na pierwszych 5 minutach publicznego nagrania, które każdy może porównać z tym artykułem.

Uruchomiliśmy silnik stojący za narzędziem SozAI do wywiadów na pierwszych 5 minutach (300 sekund) podcastu NASA Johnson Space Center Houston We Have a Podcast, odcinek 180, „Artemis Mission Management”, prowadzący Gary Jordan i gość Mike Sarafin — to utwór NASA, więc nie podlega prawu autorskiemu. Wynik: 778 słów, wykryty język angielski i 2 rozmówców. Pierwsze linie w takiej postaci, w jakiej zwrócił je silnik:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

Trzy rzeczy w zaledwie tych pięciu wypowiedziach wymagały przejrzenia przez człowieka. Odliczanie startu o 01:19 i „Launch commit lights are correct. There she goes.” o 01:22 to archiwalny dźwięk startu wmontowany w podcast, a nie głos prowadzącego czy gościa — silnik mimo to przypisał je do Speaker B i Speaker A. „Yeah, right?” na końcu wypowiedzi z 01:36 to w rzeczywistości prowadzący, który wraca do rozmowy; należy do początku następnej wypowiedzi, a nie do końca wypowiedzi gościa. A nazwisko gościa wychodzi tu jako Serafin, choć napisy końcowe odcinka podają Sarafin.

Późniejsza wypowiedź pokazuje, do czego służy transkrypcja czysta. Wynik silnika o 02:51 brzmi: „Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.” Czyszczenie zamienia to na: „You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.” Pełna transkrypcja dosłowna zachowałaby powtórzenia dokładnie tak, jak padły; silnik raczej skłania się ku ich zachowaniu — w całym pliku zostawił większość powtórzeń i przerwanych początków („you’re, you’re right”, „in, in my NASA career”, „That’s, that’s quite a number of”), co stawia jego wynik bliżej transkrypcji dosłownej niż czystej. Jeśli projekt wymaga transkrypcji czystej, zaplanuj etap redakcji bez względu na to, który silnik przygotował wersję roboczą.

Odpowiedzi

## Frequently Asked Questions

Jak najłatwiej zrobić transkrypcję wywiadu?

Przepuść nagranie przez silnik zamiany mowy na tekst, żeby dostać pierwszą wersję, a potem sprawdź ją z dźwiękiem i popraw imiona rozmówców oraz niewyraźne słowa — pisanie od zera ręcznie jest wolniejsze, a nie łatwiejsze. Narzędzie w przeglądarce, takie jak transkrypcja wywiadów SozAI, w kilka chwil i bez konta przygotuje oznaczoną, ze znacznikami czasu wersję pierwszych 5 minut, co wystarcza, żeby ocenić, czy warto puścić cały plik.

Jak powinna wyglądać gotowa transkrypcja wywiadu?

Zaczyna się krótką legendą z poziomem dosłowności, użytym zapisem i sposobem oznaczania rozmówców, a dalej idą oznaczone wypowiedzi, na przykład Speaker A, ze znacznikami czasu. Wytyczne UK Data Service dotyczące transkrypcji dodają, że powinna mieć unikalny identyfikator, jednolity układ, znaczniki rozmówców i podziały wierszy, żeby dało się ją później znaleźć i porównać, zamiast czytać od nowa.

Czy ChatGPT potrafi zrobić transkrypcję wywiadu?

To zależy od produktu i jest to złe narzędzie na pierwszy krok. Transkrypcja wywiadu wymaga znaczników czasu i zmian mówiącego, na których można polegać, a to właśnie wytwarza silnik transkrypcji. Chatbot przydaje się potem, do porządkowania, streszczania lub przeformatowania transkrypcji, którą już masz, a każdy automatyczny tekst i tak trzeba sprawdzić z nagraniem.

Wybrać transkrypcję dosłowną czy czystą?

Pełną dosłowną wybierz do analizy konwersacji albo prac prawnych i dowodowych, gdzie liczy się każde „yyy”, przerwane zdanie i powtórzenie; czystą — do większości badań jakościowych, dziennikarstwa i badań użytkowników, gdzie ważniejszy jest sens niż zacięcia. Zdecyduj przed pierwszym wywiadem, bo zmiana w trakcie oznacza przerabianie wcześniejszych transkrypcji.

Jak oznaczać fragmenty niesłyszalne w transkrypcji?

Zapisz [inaudible] ze znacznikiem czasu, na przykład [inaudible 00:12:31], żeby ty lub ktokolwiek inny mógł później znaleźć to miejsce w nagraniu. Dla nakładających się głosów użyj [crosstalk], a dla dźwięków niemownych, jak śmiech, [laughs] — wszystko w nawiasach kwadratowych, wyjaśnione raz w legendzie na górze transkrypcji.

Ile trwa transkrypcja godzinnego wywiadu?

Ręcznie poradnik historii mówionej Texas Tech University Libraries podaje około sześciu godzin pisania na godzinę nagrania; przewodnik kursowy Cornell University szacuje od czterech do sześciu godzin. Automatyczna transkrypcja zwraca wersję roboczą w kilka minut, a pozostały czas idzie na sprawdzanie jej z nagraniem zamiast na przepisywanie.

![Merey Tleugazin](https://sozai.app/wp-content/themes/sozai/assets/images/merey-tleugazin.webp)

[Merey Tleugazin](https://sozai.app/about/merey/)

Założyciel SozAI. Tworzy narzędzia, które zamieniają mowę w tekst dla profesjonalistów na całym świecie.

- [Instagram](https://instagram.com/mereytleugazin)
- [X](https://x.com/mereytleugazin)

## Powiązane artykuły

- [mar 20 18 min ### Jak korzystać z pisania głosowego w Microsoft Word: kompleksowy przewodnik krok po kroku](https://sozai.app/pl/voice-typing-microsoft-word/)
- [sie 2 10 min ### Jak zrobić transkrypcję, która pokazuje, kto co powiedział](https://sozai.app/pl/who-said-what-transcript/)
- [sie 2 9 min ### Jak zacytować film w pracy pisemnej bez przepisywania go ze słuchu](https://sozai.app/pl/quote-a-video-in-an-essay/)

[![SozAI](https://sozai.app/wp-content/themes/sozai/assets/images/appicon.png) SozAI — Darmowe pobieranie Transkrybuj audio i wideo natychmiast Pobierz aplikację](https://sozai.app/pl/download/)


---
This is the markdown twin of https://sozai.app/pl/how-to-transcribe-an-interview/ — the same content, without the markup.
Published by SozAI (https://sozai.app). Reuse and quotation are allowed with attribution and a link back.
Machine-readable index: https://sozai.app/llms.txt · data API: https://sozai.app/api/
