Перейти до вмісту

Як транскрибувати інтерв’ю: рівні дослівності, позначки мовців і нотація

•2 min read• 11 views •Останнє оновлення: Жов 2, 2026
Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook

Головне

Вирішіть рівень дослівності, перш ніж набирати хоч слово: повна дослівність зберігає кожне «е-е» і хибний початок, чиста дослівність зберігає зміст без слів-паразитів, а відредагований транскрипт приводить до ладу граматику для читання. Виберіть нотацію для пауз, накладань і нерозбірливих місць, запишіть її як ключ на початку документа та послідовно позначайте мовців. Вручну, за посібником із усної історії бібліотек Texas Tech University, це шість годин набору на годину запису; за посібником курсу Cornell University — від чотирьох до шести. Автоматичний транскрипт дає першу чернетку за хвилини; людська робота зміщується з набору на звірку із записом.

У вас є запис. Тепер комусь потрібен транскрипт, який можна цитувати, кодувати чи здавати, і перше питання — не яким застосунком користуватися, а скільки мовлення ви збережете.

Слова-паразити й хибні початки важливі в аналізі розмови та в деяких юридичних контекстах; в інших місцях це шум. У цій статті — три рівні дослівності, нотація, що позначає паузи й накладання, скільки триває робота вручну та що автоматичний транскрипт робить правильно й неправильно на реальному записі.

Який найпростіший спосіб транскрибувати інтерв’ю?

Спершу пропустіть запис через рушій перетворення мовлення на текст, потім виправте імена, вибірково звірте з аудіо й додайте нотацію, потрібну вашому проєкту — це швидше, ніж набирати з чистого аркуша, і саме це більшість людей насправді має на увазі під «найпростішим». Набирати годину мовлення з нуля слово в слово — повільний шлях, а не простий.

Для короткого фрагмента наш браузерний інструмент транскрибація інтерв’ю онлайн робить цей перший прохід без акаунта: завантажте запис — і він розшифрує перші 5 хвилин, позначить кожну репліку як Speaker A, Speaker B і так далі з таймкодом та автоматично визначить мову серед 99 мов. Файли до 25 MB проходять як є; довші записи обрізаються до 5 хвилин у браузері, перш ніж щось надсилається. Аудіо й транскрипт видаляються в постачальника, щойно приходить результат, а попередніх переглядів — три на пристрій на добу.

Цього досить, щоб побачити, чи варто користуватися інструментом для певного запису. Для цілого інтерв’ю за один прохід, із позначками реплік на всьому протязі та кожним транскриптом, що потім лежить у бібліотеці з пошуком, це робить застосунок SozAI — перші 30 хвилин безкоштовні. Дивіться як працює транскрибація інтерв’ю для повної картини або завантажте застосунок.

У чому різниця між дослівною та чистою дослівною транскрипцією?

Повна дослівна зберігає кожне слово, як воно прозвучало: «е-е», хибні початки, повторювані слова, затинання та чутний сміх. Чиста дослівна зберігає слова й зміст мовця, але прибирає слова-паразити, хибні початки та випадкові повтори. Відредагований транскрипт іде ще далі й приводить до ладу граматику та порядок речень, щоб добре читатися, — і саме тому перестає годитися як доказ того, що насправді було сказано.

  • Повна дослівна: аналіз розмови, деяка юридична та доказова робота.
  • Чиста дослівна: більшість якісних досліджень, журналістика, дослідження користувачів.
  • Відредагований: опубліковані статті у форматі запитань і відповідей.
Три рівні дослівності та що зберігає кожен
РівеньЩо зберігаєТипове застосування
Повна дослівнаКожне слово, як воно прозвучало: слова-паразити, хибні початки, повтори, затинання, чутні звукиАналіз розмови, деяка юридична та доказова робота
Чиста дослівнаСлова й зміст мовця, слова-паразити та хибні початки прибраноБільшість якісних досліджень, журналістика, дослідження користувачів
ВідредагованаПриведена до ладу граматика й порядок речень для читанняОпубліковані статті у форматі запитань і відповідей

Якщо транскрипт піде в дослідницький проєкт, а не в опублікований матеріал, вирішіть це до першого інтерв’ю, а не після п’ятого — зміна рівнів посередині означає переробляти попередні транскрипти під єдиний стиль. Дослідницьку сторону — згоду, анонімізацію та зберігання — розглянуто в матеріалі транскрибація інтерв’ю для досліджень.

Як написати транскрипт інтерв’ю?

Почніть із ключа: рівень дослівності, символи, якими ви користуєтеся, і спосіб позначення мовців, записані на початку документа перед першим рядком мовлення. Кожному, хто потім кодуватиме чи цитуватиме транскрипт, потрібен цей ключ, а вам він знадобиться за кілька тижнів, коли ви забудете, що мало означати (.).

Найвідоміша система детальних транскриптів походить від Гейл Джефферсон і викладена в її Glossary of transcript symbols with an introduction (2004). Як підсумовують Кліфт, Кендрік, Реймонд і Робінсон (2024), ліва квадратна дужка позначає момент, де починається накладання мовлення, знак рівності з’єднує мовлення без проміжку між ним, число в дужках, як-от (0.5), — це виміряна тиша в секундах, а (.) — паузу, надто коротку для вимірювання. Джерела не збігаються в тому, наскільки коротка мікропауза, тож якщо ваш ключ використовує (.), він має пояснювати, що ви під цим розумієте.

Більшості проєктів з інтерв’ю така деталізація не потрібна, і без неї легше читати. Дужкова конвенція охоплює те, що справді трапляється: [inaudible 00:12:31] для місця, яке не розібрати, з таймкодом, щоб його можна було знайти знову; [crosstalk] там, де двоє говорять одночасно; [laughs] та інші неголосові події в квадратних дужках; і позначка мовця на початку кожної репліки.

Нотація транскрипту: символи Джефферсон і легша дужкова конвенція
СимволЗначенняСистема
[Момент, де починається накладання мовленняЗа Джефферсон
=Мовлення без проміжку (зчеплення)За Джефферсон
(0.5)Виміряна тиша, у секундахЗа Джефферсон
(.)Пауза, надто коротка для вимірюванняЗа Джефферсон
[inaudible 00:12:31]Місце, яке не розібрати, із таймкодомДужкова
[crosstalk]Двоє говорять одночасноДужкова
[laughs]Неголосовий звукДужкова

Крім нотації, рекомендації UK Data Service щодо транскрибації кажуть, що транскрипт має мати унікальний ідентифікатор, мати однакове оформлення в усьому проєкті, використовувати теги мовців для зміни реплік і зберігати розриви рядків — дрібниці, але саме вони дають змогу пізніше знаходити й порівнювати транскрипти замість того, щоб перечитувати їх усі.

Позначки мовців — це імена, яких програма транскрибації знати не може: очікуйте Speaker A і Speaker B, які ви перейменуєте вручну, коли дізнаєтеся, хто є хто. Матеріал послідовне позначення мовців розповідає, як зробити це в усьому проєкті, щоб імена не розходилися між файлами.

Анонімізуйте по ходу, а не потім: замінюйте імена й ідентифікаційні подробиці послідовними заповнювачами на кшталт [Participant 2] чи [city] прямо в транскрипті, а ключ, що зіставляє заповнювачі зі справжніми іменами, зберігайте в окремому файлі. Записувати людину майже скрізь потрібна її згода, а етична комісія дослідження зазвичай хоче цю згоду письмово; транскрибація запису цієї вимоги не змінює.

Скільки триває транскрибація інтерв’ю?

Вручну плануйте години, а не хвилини. Посібник із усної історії бібліотек Texas Tech University каже, що навіть досвідчені транскрибатори зазвичай працюють із розрахунку шість годин набору на кожну годину аудіо. Посібник курсу Cornell University називає менше — від чотирьох до шести годин на годину запису; різниця здебільшого залежить від того, наскільки чисте аудіо та скільки нотації додається по дорозі.

Автоматичний транскрипт змінює, куди йде час, а не прибирає його. Чернетка повертається за хвилини; лишається прослухати її зі звіркою із записом, виправити імена й технічні терміни, виправити, хто що сказав, там, де позначки перепуталися, і додати нотацію, потрібну проєкту. Для одногодинного інтерв’ю це все ще справжня робота, лише іншого роду, — скільки насправді триває транскрибація розбирає це докладніше.

Чи може ChatGPT транскрибувати інтерв’ю?

Чи може чат-бот перетворити аудіофайл на текст, залежить від продукту, але транскрипту інтерв’ю потрібно більше, ніж текст: таймкоди, до яких можна повернутися, і репліки мовців, яким можна довіряти, — саме це створює рушій транскрибації. Місце чат-бота — після цього кроку: привести до ладу, стиснути чи переформатувати транскрипт, який у вас уже є.

Так чи інакше, автоматичний текст треба звірити із записом, перш ніж цитувати, і саме цю перевірку не прибирає жоден інструмент.

Скільки перевірки потрібно конкретному рушію, помітно різниться. Наскільки точна транскрибація ШІ розповідає, чого чекати й де помилки зазвичай скупчуються.

Що автоматичний транскрипт робить неправильно на реальному записі

Автоматичний транскрипт — це чернетка, і найкраще зрозуміти, що це означає, можна, запустивши його й прочитавши разом із записом. 2 жовтня 2026 року ми зробили саме це на перших 5 хвилинах публічного запису, який будь-хто може звірити з цією статтею.

Ми прогнали рушій, що стоїть за інструментом інтерв’ю SozAI, через перші 5 хвилин (300 секунд) подкасту NASA Johnson Space Center Houston We Have a Podcast, епізод 180, «Artemis Mission Management», ведучий Гері Джордан і гість Майк Сарафін — це робота NASA, тож вона не захищена авторським правом. Результат: 778 слів, виявлено англійську, знайдено 2 мовців. Перші рядки так, як їх видав рушій:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

Три речі лише в цих п’яти репліках потребували людського проходу. Зворотний відлік запуску о 01:19 і «Launch commit lights are correct. There she goes.» о 01:22 — це архівний звук запуску, вмонтований у подкаст, а не мовлення ведучого чи гостя, — рушій усе одно позначив їх як Speaker B і Speaker A. «Yeah, right?» наприкінці репліки о 01:36 — насправді ведучий знову підхоплює розмову; це належить до початку наступної репліки, а не до кінця репліки гостя. А прізвище гостя вийшло як Serafin, хоча в титрах самого епізоду воно записане як Sarafin.

Пізніша репліка показує, навіщо потрібна чиста дослівність. Вихід рушія о 02:51 читається так: «Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.» Прохід чистої дослівності перетворює це на: «You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.» Повна дослівність зберегла б повтори точно так, як вони вийшли; рушій радше схильний їх зберігати — він утримав більшість повторів і хибних початків у всьому файлі («you’re, you’re right», «in, in my NASA career», «That’s, that’s quite a number of»), що ставить його результат ближче до дослівного, ніж до чистого дослівного. Якщо проєкту потрібна чиста дослівність, закладайте редакторський прохід незалежно від того, який рушій створює чернетку.

Відповіді

Frequently Asked Questions

Який найпростіший спосіб транскрибувати інтерв’ю?

Пропустіть запис через рушій перетворення мовлення на текст, щоб отримати першу чернетку, а потім звірте її з аудіо та виправте імена мовців і незрозумілі слова — набирати з нуля вручну повільніше, а не простіше. Браузерний інструмент, як-от розшифровувач інтерв’ю SozAI, може без акаунта створити чернетку перших 5 хвилин із позначками мовців і таймкодами, цього досить, щоб судити, чи варто обробляти весь файл.

Як має виглядати готовий транскрипт інтерв’ю?

Він починається з короткого ключа, де вказано рівень дослівності, використану нотацію та спосіб позначення мовців, далі йдуть репліки з позначками, як-от Speaker A, і таймкодами. Рекомендації UK Data Service щодо транскрибації додають, що транскрипт має мати унікальний ідентифікатор, однакове оформлення, теги мовців і розриви рядків, щоб його можна було знайти й порівняти пізніше, а не перечитувати повністю.

Чи може ChatGPT транскрибувати інтерв’ю?

Залежить від продукту, і це не той інструмент для першого кроку. Транскрипту інтерв’ю потрібні таймкоди й репліки мовців, на які можна покластися, а це створює рушій транскрибації. Чат-бот корисний потім — щоб привести до ладу, стиснути чи переформатувати транскрипт, який у вас уже є, а будь-який автоматичний текст усе одно треба звіряти із записом.

Що обрати: дослівну чи чисту дослівну транскрипцію?

Повну дослівну — для аналізу розмови чи юридичної та доказової роботи, де важливе кожне «е-е», хибний початок і повтор; чисту дослівну — для більшості якісних досліджень, журналістики та досліджень користувачів, де зміст важливіший за запинки. Вирішіть до першого інтерв’ю, бо зміна посередині означає переробляти попередні транскрипти.

Як позначити нерозбірливі місця в транскрипті?

Напишіть [inaudible] із таймкодом, наприклад [inaudible 00:12:31], щоб ви чи будь-хто інший могли знову знайти це місце в записі. Для накладання мовлення використовуйте [crosstalk], а для неголосових звуків, як-от сміх, — [laughs], усе в квадратних дужках і один раз пояснене в ключі на початку транскрипту.

Скільки триває транскрибація одногодинного інтерв’ю?

Вручну, за посібником із усної історії бібліотек Texas Tech University, це близько шести годин набору на годину аудіо; у посібнику курсу Cornell University оцінка — від чотирьох до шести годин. Автоматичний транскрипт повертає чернетку за хвилини, переносячи решту часу на звірку із записом, а не на набір.

Merey Tleugazin

Засновник SozAI. Створює інструменти, які перетворюють мовлення на текст для професіоналів у всьому світі.

SozAI
SozAI — Безкоштовне завантаженняМиттєво транскрибуйте аудіо й відео
Завантажити застосунок