Перейти к содержимому

Как расшифровать интервью: уровни дословности, метки говорящих и обозначения

•2 min read• 10 views •Последнее обновление: Окт 2, 2026
Two chairs facing each other at a small table by a window, a phone recording between them next to a notebook

Главное

Определите уровень дословности до того, как наберёте хоть слово: полный дословный вариант сохраняет каждое «э-э» и оговорку, чистый дословный сохраняет смысл без слов-паразитов, а отредактированная расшифровка приводит грамматику в порядок для чтения. Выберите обозначения для пауз, перекрывающейся речи и неразборчивых мест, запишите их ключом в начале документа и единообразно подписывайте говорящих. Вручную, по руководству по устной истории библиотек Texas Tech University, выходит шесть часов набора на час записи; в методичке курса Cornell University сказано от четырёх до шести. Автоматическая расшифровка даёт черновик за минуты, а человеческая работа смещается с набора на сверку с записью.

Запись у вас есть. Теперь кому-то нужна расшифровка, которую можно цитировать, кодировать или сдать, и первый вопрос не в том, каким приложением пользоваться, а в том, какую часть речи вы собираетесь сохранить.

Слова-паразиты и оговорки важны в конверсационном анализе и в некоторых юридических контекстах; везде остальное это шум. В этой статье разобраны три уровня дословности, обозначения для пауз и перекрытий, сколько времени занимает работа вручную и что автоматическая расшифровка делает верно, а что неверно на реальной записи.

Как проще всего расшифровать интервью?

Сначала прогоните запись через движок распознавания речи, затем исправьте имена, выборочно сверьте с аудио и добавьте обозначения, которые нужны вашему проекту: это быстрее, чем печатать с чистого листа, и именно это большинство людей и называют «проще всего». Набирать целый час речи с нуля, слово в слово, — это долгий путь, а не лёгкий.

Для короткого фрагмента наш браузерный инструмент, расшифровка интервью онлайн, делает такой первый проход без аккаунта: загрузите запись, и он расшифрует первые 5 минут, подпишет каждую реплику как Speaker A, Speaker B и так далее с таймкодом и автоматически определит язык среди 99 языков. Файлы до 25 MB обрабатываются как есть; более длинные записи обрезаются до 5 минут прямо в браузере, прежде чем что-либо отправляется. Аудио и расшифровка удаляются у провайдера, как только результат возвращён, а на одном устройстве доступно три предпросмотра в день.

Этого достаточно, чтобы понять, стоит ли применять инструмент к конкретной записи. Для всего интервью за один проход, с репликами, подписанными от начала до конца, и с хранением всех расшифровок в библиотеке с поиском приложение SozAI делает именно это: первые 30 минут бесплатны. Подробности — в разделе как работает расшифровка интервью, а приложение можно скачать.

Чем отличается дословная расшифровка от чистой дословной?

Полный дословный вариант сохраняет каждое слово как оно прозвучало: «э-э», оговорки, повторы слов, заикания и слышимый смех. Чистый дословный вариант сохраняет слова и смысл говорящего, но убирает слова-паразиты, оговорки и случайные повторы. Отредактированная расшифровка идёт ещё дальше и исправляет грамматику и порядок слов, чтобы текст хорошо читался, — и именно поэтому он перестаёт годиться как доказательство того, что на самом деле было сказано.

  • Полный дословный: конверсационный анализ, часть юридической и доказательной работы.
  • Чистый дословный: большинство качественных исследований, журналистика, исследования пользователей.
  • Отредактированный: публикуемые статьи в формате «вопрос — ответ».
Три уровня дословности и что сохраняет каждый
УровеньЧто сохраняетТипичное применение
Полный дословныйКаждое слово как прозвучало: слова-паразиты, оговорки, повторы, заикания, слышимые звукиКонверсационный анализ, часть юридической и доказательной работы
Чистый дословныйСлова и смысл говорящего, слова-паразиты и оговорки убраныБольшинство качественных исследований, журналистика, исследования пользователей
ОтредактированныйИсправленная грамматика и порядок слов для чтенияПубликуемые статьи в формате «вопрос — ответ»

Если расшифровка пойдёт в исследовательский проект, а не в публикацию, решите это до первого интервью, а не после пятого: смена уровня на полпути означает, что прежние расшифровки придётся переделывать под него. О стороне, связанной именно с исследованиями — согласии, анонимизации и хранении, — рассказано в статье расшифровка интервью для исследований.

Как написать расшифровку интервью?

Начните с ключа: уровень дословности, используемые символы и способ подписи говорящих, всё это в начале документа, до первой строки речи. Он понадобится всем, кто позже будет кодировать или цитировать расшифровку, и вам самим через несколько недель, когда вы забудете, что должно было означать (.).

Самая известная система для подробных расшифровок принадлежит Гейл Джефферсон и изложена в её работе Glossary of transcript symbols with an introduction (2004). Как резюмируют Clift, Kendrick, Raymond and Robinson (2024), левая квадратная скобка отмечает момент, с которого начинается перекрывающаяся речь, знак равенства соединяет реплики без промежутка, число в круглых скобках, например (0,5), означает отмеренную паузу в секундах, а (.) обозначает паузу, слишком короткую, чтобы её измерять. Источники расходятся в том, насколько короткой должна быть микропауза, поэтому, если в вашем ключе есть (.), в нём стоит написать, что вы под этим понимаете.

Большинству проектов с интервью такой детальности не нужно, и без неё текст читается проще. Достаточно соглашения со скобками, которое покрывает то, что реально встречается: [inaudible 00:12:31] для неразборчивого места, с таймкодом, чтобы его можно было найти снова; [crosstalk], когда двое говорят одновременно; [laughs] и другие неречевые события в квадратных скобках; и подпись говорящего в начале каждой реплики.

Обозначения в расшифровке: символы Джефферсон и более лёгкое соглашение со скобками
СимволЗначениеСистема
[Точка начала перекрывающейся речиДжефферсон
=Речь без промежутка (подхват)Джефферсон
(0,5)Отмеренная пауза в секундахДжефферсон
(.)Пауза, слишком короткая для измеренияДжефферсон
[inaudible 00:12:31]Неразборчивое место, с таймкодомСкобочная
[crosstalk]Двое говорят одновременноСкобочная
[laughs]Неречевой звукСкобочная

Помимо обозначений, в руководстве UK Data Service по расшифровке сказано, что у расшифровки должен быть уникальный идентификатор, единообразная вёрстка во всём проекте, теги говорящих для смены реплик и сохранённые разрывы строк. Это мелочи, но именно они позволяют потом находить и сравнивать расшифровки, а не перечитывать их все заново.

Имён говорящих программа расшифровки знать не может: ждите Speaker A и Speaker B, которых вы переименуете вручную, когда поймёте, кто есть кто. В материале единообразная подпись говорящих рассказано, как делать это во всём проекте, чтобы имена не расходились между файлами.

Анонимизируйте по ходу работы, а не потом: заменяйте имена и опознающие детали единообразными заглушками вроде [Participant 2] или [city] прямо в расшифровке, а ключ, сопоставляющий заглушки с реальными именами, храните в отдельном файле. Запись человека почти везде требует его согласия, а этический комитет исследования обычно хочет видеть это согласие письменным; то, что вы расшифровываете запись, этого требования не меняет.

Сколько времени занимает расшифровка интервью?

Вручную рассчитывайте на часы, а не на минуты. В руководстве по устной истории библиотек Texas Tech University сказано, что даже опытные расшифровщики обычно тратят шесть часов набора на каждый час аудио. В методичке курса Cornell University цифра ниже: от четырёх до шести часов на час записи, а разрыв в основном объясняется тем, насколько чистое аудио и сколько обозначений добавляется по ходу.

Автоматическая расшифровка меняет то, куда уходит время, а не убирает его. Черновик возвращается за минуты; остаётся прослушать его вместе с записью, исправить имена и термины, поправить, кто что сказал, там, где подписи перепутались, и добавить обозначения, нужные проекту. Для часового интервью это по-прежнему настоящая работа, просто другая; подробнее об этом в материале сколько на самом деле занимает расшифровка.

Может ли ChatGPT расшифровать интервью?

Сможет ли чат-бот превратить аудиофайл в текст, зависит от продукта, но расшифровке интервью нужно больше, чем текст: таймкоды, к которым можно вернуться, и реплики говорящих, которым можно доверять, а именно это и призван выдавать движок расшифровки. Чат-бот оказывается к месту после этого шага: чтобы привести в порядок, пересказать или переоформить уже готовую расшифровку.

В любом случае автоматический текст нужно сверить с записью, прежде чем его цитировать, и эту проверку не снимает ни один инструмент.

Сколько проверки нужно конкретному движку, сильно различается. В материале насколько точна ИИ-расшифровка рассказано, чего ждать и где ошибки обычно скапливаются.

Что автоматическая расшифровка на реальной записи делает неверно

Автоматическая расшифровка — это черновик, и яснее всего понять, что это значит, можно, запустив её и прочитав рядом с записью. 2 октября 2026 года мы сделали именно это на первых 5 минутах публичной записи, которую каждый может сверить с этой статьёй.

Мы прогнали движок, на котором работает интервью-инструмент SozAI, по первым 5 минутам (300 секундам) подкаста NASA Johnson Space Center Houston We Have a Podcast, эпизод 180, «Artemis Mission Management», ведущий Gary Jordan и гость Mike Sarafin; это работа NASA, так что авторским правом она не защищена. Результат: 778 слов, определён английский язык, найдено 2 говорящих. Первые реплики в том виде, в каком их вывел движок:

[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today.
[01:19] Speaker B: T-minus five seconds and counting. Mark.
[01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today.
[01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right?
[01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.

Три вещи в этих пяти репликах потребовали человеческой правки. Отсчёт перед стартом в 01:19 и фраза «Launch commit lights are correct. There she goes.» в 01:22 — это архивное аудио запуска, вмонтированное в подкаст, а не речь ведущего или гостя, но движок всё равно подписал их как Speaker B и Speaker A. «Yeah, right?» в конце реплики на 01:36 на самом деле принадлежит ведущему, который возвращает разговор себе; это слова из начала следующей реплики, а не конца реплики гостя. А фамилия гостя вышла как Serafin, хотя в титрах самого эпизода она пишется Sarafin.

Более поздняя реплика показывает, зачем нужен чистый дословный вариант. Вывод движка на 02:51 такой: «Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.» Чистая дословная правка превращает его в: «You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.» Полный дословный вариант сохранил бы повторы ровно так, как они вышли; движок, если на то пошло, склонен их сохранять: он оставил большинство повторов и оговорок по всему файлу («you’re, you’re right», «in, in my NASA career», «That’s, that’s quite a number of»), и его вывод оказывается ближе к дословному, чем к чистому дословному. Если проекту нужен чистый дословный вариант, закладывайте проход редактирования, какой бы движок ни выдал черновик.

Ответы

Frequently Asked Questions

Как проще всего расшифровать интервью?

Прогоните запись через движок распознавания речи ради первого черновика, затем сверьте его с аудио и исправьте имена говорящих и неясные слова: набирать с нуля вручную дольше, а не проще. Браузерный инструмент вроде расшифровщика интервью SozAI даёт размеченный черновик первых 5 минут с таймкодами без аккаунта, и этого достаточно, чтобы понять, стоит ли обрабатывать весь файл.

Как должна выглядеть готовая расшифровка интервью?

Она начинается с короткого ключа, где указаны уровень дословности, используемые обозначения и способ подписи говорящих, а дальше идут подписанные реплики, например Speaker A, с таймкодами. В руководстве UK Data Service по расшифровке добавлено, что у неё должен быть уникальный идентификатор, единообразная вёрстка, теги говорящих и разрывы строк, чтобы её можно было найти и сравнить позже, а не перечитывать целиком.

Может ли ChatGPT расшифровать интервью?

Это зависит от продукта, и для первого шага он не тот инструмент. Расшифровке интервью нужны таймкоды и реплики говорящих, которым можно доверять, а именно их выдаёт движок расшифровки. Чат-бот полезен потом: чтобы привести в порядок, пересказать или переоформить уже имеющуюся расшифровку, а любой автоматический текст всё равно надо сверять с записью.

Что выбрать: дословную или чистую дословную расшифровку?

Полный дословный вариант берите для конверсационного анализа и юридической или доказательной работы, где важны каждое «э-э», оговорка и повтор; чистый дословный — для большинства качественных исследований, журналистики и исследований пользователей, где смысл важнее сбивок речи. Решите это до первого интервью, потому что смена на полпути означает переделку прежних расшифровок.

Как отметить неразборчивые места в расшифровке?

Напишите [inaudible] с таймкодом, например [inaudible 00:12:31], чтобы вы или кто-то другой могли снова найти это место в записи. Для перекрывающейся речи используйте [crosstalk], а для неречевых звуков вроде смеха — [laughs]: всё в квадратных скобках и один раз объяснено в ключе в начале расшифровки.

Сколько времени занимает расшифровка часового интервью?

Вручную, по руководству по устной истории библиотек Texas Tech University, это около шести часов набора на час аудио; методичка курса Cornell University оценивает в четыре-шесть часов. Автоматическая расшифровка возвращает черновик за минуты, и оставшееся время уходит на сверку с записью, а не на набор.

Merey Tleugazin

Основатель SozAI. Создаю инструменты преобразования речи в текст для профессионалов по всему миру.

SozAI
SozAI — Скачать бесплатноТранскрибируйте аудио и видео мгновенно
Скачать