Главное
Определите уровень дословности до того, как наберёте хоть слово: полный дословный вариант сохраняет каждое «э-э» и оговорку, чистый дословный сохраняет смысл без слов-паразитов, а отредактированная расшифровка приводит грамматику в порядок для чтения. Выберите обозначения для пауз, перекрывающейся речи и неразборчивых мест, запишите их ключом в начале документа и единообразно подписывайте говорящих. Вручную, по руководству по устной истории библиотек Texas Tech University, выходит шесть часов набора на час записи; в методичке курса Cornell University сказано от четырёх до шести. Автоматическая расшифровка даёт черновик за минуты, а человеческая работа смещается с набора на сверку с записью.
Запись у вас есть. Теперь кому-то нужна расшифровка, которую можно цитировать, кодировать или сдать, и первый вопрос не в том, каким приложением пользоваться, а в том, какую часть речи вы собираетесь сохранить.
Слова-паразиты и оговорки важны в конверсационном анализе и в некоторых юридических контекстах; везде остальное это шум. В этой статье разобраны три уровня дословности, обозначения для пауз и перекрытий, сколько времени занимает работа вручную и что автоматическая расшифровка делает верно, а что неверно на реальной записи.
Как проще всего расшифровать интервью?
Сначала прогоните запись через движок распознавания речи, затем исправьте имена, выборочно сверьте с аудио и добавьте обозначения, которые нужны вашему проекту: это быстрее, чем печатать с чистого листа, и именно это большинство людей и называют «проще всего». Набирать целый час речи с нуля, слово в слово, — это долгий путь, а не лёгкий.
Для короткого фрагмента наш браузерный инструмент, расшифровка интервью онлайн, делает такой первый проход без аккаунта: загрузите запись, и он расшифрует первые 5 минут, подпишет каждую реплику как Speaker A, Speaker B и так далее с таймкодом и автоматически определит язык среди 99 языков. Файлы до 25 MB обрабатываются как есть; более длинные записи обрезаются до 5 минут прямо в браузере, прежде чем что-либо отправляется. Аудио и расшифровка удаляются у провайдера, как только результат возвращён, а на одном устройстве доступно три предпросмотра в день.
Этого достаточно, чтобы понять, стоит ли применять инструмент к конкретной записи. Для всего интервью за один проход, с репликами, подписанными от начала до конца, и с хранением всех расшифровок в библиотеке с поиском приложение SozAI делает именно это: первые 30 минут бесплатны. Подробности — в разделе как работает расшифровка интервью, а приложение можно скачать.
Чем отличается дословная расшифровка от чистой дословной?
Полный дословный вариант сохраняет каждое слово как оно прозвучало: «э-э», оговорки, повторы слов, заикания и слышимый смех. Чистый дословный вариант сохраняет слова и смысл говорящего, но убирает слова-паразиты, оговорки и случайные повторы. Отредактированная расшифровка идёт ещё дальше и исправляет грамматику и порядок слов, чтобы текст хорошо читался, — и именно поэтому он перестаёт годиться как доказательство того, что на самом деле было сказано.
- Полный дословный: конверсационный анализ, часть юридической и доказательной работы.
- Чистый дословный: большинство качественных исследований, журналистика, исследования пользователей.
- Отредактированный: публикуемые статьи в формате «вопрос — ответ».
| Уровень | Что сохраняет | Типичное применение |
|---|---|---|
| Полный дословный | Каждое слово как прозвучало: слова-паразиты, оговорки, повторы, заикания, слышимые звуки | Конверсационный анализ, часть юридической и доказательной работы |
| Чистый дословный | Слова и смысл говорящего, слова-паразиты и оговорки убраны | Большинство качественных исследований, журналистика, исследования пользователей |
| Отредактированный | Исправленная грамматика и порядок слов для чтения | Публикуемые статьи в формате «вопрос — ответ» |
Если расшифровка пойдёт в исследовательский проект, а не в публикацию, решите это до первого интервью, а не после пятого: смена уровня на полпути означает, что прежние расшифровки придётся переделывать под него. О стороне, связанной именно с исследованиями — согласии, анонимизации и хранении, — рассказано в статье расшифровка интервью для исследований.
Как написать расшифровку интервью?
Начните с ключа: уровень дословности, используемые символы и способ подписи говорящих, всё это в начале документа, до первой строки речи. Он понадобится всем, кто позже будет кодировать или цитировать расшифровку, и вам самим через несколько недель, когда вы забудете, что должно было означать (.).
Самая известная система для подробных расшифровок принадлежит Гейл Джефферсон и изложена в её работе Glossary of transcript symbols with an introduction (2004). Как резюмируют Clift, Kendrick, Raymond and Robinson (2024), левая квадратная скобка отмечает момент, с которого начинается перекрывающаяся речь, знак равенства соединяет реплики без промежутка, число в круглых скобках, например (0,5), означает отмеренную паузу в секундах, а (.) обозначает паузу, слишком короткую, чтобы её измерять. Источники расходятся в том, насколько короткой должна быть микропауза, поэтому, если в вашем ключе есть (.), в нём стоит написать, что вы под этим понимаете.
Большинству проектов с интервью такой детальности не нужно, и без неё текст читается проще. Достаточно соглашения со скобками, которое покрывает то, что реально встречается: [inaudible 00:12:31] для неразборчивого места, с таймкодом, чтобы его можно было найти снова; [crosstalk], когда двое говорят одновременно; [laughs] и другие неречевые события в квадратных скобках; и подпись говорящего в начале каждой реплики.
| Символ | Значение | Система |
|---|---|---|
| [ | Точка начала перекрывающейся речи | Джефферсон |
| = | Речь без промежутка (подхват) | Джефферсон |
| (0,5) | Отмеренная пауза в секундах | Джефферсон |
| (.) | Пауза, слишком короткая для измерения | Джефферсон |
| [inaudible 00:12:31] | Неразборчивое место, с таймкодом | Скобочная |
| [crosstalk] | Двое говорят одновременно | Скобочная |
| [laughs] | Неречевой звук | Скобочная |
Помимо обозначений, в руководстве UK Data Service по расшифровке сказано, что у расшифровки должен быть уникальный идентификатор, единообразная вёрстка во всём проекте, теги говорящих для смены реплик и сохранённые разрывы строк. Это мелочи, но именно они позволяют потом находить и сравнивать расшифровки, а не перечитывать их все заново.
Имён говорящих программа расшифровки знать не может: ждите Speaker A и Speaker B, которых вы переименуете вручную, когда поймёте, кто есть кто. В материале единообразная подпись говорящих рассказано, как делать это во всём проекте, чтобы имена не расходились между файлами.
Анонимизируйте по ходу работы, а не потом: заменяйте имена и опознающие детали единообразными заглушками вроде [Participant 2] или [city] прямо в расшифровке, а ключ, сопоставляющий заглушки с реальными именами, храните в отдельном файле. Запись человека почти везде требует его согласия, а этический комитет исследования обычно хочет видеть это согласие письменным; то, что вы расшифровываете запись, этого требования не меняет.
Сколько времени занимает расшифровка интервью?
Вручную рассчитывайте на часы, а не на минуты. В руководстве по устной истории библиотек Texas Tech University сказано, что даже опытные расшифровщики обычно тратят шесть часов набора на каждый час аудио. В методичке курса Cornell University цифра ниже: от четырёх до шести часов на час записи, а разрыв в основном объясняется тем, насколько чистое аудио и сколько обозначений добавляется по ходу.
Автоматическая расшифровка меняет то, куда уходит время, а не убирает его. Черновик возвращается за минуты; остаётся прослушать его вместе с записью, исправить имена и термины, поправить, кто что сказал, там, где подписи перепутались, и добавить обозначения, нужные проекту. Для часового интервью это по-прежнему настоящая работа, просто другая; подробнее об этом в материале сколько на самом деле занимает расшифровка.
Может ли ChatGPT расшифровать интервью?
Сможет ли чат-бот превратить аудиофайл в текст, зависит от продукта, но расшифровке интервью нужно больше, чем текст: таймкоды, к которым можно вернуться, и реплики говорящих, которым можно доверять, а именно это и призван выдавать движок расшифровки. Чат-бот оказывается к месту после этого шага: чтобы привести в порядок, пересказать или переоформить уже готовую расшифровку.
В любом случае автоматический текст нужно сверить с записью, прежде чем его цитировать, и эту проверку не снимает ни один инструмент.
Сколько проверки нужно конкретному движку, сильно различается. В материале насколько точна ИИ-расшифровка рассказано, чего ждать и где ошибки обычно скапливаются.
Что автоматическая расшифровка на реальной записи делает неверно
Автоматическая расшифровка — это черновик, и яснее всего понять, что это значит, можно, запустив её и прочитав рядом с записью. 2 октября 2026 года мы сделали именно это на первых 5 минутах публичной записи, которую каждый может сверить с этой статьёй.
Мы прогнали движок, на котором работает интервью-инструмент SozAI, по первым 5 минутам (300 секундам) подкаста NASA Johnson Space Center Houston We Have a Podcast, эпизод 180, «Artemis Mission Management», ведущий Gary Jordan и гость Mike Sarafin; это работа NASA, так что авторским правом она не защищена. Результат: 778 слов, определён английский язык, найдено 2 говорящих. Первые реплики в том виде, в каком их вывел движок:
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
Три вещи в этих пяти репликах потребовали человеческой правки. Отсчёт перед стартом в 01:19 и фраза «Launch commit lights are correct. There she goes.» в 01:22 — это архивное аудио запуска, вмонтированное в подкаст, а не речь ведущего или гостя, но движок всё равно подписал их как Speaker B и Speaker A. «Yeah, right?» в конце реплики на 01:36 на самом деле принадлежит ведущему, который возвращает разговор себе; это слова из начала следующей реплики, а не конца реплики гостя. А фамилия гостя вышла как Serafin, хотя в титрах самого эпизода она пишется Sarafin.
Более поздняя реплика показывает, зачем нужен чистый дословный вариант. Вывод движка на 02:51 такой: «Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.» Чистая дословная правка превращает его в: «You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.» Полный дословный вариант сохранил бы повторы ровно так, как они вышли; движок, если на то пошло, склонен их сохранять: он оставил большинство повторов и оговорок по всему файлу («you’re, you’re right», «in, in my NASA career», «That’s, that’s quite a number of»), и его вывод оказывается ближе к дословному, чем к чистому дословному. Если проекту нужен чистый дословный вариант, закладывайте проход редактирования, какой бы движок ни выдал черновик.

