Главное
Единого показателя точности не существует: любая цифра, которую вы где-то видели, описывает работу одной конкретной программы на одной конкретной записи. Чистая запись с одним говорящим и шумный разговор нескольких людей дают результаты настолько разные, что усреднить их в один процент просто невозможно. Реальный итог зависит от самой записи — расстояние до микрофона, фоновый шум, наложение речи, охват акцентов. Ошибки при этом не рассыпаны равномерно: основной текст читается гладко, а сбои концентрируются в именах, терминах, числах и местах, где люди говорят одновременно. Для поиска нужного момента это не проблема. Для цитирования — каждую строку нужно проверять по звуку.
Вы наверняка встречали процент точности, приписанный какому-нибудь сервису распознавания речи. Это реальное измерение чего-то конкретного. Просто не измерение того, что произойдёт, когда вы загрузите туда свою запись, — а воспринимать эту цифру как обещание — верный способ разочароваться в самый неподходящий момент.
Правильный вопрос не «насколько точна автоматическая расшифровка вообще», а «достаточно ли хорош будет результат именно для той задачи, которую вы решаете». Это разные вопросы с разными ответами: один и тот же файл может отлично подойти, чтобы найти нужный момент, и совершенно не подойти, чтобы процитировать сказанное.
Цифра точности измеряет одну запись, а не программу
Любое заявление о точности — результат прогона конкретной системы на конкретном аудио. Меняется запись — меняется и цифра. Это не изъян измерения, это его суть.
Представьте два полюса. Один человек говорит близко к микрофону, в тихой комнате, на распространённом варианте языка, о повседневных вещах. Такая запись расшифровывается почти без ошибок. А теперь представьте четверых за столом, работающий кондиционер, все перебивают друг друга, используют профессиональный жаргон, а двое сидят в полутора метрах от телефона. Расшифровка получится значительно хуже. Оба результата — честные измерения одной и той же системы. Один процент не может описать оба случая, а разрыв между ними настолько велик, что даже усреднение не имеет смысла.
Поэтому, когда вы видите цифру без указания, на какой записи она получена, самое важное — то, чего в ней нет. Всё, что вы на самом деле узнали, — это что кто-то что-то протестировал. Ориентир, который имеет значение для вас, — ваш собственный материал. Возьмите несколько минут записи, похожей на те, с которыми вы обычно работаете, прогоните её через сервис и сравните текст со звуком. Это даст больше информации, чем любая опубликованная цифра, и займёт меньше времени, чем чтение сравнительных обзоров.
Условия записи влияют на результат сильнее, чем сама программа
Люди выбирают сервис расшифровки, сравнивая точность разных программ. Для большинства записей это не тот вопрос, с которого стоит начинать. Условия записи звука сдвигают результат сильнее, чем выбор конкретного движка распознавания.
- Расстояние до микрофона. Каждый лишний сантиметр расстояния добавляет больше комнаты и меньше голоса. Телефон, лежащий на столе между двумя людьми, — это совсем другая запись, чем телефон, направленный на одного из них.
- Фоновый шум. Улица, кафе, вентиляторы, стук по клавиатуре. Шум не просто существует на фоне речи — он с ней конкурирует, и первыми теряются тихие слова в конце фраз.
- Наложение речи. Когда два человека говорят одновременно, чистого сигнала для распознавания просто нет. Что-то будет написано, и часто это окажется смесью реплик обоих.
- Охват акцентов. Одни варианты произношения представлены в обучающих данных этих систем гораздо лучше других, и там, где представленность низкая, результат хуже даже на такой же чистой записи.
Сервисы действительно отличаются друг от друга, и если ваш материал стабильно сложен одним и тем же образом, потратить полдня на тест нескольких вариантов оправданно. Но разница между двумя приличными сервисами на одной и той же записи обычно меньше, чем разница между хорошей и плохой записью в одном и том же сервисе. Поднести микрофон ближе даёт больше, чем смена продукта. Если хочется понять, что именно программа делает с вашим звуком, общий принцип того, как работает распознавание речи ИИ, объясняет, почему именно эти условия так важны.
Ошибки распределены по тексту неравномерно
Вот момент, на котором люди чаще всего попадают в ловушку, и он важнее итоговой цифры точности. Ошибки собираются в кучу. Основная часть расшифровки выходит чистой, а сбои концентрируются в нескольких предсказуемых местах: имена собственные, специальная терминология, числа и любые моменты, где люди говорят друг через друга.
Подумайте, что это значит при чтении текста. Страница обычного разговора расшифровывается хорошо и читается гладко. Потом появляется фамилия, или название продукта, или цифра — и это оказывается неверным. На странице это никак не помечено. Неправильное слово стоит тем же уверенным шрифтом, что и правильные, среди верных предложений — а это ровно тот контекст, в котором ошибка выглядит убедительно. Расшифровка может читаться безупречно и при этом ошибаться именно в тех местах, для которых вы её и использовали.
У такого совпадения категорий есть причина. Обычные слова ограничены контекстом вокруг них, поэтому если система ослышалась, она может «восстановиться» по смыслу. Имя собственное так не ограничено: почти любой набор звуков может оказаться чьим-то именем, и в грамматике нет ничего, что отбросило бы неверный вариант. У специальных терминов та же проблема, плюс дополнительная сложность — обычное слово часто звучит достаточно похоже, чтобы подменить собой техническое. Числа — самый острый случай: небольшая акустическая разница даёт совершенно другое значение, а предложение при этом читается совершенно правдоподобно в обоих вариантах.
Пунктуация — это догадка о том, где заканчивается предложение
Автоматическая расстановка знаков препинания — это не расшифровка речи. Это предположение, сделанное на основе пауз, интонации и ритма, о том, где заканчивается одна мысль и начинается следующая. Чаще всего догадка верна — или верна настолько, что никто этого не замечает.
Там, где догадка ошибочна, смысл смещается. Точка, поставленная посреди придаточного, может оторвать оговорку от того, к чему она относилась, — осторожное утверждение превращается в категоричное, а условие превращается в факт. Каждое отдельное слово может быть распознано правильно, а предложение при этом будет говорить не то, что сказал говорящий. Такую ошибку невозможно увидеть на странице, потому что там нет ничего подозрительного. Вычитать расшифровку и найти это чтением самой расшифровки не получится. Разобраться может только звук.
У меток говорящих похожая слабость. Обычно они верны внутри длинного отрезка речи одного человека и наименее надёжны на стыках, где короткая вставка может быть приписана не тому, кто её произнёс. Если вы берёте цитату рядом со сменой говорящего, эту строку стоит переслушать.
Требования к расшифровке задаёт её назначение
Вопрос не в том, точна ли расшифровка вообще. Вопрос в том, достаточно ли она точна для конкретной задачи, а задачи различаются сильнее, чем кажется.
Если расшифровка нужна, чтобы найти нужный момент, разрозненные ошибки не имеют значения. Вы ищете слово, попадаете в нужную минуту, включаете звук. Расшифровка сделала своё дело, даже если тремя строками выше искажено имя. То же самое верно, когда вы просматриваете часовую запись, чтобы решить, какие двадцать минут стоят внимания, или превращаете запись в текст, чтобы прочитать её быстрее, чем прослушать.
Если расшифровку собираются процитировать, опубликовать, подать куда-то официально или на неё будет опираться человек, который не присутствовал при разговоре, — требования другие, и здесь торга быть не может. Каждую строку, которую вы планируете использовать, нужно проверить по звуку отдельно. Не пробежаться взглядом по всему документу, а прицельно переслушать каждый цитируемый фрагмент, потому что описанные выше сбои читка не выявляет. Это особенно важно там, где вес фразы держится на числе или имени.
Для рабочего документа разумный вариант — приложение. SozAI, доступный для iOS, Android и macOS, превращает записи, аудио- и видеофайлы, а также ссылки на YouTube в текст с метками говорящих, кратким содержанием и переводом на более чем 99 языков — но цитаты в нём всё равно нужно проверять по звуку, как и с любым другим автоматическим результатом.
Когда расшифровка — конечный продукт сама по себе, правильный ответ — услуги расшифровки, выполненной человеком. Они стоят дороже именно потому, что за ними сидит человек и слушает, а это ровно то, за что вы платите: кто-то, кто расслышит имя и напишет его верно, поймёт, где закончилось предложение, и отметит момент, который правда неразборчив, вместо того чтобы угадывать. Если документ получит клиент, суд, архив или издание, эти дополнительные расходы покупают вам что-то реальное. Если расшифровка — это личный инструмент, чтобы быстрее добраться до звука, эти расходы покупают то, что вам не нужно.
Вторая попытка записи лучше часа правок
Улучшить запись почти всегда дешевле, чем улучшить результат расшифровки. Десять минут, потраченные на то, чтобы переставить микрофон, закрыть окно, выключить вентилятор и попросить людей говорить по одному, сэкономят больше времени, чем час правок текста, и дадут результат лучше, чем правки: исправленная расшифровка хороша ровно настолько, насколько у вас хватило терпения к концу процесса.
Легче всего этим воспользоваться, если ситуация повторяется. Если вы регулярно записываете один и тот же тип разговора, одно внимательное отношение к условиям записи улучшит всё, что вы запишете после. Особенно это важно для интервью, где материал часто неповторим и цитаты — вся суть; практические вопросы расшифровки интервью — это по большей части вопросы того, как их записывать.
Иногда второй попытки не будет. Разговор случился один раз, телефон лежал в кармане, и это всё, что у вас есть. Тогда честный путь — перестать ждать, что программа это спасёт, и заложить время на правки заранее, либо отдать запись человеку. Сложная запись не становится простой только потому, что вам это нужно.
Чего ожидать, открывая готовый файл
Ожидайте гладкий, читаемый текст с несколькими неверными существительными в нём. Ожидайте, что фрагменты, где люди говорили одновременно, окажутся скудными, искажёнными или просто пропущенными без предупреждения. Ожидайте расстановку знаков препинания, которую вы бы сделали иначе, и метки говорящих, в целом верные, но ненадёжные на стыках. Не ждите пометок, подсветки или каких-либо знаков неуверенности. Документ будет выглядеть одинаково уверенно на всём протяжении — и при этом не будет одинаково верным на всём протяжении.
Ожидайте, что имена и специальные термины потребуют отдельной проверки независимо от того, насколько чистой была запись. Они сбоят и на хорошем звуке — просто реже.
И сохраняйте исходную запись. Автоматическая расшифровка не может проверить сама себя, а все важные проверки требуют прослушивания. Расшифровка, за которой стоит запись, — надёжный рабочий инструмент. Расшифровка без записи — документ, который никто не может проверить, включая вас самих.

