Главное
macOS сама видео не расшифрует. Зато без всяких загрузок она умеет вытащить звуковую дорожку из видео через QuickTime Player — и тогда у вас на руках файл куда меньшего размера, с которым удобно работать дальше. Встроенная диктовка печатает то, что слышит микрофон, прямо во время разговора, — то есть для уже готовой записи она не подходит. Расшифровка — это отдельный шаг, и он одинаков на любом компьютере.
У вас на Mac лежит видео. Запись экрана со встречи, лекция, которую кто-то прислал, сохранённый ролик. Нужен именно текст. И заводить аккаунт в незнакомом сервисе ради этого совсем не хочется.
Задача делится на две чистые части. Сначала — вытащить из видео чистый звук. Потом — превратить этот звук в текст. Первую половину Mac умеет делать прямо сейчас, штатными средствами, без единой установки. Вторую — нет, и сколько ни рыться в настройках системы, ничего не изменится. Понимание того, где проходит эта граница, экономит вам целый вечер поисков несуществующего пункта меню.
Что умеет macOS «из коробки»
QuickTime Player есть на каждом Mac. Он проигрывает видео, записывает экран и умеет экспортировать звук из видеофайла. Вот это последнее и есть самое полезное — часто это единственный шаг, который нужен перед тем, как передать файл дальше, в другую программу.
Ещё в macOS есть диктовка, которая превращает речь в текст прямо во время разговора. Есть «Голосовые заметки» (Voice Memos), которые синхронизируются с тем же приложением на iPhone через iCloud. Вместе эти три инструмента позволяют записать звук, сохранить его и напечатать текст голосом.
Но ни один из них не прочитает готовый видеофайл и не выдаст расшифровку. Это стоит сказать прямо, потому что все эти инструменты стоят так близко друг к другу, что кажется — нужная функция где-то рядом прячется. Не прячется. Mac отлично умеет создавать записи и плохо умеет превращать их в текст.
Сначала вытащите звук
Видеофайл — это контейнер. В нём есть картинка и есть звуковая дорожка, а расшифровка работает только со звуком. Картинка для этой задачи — лишний вес.
Поэтому первым делом извлеките звук. QuickTime Player справится с этим сам, то есть первый шаг ничего не стоит и ничего не требует устанавливать. На выходе — файл заметно меньше исходного видео, иногда в разы, в зависимости от того, что это было за видео.
Разница в размере из абстрактной превращается в очень конкретную, как только запись длинная. Двухчасовая лекция в виде видео — штука неудобная: её сложно переслать, загрузить куда-то, держать несколько копий, пока вы решаете, каким инструментом воспользоваться. Те же два часа в виде звука — скромный файл, с которым не нужно возиться. Если у вас целая папка записей, извлечение звука заранее — это разница между «управился за вечер» и «провозился все выходные».
Извлечение звука ещё и снимает вопрос, который многих сбивает с толку: нужен ли инструмент, который умеет именно превращать видео в текст, или достаточно обычной расшифровки аудио. Как только звук становится отдельным файлом, разница исчезает. Любой инструмент, работающий со звуком, примет и ваш файл.
Диктовка — это другая задача
Диктовку и расшифровку часто путают, будто это одно и то же. Это не так, и в этой разнице — то самое, что стоит между вами и нужным текстом.
Диктовка слушает микрофон и записывает то, что слышит, в реальном времени, по ходу разговора. Вы говорите — появляется текст. Это способ печатать. Расшифровка берёт запись, которая уже существует — что-то, что произошло час назад или год назад, — и превращает её в текст. Одно — это способ ввода, другое — преобразование.
Можно попытаться обойти это, включив видео на колонках и дав диктовке слушать звук через них. Люди так делают. Получается плохо. Вы просите микрофон заново записать звук, который уже был записан — в какой-то комнате, с тем звучанием, какое было в этой комнате, — и вам нужно просидеть всё время записи заново, пока это происходит. Час видео обойдётся вам ровно в час. Для чего-то длиннее короткого ролика это не вариант. Подробнее о том, как работает распознавание речи на Mac и где заканчиваются возможности встроенных средств, — в отдельном материале, но короткий ответ такой: диктовка изначально не создавалась для работы с файлами.
Когда файла ещё нет
Всё сказанное выше предполагает, что видео уже лежит на диске. Иногда это не так. Слова, которые вам нужны, звучат в разговоре, который идёт прямо сейчас, или в видео, открытом в браузере, — и извлекать звук не из чего, потому что ничего не сохранено.
Вот тут Mac ставит по-настоящему серьёзное препятствие. Запись собственного системного звука Mac — того, что выходит из динамиков компьютера, а не того, что попадает в микрофон, — это не то, что macOS умеет «из коробки». Запись экрана даст вам картинку. А вот звук, который шёл вместе с ней, — отдельная задача, и именно на этом шаге чаще всего всё и стопорится. Если у вас хоть раз получилась беззвучная запись встречи и вы не поняли, что сделали не так, — вот в чём дело. Вы ничего не сделали не так.
Есть способы решить это, и разумно разобраться в них заранее, а не посреди звонка, который повторить уже не получится. О том, как записать экран Mac со звуком, подробно рассказано отдельно. Здесь важно другое: это проблема захвата звука, а не расшифровки, и решив её, вы возвращаетесь к обычной ситуации — файл на диске.
Есть путь, который обходит эту проблему стороной. «Голосовые заметки» на Mac делятся записями с тем же приложением на iPhone через iCloud, так что всё записанное на телефоне появляется на Mac само, без писем самому себе и без проводов. Для живого разговора или лекции, на которой вы присутствуете лично, записать всё на телефон и забрать файл на компьютере — куда проще, чем разбираться с системным звуком. Правда, со звуком, который производит сам Mac, это никак не поможет.
Превращаем звук в текст
Как только звук существует в виде файла, все прежние решения теряют значение. Расшифровке всё равно, откуда взялся файл — из видео, с телефона, из записи экрана или от коллеги по почте. Ей всё равно, что вы работаете на Mac. Дальше это та же самая задача, что и на любом другом компьютере, а значит, выбор сводится только к инструменту расшифровки и ничему больше.
Здесь же желание обойтись без регистрации сталкивается с реальностью, так что скажу прямо. Всё, что работает целиком в браузере, может честно обещать, что файл никуда не уходит с компьютера, и некоторые инструменты действительно так и работают. Но такие браузерные инструменты обычно умеют работать с субтитрами и подсчётом — то есть с тем, что уже является текстом. А настоящее распознавание речи в двухчасовой записи — задача куда тяжелее, и инструменты, которые с ней справляются, как правило, требуют либо установленного приложения, либо загрузки файла на сервер. Что бы вы ни выбрали, именно этот вопрос стоит задать заранее, и ответ на него должен находиться легко.
SozAI — один из вариантов: приложение для расшифровки на macOS, которое работает с аудио- и видеофайлами, записями и ссылками на YouTube, умеет разделять реплики по говорящим, делать краткие содержания и переводить на 99+ языков. На том же сайте есть бесплатные браузерные инструменты для субтитров и подсчёта, которые работают целиком в браузере — ничего не загружается, аккаунт не нужен. Сами они звук не расшифровывают, но пригодятся, когда расшифровка уже готова и с ней нужно поработать дальше.
Чего расшифровка не сделает за вас
Просите временные метки, если задача — вернуться к конкретному моменту. Текст без них можно искать — нужную фразу вы найдёте, — но найти фразу не то же самое, что найти место в видео, где её произнесли. Если вы расшифровываете лекцию, чтобы потом сразу перейти к нужным десяти минутам, метки времени — это вообще вся суть. Если вы расшифровываете, чтобы прочитать один раз и больше к видео не возвращаться, метки — лишний шум. Решите, какая у вас задача, до того как начнёте: добавлять метки потом означает делать работу дважды.
Ожидайте, что текст будет отражать качество исходной записи. Распознавание речи работает с тем, что реально записано, а запись, сделанная через всю комнату, где люди перебивают друг друга, даёт системе куда меньше шансов, чем чистая запись. Извлечение звука из видео звук не улучшает — оно просто выделяет то, что уже было записано. Если исходный звук плохой, придётся редактировать расшифровку руками, и ни один из предыдущих шагов это не исправит.
И примите, что часть видео просто не переживёт эту процедуру. Слайды, схемы, всё, что написано на доске, кто на что показывал руками — всё это пропадёт, потому что вы сознательно отказались от картинки ради файла, с которым можно нормально работать. Для разговора это не потеря. А для демонстрации или презентации расшифровка — это только половина записи, и оригинальное видео стоит сохранить рядом с ней.

