Perkara Penting
macOS tidak akan mentranskripsi fail video dengan sendirinya. Apa yang ia boleh buat, tanpa sebarang muat turun, adalah mengeluarkan trek audio daripada video menggunakan QuickTime Player, yang menghasilkan fail yang jauh lebih kecil untuk anda gunakan. Fungsi dictation terbina dalam menaip apa yang mikrofon dengar semasa anda bercakap, secara langsung, jadi ia bukan alat untuk rakaman yang anda sudah ada. Transkripsi adalah langkah yang berasingan, dan ia sama sahaja tidak kira komputer apa yang anda guna.
Anda ada video tersimpan di Mac anda. Rakaman skrin sesuatu mesyuarat, kuliah yang dihantar seseorang kepada anda, klip yang anda simpan. Anda mahukan kata-kata di dalamnya. Anda tidak mahu buat akaun dengan syarikat yang anda tak pernah dengar hanya untuk mendapatkannya.
Kerja ini terbahagi kepada dua bahagian dengan jelas. Pertama, keluarkan fail audio yang bersih daripada video. Kedua, tukarkan audio itu kepada teks. Bahagian pertama, Mac anda sudah boleh buat, sekarang, dengan perisian yang sedia ada dalam mesin itu. Bahagian kedua, ia tidak boleh, dan berapa banyak pun anda menyelongkar System Settings tidak akan mengubah keadaan itu. Dengan mengetahui di mana garis pemisah ini berada, anda dapat jimatkan masa daripada mencari menu yang sebenarnya tidak wujud.
Apa yang macOS sudah boleh lakukan
QuickTime Player disertakan pada setiap Mac. Ia memainkan video, merakam skrin, dan boleh mengeksport audio daripada fail video. Fungsi terakhir itu yang paling berguna di sini, dan selalunya itu satu-satunya langkah yang anda perlu ambil sebelum menyerahkan fail itu kepada alat lain.
macOS juga ada fungsi dictation, yang menukar pertuturan kepada teks semasa anda bercakap. Voice Memos pun ada, dan ia disegerakkan dengan aplikasi yang sama pada iPhone melalui iCloud. Dengan ketiga-tiga ini, anda boleh merakam bunyi, menyimpannya, dan menaip menggunakan suara anda.
Tiada satu pun daripadanya akan membaca fail video sedia ada dan memberikan anda transkrip. Ini perlu dinyatakan dengan jelas, sebab alat-alat ini begitu rapat antara satu sama lain sehingga rasa seperti fungsi itu mesti ada tersembunyi di mana-mana. Ia tidak ada. Mac memang bagus menghasilkan rakaman tetapi lemah dalam menukarkannya kepada teks.
Keluarkan audio dahulu
Fail video adalah bekas (container). Ia membawa gambar dan ia membawa trek audio, dan transkripsi hanya menyentuh audio sahaja. Video itu cuma beban yang tidak diperlukan untuk tujuan ini.
Jadi, eksport audio sebelum buat apa-apa lagi. QuickTime Player boleh buat ini, bermakna langkah pertama tidak memerlukan sebarang kos dan tidak perlu pasang apa-apa. Apa yang anda dapat adalah fail yang jauh lebih kecil berbanding video asal — kadangkala jauh lebih kecil, bergantung pada jenis video itu.
Perbezaan saiz ini bukan lagi sekadar konsep apabila rakaman itu panjang. Kuliah dua jam dalam bentuk video adalah sesuatu yang menyusahkan untuk dipindahkan, dimuat naik, atau disimpan beberapa salinan semasa anda tentukan alat mana yang hendak digunakan. Dua jam yang sama dalam bentuk audio pula ialah fail yang kecil dan mudah dikendalikan tanpa perlu berfikir panjang. Jika anda ada satu folder rakaman yang perlu diproses, mengeluarkan audio dahulu itulah beza antara menghabiskan satu petang berbanding satu hujung minggu.
Pengeluaran audio ini juga menjawab soalan yang selalu mengelirukan orang: sama ada mereka perlukan alat yang khusus mengendalikan fail video ditukar kepada teks, atau memadai sahaja dengan transkripsi audio biasa. Sebaik sahaja audio itu menjadi fail berasingan, perbezaan itu tidak lagi penting. Mana-mana alat transkripsi yang menerima audio akan menerima fail anda.
Dictation itu kerja yang berbeza
Dictation dan transkripsi sering digunakan seolah-olah kedua-duanya perkataan yang sama. Sebenarnya tidak, dan perbezaan itu adalah perkara yang menghalang anda daripada mendapat transkrip yang anda inginkan.
Dictation mendengar mikrofon dan menulis apa yang ia dengar, secara masa nyata, semasa ia berlaku. Anda bercakap, teks muncul. Ia adalah kaedah menaip. Transkripsi pula mengambil rakaman yang sudah wujud — sesuatu yang telah berlaku sejam atau setahun yang lalu — dan menghasilkan teks daripadanya. Satu adalah alat input, satu lagi adalah proses penukaran.
Anda boleh cuba merapatkan jurang ini dengan memainkan video secara kuat dan biarkan dictation mendengar melalui pembesar suara anda. Ada orang buat begini. Ia tidak berkesan. Anda sebenarnya menyuruh mikrofon merakam semula bunyi yang sudah pernah dirakam sekali, dalam sebuah bilik, dengan bunyi seadanya bilik itu, dan anda perlu duduk menunggu sepanjang tempoh video itu berjalan. Satu jam video memakan masa satu jam anda. Untuk apa-apa yang lebih panjang daripada klip pendek, ini bukan pilihan yang serius. Ada lagi yang boleh dibincangkan tentang speech to text di Mac dan di mana kaedah terbina dalam ini akan mula tidak mencukupi, tetapi ringkasnya, dictation memang tidak direka untuk fail.
Apabila anda belum ada fail lagi
Semua yang dibincangkan di atas mengandaikan video itu sudah ada dalam cakera anda. Kadangkala ia tidak begitu. Perkara yang anda mahu dapatkan kata-katanya mungkin panggilan yang sedang berlangsung, atau video yang dimainkan dalam tab pelayar, dan tiada apa untuk dikeluarkan audionya sebab tiada apa yang disimpan.
Di sinilah Mac menimbulkan halangan sebenar. Merakam audio sistem Mac anda sendiri — bunyi yang keluar daripada mesin itu, bukan yang masuk ke mikrofon — bukan sesuatu yang didedahkan oleh macOS secara lalai. Rakaman skrin memberikan anda gambar. Mendapatkan bunyi yang bersama gambar itu adalah masalah berasingan, dan ia adalah satu langkah yang paling kerap menghentikan orang terus. Jika anda pernah dapat rakaman mesyuarat yang senyap dan tidak faham apa yang tersalah, ini lah sebabnya. Anda tidak buat sebarang kesilapan.
Ada cara untuk mengatasinya, dan lebih baik anda faham cara itu sebelum anda perlukannya berbanding lima minit selepas panggilan yang tidak boleh diulang. Cara-cara merakam skrin di Mac bersama audio adalah topik tersendiri. Yang penting di sini, ini adalah masalah rakaman, bukan masalah transkripsi, dan menyelesaikannya membawa anda kembali kepada situasi biasa: fail dalam cakera.
Ada satu cara yang terus mengelakkan masalah ini. Voice Memos di Mac berkongsi rakaman dengan aplikasi yang sama pada iPhone melalui iCloud, jadi apa-apa yang anda rakam pada telefon akan muncul di Mac tanpa perlu emel fail kepada diri sendiri atau mencari kabel. Untuk perbualan bersemuka, atau ceramah yang anda hadiri, merakam melalui telefon dan mengambil fail itu di desktop lebih mudah berbanding bergelut dengan isu audio sistem. Ia sudah tentu tidak membantu untuk bunyi yang dihasilkan oleh Mac itu sendiri.
Menukar audio kepada teks
Sebaik sahaja audio wujud sebagai fail, semua keputusan sebelum ini tidak lagi penting. Transkripsi tidak kisah sama ada fail itu berasal daripada video, telefon, rakaman skrin, atau sesuatu yang dihantar oleh rakan sekerja anda. Ia juga tidak kisah anda menggunakan Mac. Dari sini, ia adalah kerja yang sama tidak kira mesin apa pun, bermakna pilihan anda hanya bergantung pada alat transkripsi itu sendiri, bukan apa-apa lagi.
Ini juga titik di mana keinginan untuk elak daftar akaun bertembung dengan realiti, jadi biar saya jelaskan terus. Apa-apa yang berjalan sepenuhnya dalam pelayar anda boleh menjanjikan fail anda tidak akan meninggalkan mesin, dan sesetengah alat memang berfungsi begitu. Tetapi alat pelayar jenis ini biasanya hanya mengendalikan perkara seperti fail sarikata dan pengiraan — teks yang sudah menjadi teks. Pengecaman pertuturan sebenar pada rakaman dua jam adalah kerja yang lebih berat, dan alat yang melakukannya biasanya memerlukan sama ada aplikasi yang dipasang atau fail anda di pelayan mereka. Apa jua yang anda pilih, itulah soalan yang perlu ditanya, dan jawapannya sepatutnya mudah dicari.
SozAI adalah satu pilihan: aplikasi transkripsi untuk macOS yang mengendalikan fail audio dan video, rakaman dan pautan YouTube, dengan label penutur, ringkasan dan terjemahan merentasi 99+ bahasa. Laman yang sama juga menyediakan alat sarikata dan pengiraan percuma berasaskan pelayar yang berjalan sepenuhnya dalam pelayar anda tanpa sebarang muat naik dan tanpa akaun — alat-alat ini tidak mentranskripsi audio, tetapi berguna sebaik sahaja anda ada transkrip untuk diproses.
Apa yang transkrip tidak akan lakukan untuk anda
Minta cap masa (timestamp) jika tujuan anda adalah untuk kembali ke saat tertentu. Transkrip tanpa cap masa hanyalah dinding teks yang boleh dicari — anda akan jumpa ayat itu — tetapi menjumpai ayat itu bukan sama seperti menjumpai tempat dalam video di mana ia disebut. Jika anda mentranskripsi kuliah supaya boleh terus melompat ke sepuluh minit yang penting, cap masa itulah fungsi utamanya. Jika anda mentranskripsi supaya boleh baca sekali sahaja dan tidak akan buka video itu lagi, cap masa hanya jadi bahan tambahan yang tidak perlu. Tentukan yang mana anda buat sebelum mula, sebab menambah cap masa selepas itu bermakna anda perlu buat kerja dua kali.
Jangkakan teks itu mencerminkan rakaman asalnya. Pengecaman pertuturan bergantung pada apa yang sebenarnya dirakam, dan rakaman yang dibuat merentasi bilik dengan orang bercakap serentak memberikan bahan yang kurang baik berbanding rakaman yang bersih. Mengeluarkan audio daripada video tidak memperbaiki kualiti audio itu; ia hanya mengasingkan apa yang sudah ada. Jika bunyi sumbernya lemah, anda akan terpaksa mengedit transkrip itu, dan tiada langkah sebelum ini dalam proses ini dapat membetulkannya.
Dan terimalah hakikat bahawa sebahagian daripada video itu tidak akan terbawa dalam proses ini. Slaid, gambar rajah, apa-apa yang ditulis pada papan putih, siapa yang menunjuk ke arah apa — semuanya akan hilang, sebab anda sengaja buang gambar untuk mendapatkan fail yang boleh anda kendalikan. Untuk perbualan, itu tidak merugikan apa-apa. Untuk demo atau pembentangan, transkrip hanya separuh daripada rekod sebenar, dan anda akan mahu simpan video asal bersama-sama transkrip itu.

