Intipati Penting
Tidak ada satu angka ketepatan yang universal, dan mana-mana peratusan yang anda pernah baca sebenarnya cuma menggambarkan satu sistem yang diuji pada satu rakaman. Audio bersih dengan seorang penutur dan perbualan berkumpulan yang bising berada pada dua hujung yang jauh berbeza — tidak ada satu peratusan yang boleh merangkumi kedua-duanya. Faktor yang benar-benar menentukan hasil anda ialah rakaman itu sendiri: jarak mikrofon, bunyi latar, pertindihan percakapan, dan liputan loghat. Kesilapan juga tidak tersebar sama rata — kebanyakan transkrip kelihatan lancar, tetapi nama, istilah khusus, nombor dan bahagian bertindih suara yang sering tersasar. Untuk mencari satu-satu babak dalam rakaman, itu tidak jadi masalah. Untuk memetik kata-kata, semak setiap baris dengan audio sebenar.
Anda mungkin pernah nampak sesuatu peratusan yang dilekatkan pada alat transkripsi tertentu. Ia memang ukuran sebenar bagi sesuatu perkara. Cuma bukan ukuran bagi apa yang akan berlaku bila anda masukkan rakaman anda sendiri, dan menganggapnya sebagai jaminan itulah yang selalu membuatkan orang kecewa pada waktu yang paling tidak sesuai.
Soalan yang lebih berguna bukanlah setakat mana ketepatan transkripsi automatik secara umum. Soalan sebenar ialah sama ada transkrip yang anda dapat itu cukup baik untuk kegunaan khusus yang anda mahu. Dua soalan ini berbeza dan jawapannya pun berbeza, sebab fail yang sama boleh sangat berguna untuk mencari satu babak, tetapi terus tidak boleh dipakai untuk memetik kata-kata daripadanya.
Satu angka ketepatan mengukur satu rakaman, bukan satu sistem
Mana-mana dakwaan ketepatan adalah hasil daripada menjalankan satu sistem tertentu ke atas satu audio tertentu. Tukar audio itu, angka pun berubah. Ini bukan kelemahan cara ukurannya dibuat — ini memang sifat semula jadi ukuran itu.
Bayangkan dua hujung skala. Seorang penutur, dekat dengan mikrofon, dalam bilik yang senyap, bercakap dengan loghat yang banyak wakilnya dalam data, tentang perkara biasa. Ini akan ditranskripsi dengan sangat baik. Sekarang bayangkan empat orang duduk mengelilingi meja, penghawa dingin berbunyi, mereka bercakap bertindih-tindih, menggunakan singkatan khusus industri masing-masing, dua daripada mereka pula berjarak sehasta setengah daripada telefon. Ini akan ditranskripsi jauh lebih teruk. Kedua-duanya ukuran yang jujur bagi sistem yang sama. Satu angka tunggal tidak boleh menggambarkan kedua-duanya, dan jurang antara keduanya terlalu besar sehingga purata pun tidak bermakna.
Jadi bila anda nampak satu angka tanpa tahu audio yang digunakan untuk mengukurnya, maklumat penting sebenarnya ialah bahagian yang tidak diberitahu itu. Apa yang anda tahu cumalah seseorang pernah menguji sesuatu. Ujian yang paling bermakna untuk anda ialah bahan anda sendiri. Ambil beberapa minit rakaman yang serupa dengan yang anda selalu gunakan, jalankan melalui sistem itu, dan baca hasilnya sambil dengar audionya. Itu lebih bermaklumat daripada sebarang dakwaan yang diterbitkan, dan masanya lebih singkat daripada membaca artikel perbandingan.
Rakaman itu lebih mempengaruhi hasil berbanding perisian
Ramai orang membanding-bandingkan alat untuk cari ketepatan. Bagi kebanyakan rakaman, itu bukan tempat yang tepat untuk mula. Keadaan semasa rakaman dibuat lebih mempengaruhi hasil berbanding pilihan enjin transkripsi.
- Jarak mikrofon. Setiap tambahan jarak membawa lebih banyak bunyi bilik dan kurang suara. Telefon yang diletak di atas meja antara dua orang menghasilkan rakaman yang berbeza daripada telefon yang diletak dekat dengan seorang sahaja.
- Bunyi latar. Bunyi lalu lintas, kafe, kipas, papan kekunci. Bunyi ini bukan sekadar berada di belakang percakapan — ia bersaing dengannya, dan perkataan yang selalu hilang ialah perkataan perlahan di hujung ayat.
- Pertindihan percakapan. Bila dua orang bercakap serentak, tidak ada isyarat bersih untuk ditranskripsi. Sesuatu tetap akan ditulis, dan selalunya ia gabungan kedua-dua suara.
- Liputan loghat. Sesetengah loghat jauh lebih banyak diwakili dalam data latihan sistem ini berbanding yang lain, dan loghat yang kurang diwakili itu memberi hasil lebih buruk walaupun audionya sama bersih.
Alat-alat ini memang berbeza antara satu sama lain, dan kalau bahan anda selalu bermasalah dengan satu jenis kesukaran yang sama, cuba beberapa alat memang berbaloi dengan masa yang diambil. Tetapi jurang antara dua alat yang sama-sama baik pada audio yang sama biasanya lebih kecil berbanding jurang antara audio yang baik dan audio yang buruk pada alat yang sama. Menggerakkan mikrofon lebih dekat memberi lebih manfaat berbanding menukar produk. Kalau anda mahu faham apa sebenarnya perisian ini lakukan pada bahan yang anda berikan, penjelasan umum tentang cara transkripsi AI berfungsi menerangkan sebab keadaan-keadaan ini penting.
Kesilapan tidak tersebar sama rata dalam fail
Inilah bahagian yang selalu terlepas pandang, dan ia lebih penting daripada angka besar di kepala artikel. Kesilapan bertumpu di tempat-tempat tertentu. Sebahagian besar transkrip terhasil dengan bersih, dan kesilapan tertumpu di beberapa tempat yang boleh dijangka: nama khas, istilah teknikal, nombor, dan mana-mana babak orang bercakap bertindih-tindih.
Fikirkan apa maksudnya bila membaca transkrip. Satu halaman perbualan biasa ditranskripsi dengan baik dan mengalir lancar bila dibaca. Kemudian muncul satu nama keluarga, atau nama produk, atau satu nombor, dan ia tersasar. Tidak ada apa-apa pada halaman itu yang menandakan perbezaannya. Perkataan yang salah itu ditulis dalam gaya tulisan yang sama yakinnya dengan yang betul, dikepung oleh ayat-ayat yang tepat — dan itulah tepat konteks yang membuatkan kesilapan itu kelihatan munasabah. Sebuah transkrip boleh dibaca dengan lancar dan tetap salah di tempat-tempat yang paling anda perlukan.
Ada sebab kategori-kategori ini gagal serentak. Perkataan biasa dibatasi oleh apa yang ada di sekelilingnya, jadi sistem yang tersalah dengar satu perkataan masih boleh diselamatkan oleh konteks. Nama tidak dibatasi begitu; hampir apa-apa bunyi boleh jadi nama seseorang, dan tidak ada peraturan tatabahasa yang boleh menolak tekaan yang salah. Istilah khusus menghadapi masalah yang sama, malah lebih rumit sebab perkataan biasa selalunya berbunyi cukup hampir untuk menggantikan istilah teknikal itu. Nombor adalah kes paling tajam, sebab sedikit perbezaan bunyi menghasilkan nilai yang sama sekali berbeza, sedangkan ayat itu tetap kelihatan betul walau nombornya salah.
Tanda baca cuma tekaan tentang di mana ayat berhenti
Tanda baca automatik bukan transkripsi. Ia adalah kesimpulan yang dibuat daripada kesenyapan, intonasi dan rentak percakapan tentang di mana satu fikiran berhenti dan yang seterusnya bermula. Kebanyakan masa tekaan itu betul, atau cukup betul sehingga tidak siapa perasan.
Bila tekaan itu salah, maksud ayat pun bergeser. Noktah yang tersasar di tengah-tengah klausa boleh memisahkan satu syarat daripada perkara yang disyaratkannya, jadi kenyataan yang berhati-hati boleh bertukar jadi kenyataan tegas, dan syarat pula bertukar jadi dakwaan mutlak. Setiap perkataan boleh betul secara individu, tetapi ayat itu tetap boleh menyatakan sesuatu yang tidak pernah dikatakan oleh penutur asal. Kesilapan jenis ini tidak kelihatan pada halaman, sebab tidak ada apa-apa yang boleh diperasan. Anda tidak boleh menyemak kesilapan ini dengan membaca semula transkrip. Hanya audio boleh memastikan kebenarannya.
Label penutur ada kelemahan yang serupa. Biasanya betul sepanjang seorang penutur bercakap dan paling tidak boleh dipercayai pada waktu pertukaran penutur — di situlah satu selaan pendek boleh tersalah label kepada orang lain. Kalau anda mahu memetik sesuatu berhampiran pertukaran penutur, itulah baris yang wajib didengar semula.
Tetapkan standard mengikut tujuan transkrip itu
Soalannya bukan sama ada transkrip itu tepat. Soalannya ialah sama ada ia cukup tepat untuk tujuan tersebut, dan tujuan itu berbeza-beza lebih daripada yang orang jangkakan.
Kalau anda menggunakan transkrip untuk mencari sesuatu, kesilapan yang bertaburan tidak jadi masalah. Anda cari satu perkataan, anda sampai berhampiran minit yang betul, anda mainkan audionya. Transkrip itu sudah menjalankan tugasnya walaupun ada satu nama yang tersasar tiga baris di atas. Sama juga bila anda selak-selak satu jam rakaman untuk tentukan bahagian dua puluh minit mana yang berbaloi diberi perhatian, atau menukar rakaman audio kepada teks supaya anda boleh membacanya lebih cepat daripada mendengarnya.
Kalau transkrip itu akan dipetik, diterbitkan, difailkan, atau dijadikan sandaran oleh seseorang yang tidak berada dalam bilik itu, standardnya berbeza dan tidak boleh dikompromi. Setiap baris yang anda mahu guna wajib disemak dengan audio, satu demi satu. Bukan membaca sepintas lalu seluruh dokumen; tetapi mendengar khusus setiap petikan, sebab kesilapan-kesilapan yang disebut di atas itulah yang tidak akan ternampak semasa bacaan sepintas lalu. Ini terpakai lebih kuat lagi untuk mana-mana ayat yang bergantung pada satu nombor atau satu nama.
Untuk dokumen kerja harian, aplikasi adalah pilihan yang paling praktikal. SozAI, tersedia untuk iOS, Android dan macOS, menukar rakaman, fail audio dan video serta pautan YouTube kepada teks lengkap dengan label penutur, ringkasan dan terjemahan merentas lebih 99 bahasa, dan anda tetap perlu semak petikan dengan audio, sama seperti mana-mana hasil automatik lain.
Bila transkrip itu sendiri adalah hasil akhir yang perlu diserahkan, perkhidmatan transkripsi manusia adalah jawapan yang lebih sesuai. Kosnya lebih mahal sebab ada seorang yang duduk dan mendengar, dan itulah sebenarnya yang anda bayar: seseorang yang dengar nama itu dan tulis dengan betul, yang tahu di mana ayat itu sebenarnya berhenti, yang tandakan bahagian yang benar-benar tidak boleh didengar dengan jelas daripada sekadar menekanya. Kalau klien, mahkamah, arkib atau penerbitan yang akan menerima dokumen itu, kos tambahan itu memang membeli sesuatu yang bernilai sebenar. Kalau transkrip itu cuma alat peribadi untuk anda sampai ke audio dengan lebih cepat, kos tambahan itu membeli sesuatu yang anda tidak perlukan.
Rakaman kedua lebih berbaloi daripada sejam menyunting
Memperbaiki cara rakaman dibuat hampir selalu lebih murah daripada memperbaiki hasil selepasnya. Sepuluh minit menggerakkan mikrofon, menutup tingkap, memadamkan kipas dan meminta orang bercakap seorang-seorang akan menjimatkan lebih banyak kerja berbanding sejam menyunting teks selepas itu, dan hasilnya lebih baik daripada suntingan sebab transkrip yang disunting cuma sebaik kesabaran anda sehingga habis menyuntingnya.
Ini paling mudah dilakukan untuk apa-apa yang berulang. Kalau anda selalu merekod jenis perbualan yang sama, satu pusingan memberi perhatian pada persediaan akan memperbaiki setiap rakaman selepas itu. Ini paling penting untuk temu bual, sebab bahannya selalunya tidak boleh diulang dan petikan katalah keseluruhan tujuannya; hal-hal praktikal dalam mentranskripsi temu bual sebenarnya kebanyakannya hal-hal praktikal cara merekodnya.
Kadang-kadang tidak ada peluang kedua. Perbualan itu cuma berlaku sekali, telefon ada dalam poket, dan itulah saja audio yang anda ada. Waktu itu tindakan yang jujur ialah berhenti mengharapkan perisian menyelamatkannya, dan sebaliknya sediakan masa untuk menyunting, atau serahkan kepada seorang manusia. Audio yang sukar tidak akan jadi mudah sekadar sebab anda perlukannya begitu.
Apa yang perlu dijangka bila membuka fail
Jangkakan teks yang lancar dan mudah dibaca, dengan segelintir kata nama yang tersasar. Jangkakan bahagian-bahagian orang bercakap bertindih-tindih akan kelihatan nipis, bercelaru, atau senyap tanpa disedari. Jangkakan pilihan tanda baca yang mungkin tidak sama dengan pilihan anda, dan label penutur yang secara umum betul tetapi tidak boleh dipercayai pada waktu pertukaran penutur. Jangkakan tidak ada tanda amaran, tidak ada penonjolan, tidak ada penanda keraguan. Dokumen itu akan kelihatan sama yakin sepanjang keseluruhannya, dan ia tidak akan sama tepat sepanjang keseluruhannya.
Jangkakan nama dan istilah khusus perlu disemak semula tidak kira betapa bersihnya rakaman itu. Perkara-perkara ini tetap tersasar walaupun pada audio yang baik, cuma kurang kerap saja.
Dan simpan audio itu. Transkrip automatik tidak boleh mengesahkan dirinya sendiri, dan semua semakan yang penting memerlukan pendengaran. Transkrip yang masih ada rakamannya adalah alat kerja yang boleh dipercayai. Transkrip yang rakamannya sudah dipadam adalah dokumen yang tidak siapa boleh sahkan, termasuk anda sendiri.

