Perkara Penting
Transkrip boleh betul setiap patah perkataan tetapi masih tersilap letak di bawah nama yang salah, sebab mengecam pertuturan dan mengagihkannya kepada penutur adalah dua operasi yang berasingan. Pelabelan penutur berfungsi berdasarkan ciri-ciri suara, jadi ia paling baik apabila ada beberapa suara yang jelas berbeza, dirakam pada kelantangan yang lebih kurang sama oleh satu mikrofon. Ia bergelut apabila orang bercakap serentak, apabila penutur bersuara perlahan atau menyertai lewat, dan ia tidak akan sekali-kali memberikan anda nama sebenar secara automatik — bahagian itu anda tambah sendiri kemudian.
Jika anda pernah membuka transkrip perbualan berkumpulan dan mendapati separuh daripadanya disandarkan kepada orang yang salah, kemungkinan besar perkataan-perkataannya sendiri sudah tepat. Masalahnya terletak satu peringkat di atas, pada bahagian proses yang menentukan siapa yang bercakap, bukan apa yang dicakapkan. Bahagian ini bergantung pada maklumat yang berbeza dan gagal dengan cara yang berbeza, dan hampir semua yang menentukan sama ada ia berjaya atau tidak sebenarnya ditetapkan semasa proses merakam, jauh sebelum sebarang perisian menyentuh fail tersebut.
Inilah bahagian yang berbaloi difahami jika anda bakal merakam temu bual, panel, atau perbualan keluarga dan anda benar-benar perlu tahu siapa cakap apa — bukan sekadar apa yang dicakapkan. Sebahagiannya berkaitan dengan lokasi anda meletakkan mikrofon. Sebahagian lagi berkaitan dengan menerima hakikat bahawa situasi tertentu tidak akan pernah dapat dilabel dengan kemas, tidak kira apa sahaja yang anda gunakan untuk memprosesnya.
Dua tugas berasingan, satu transkrip
Mengecam perkataan dan menentukan siapa yang menuturkannya bukan tugas yang sama, walaupun akhirnya kedua-duanya terkumpul dalam dokumen yang sama. Tugas pertama mendengar bunyi dan mentafsir bahasa — ia sebahagian besarnya tidak kisah suara siapa yang menghasilkannya. Tugas kedua mendengar bunyi yang sama tetapi menyoal perkara yang berbeza: adakah suara ini sepadan dengan suara dua ayat sebelum ini, atau adakah ini penutur baharu? Soalan kedua itu dijawab berdasarkan ciri-ciri suara — pic, nada, rentak, cap jari akustik pertuturan seseorang — bukan berdasarkan perkataan itu sendiri.
Inilah sebabnya sebuah transkrip boleh tepat perkataan demi perkataan tetapi masih tersilap mengagihkan baris pertuturan. Transkripsi berjaya. Pengasingan penutur tidak. Kedua-duanya boleh gagal secara berasingan, dan apabila seseorang memberitahu anda transkrip itu ‘salah’, wajar disemak dahulu tugas mana yang sebenarnya gagal, kerana caranya membaikinya berbeza bergantung pada jawapannya.
Apa yang membuatkan pengasingan penutur berfungsi
Pengasingan penutur berfungsi paling baik dengan bilangan suara yang kecil yang jelas berbeza antara satu sama lain, kesemuanya dirakam oleh satu kedudukan mikrofon yang mendengar setiap orang pada kelantangan yang lebih kurang sama. Itulah keadaan ideal: dua atau tiga orang, suara yang jelas berbeza, satu peranti rakaman yang diletakkan di tempat yang boleh mendengar seluruh bilik secara sama rata.
Setiap penyimpangan daripada keadaan ideal itu ada kosnya. Lebih ramai penutur bermakna lebih banyak peluang untuk dua suara terdengar cukup serupa sehingga bercampur aduk. Suara yang berbunyi serupa — dua orang berumur dan berloghat lebih kurang sama, misalnya — lebih sukar dibezakan berbanding suara yang dalam dan suara yang nyaring. Dan jika seorang dirakam jauh lebih kuat berbanding yang lain, sistem mula menganggap perbezaan kelantangan sebagai perbezaan penutur, sedangkan sebenarnya bukan begitu.
Tidak ada apa-apa yang luar biasa di sini. Ia lebih kurang sama dengan apa yang seseorang akan perasan juga, jika mereka memejamkan mata dan sekadar mendengar. Kelebihan perisian ini adalah kesabaran dan konsistensi sepanjang sejam audio, bukan deria tambahan yang tidak ada pada pendengar biasa.
Di mana ia gagal: orang bercakap serentak
Ada satu situasi yang secara konsisten merosakkan pelabelan penutur, dan tidak kira betapa baik persediaan anda, ia tidak dapat diperbaiki: pertindihan pertuturan yang sebenar, apabila dua orang bercakap pada masa yang sama. Semasa pertindihan ini tidak ada isyarat bersih yang tergolong pada satu suara — audio itu adalah gabungan kedua-duanya, dan tidak ada apa-apa yang boleh diagihkan secara bersih. Apa yang biasanya berlaku ialah perkataan seorang penutur terlipat masuk ke dalam giliran penutur yang lain, sehingga transkrip menunjukkan satu kenyataan berterusan yang sebenarnya adalah dua orang bercakap serentak.
Ini bukan pepijat yang boleh dibaiki kemudian. Ia adalah had yang terbina dalam sifat masalah itu sendiri — anda tidak boleh mengasingkan semula dua suara yang bertindih menjadi dua aliran bersih selepas fakta itu berlaku, bukan secara boleh dipercayai. Jangkaan yang jujur adalah mana-mana bahagian rakaman yang mempunyai pertindihan sebenar akan memerlukan semakan manual untuk menyelesaikan siapa cakap apa, atau ia akan kekal disandarkan kepada sesiapa yang diteka oleh sistem. Jika perbualan anda banyak orang bercakap bertindih-tindih — panel yang panas, makan malam keluarga yang penuh perdebatan — rancanglah bahawa bahagian transkrip itu akan memerlukan pembetulan manual, dan jangan nilai keseluruhan alat itu berdasarkan bahagian tersebut sahaja.
Lokasi mikrofon lebih penting daripada jenis mikrofon
Jarak ke mikrofon memberi kesan lebih besar kepada pelabelan penutur berbanding kualiti mikrofon itu sendiri. Telefon yang diletakkan di tengah-tengah meja biasanya memberikan pengasingan penutur yang lebih baik berbanding mikrofon yang lebih bagus tetapi diletakkan berdekatan dengan seorang sahaja, sebab peserta yang bersuara perlahan dan berada jauh itulah yang paling mudah hilang daripada sistem. Jika seseorang secara konsisten bersuara jauh lebih perlahan berbanding orang lain kerana dia paling jauh daripada mikrofon, jurang kelantangan itu boleh lebih memberi kesan kepada pelabelan penutur berbanding sebarang perbezaan peralatan.
Untuk perbualan berkumpulan, ini menunjukkan satu peraturan mudah: letakkan peranti rakaman di tempat yang tengah, bukan di tempat yang paling senang dicapai. Di tengah meja, bukan di hujung yang paling hampir dengan hos. Jika orang duduk berselerak dalam bilik berbanding duduk berdekatan antara satu sama lain, itu adalah kes yang lebih sukar tidak kira peralatan apa pun yang digunakan, dan lebih baik diketahui awal-awal berbanding disedari kemudian.
Mendapatkan nama sebenar, bukan Penutur 1, Penutur 2
Tidak ada apa-apa dalam audio itu sendiri yang memberitahu sistem transkripsi nama sesiapa pun — ia boleh mengesan bahawa dua suara berbeza wujud, tetapi ia tidak ada cara untuk mengetahui yang seorang bernama Aisyah dan seorang lagi bernama Rahman. Jadi hasilnya keluar dilabel dengan pengecam tanpa nama: Penutur 1, Penutur 2, dan seterusnya. Menukar label itu kepada nama sebenar adalah langkah manual, dan ia hanya perlu dibuat sekali, di bahagian atas transkrip, memadankan setiap label dengan satu nama.
Satu perkara yang menjadikan langkah itu mudah berbanding membosankan adalah dengan meminta setiap orang menyebut nama mereka dengan kuat berhampiran permulaan rakaman. Ia hanya mengambil masa kira-kira sepuluh saat dan memberikan anda pautan yang jelas — anda tahu bahawa suara yang menyebut ‘ini Rahman’ berhampiran permulaan itulah suara yang perlu dilabel Rahman untuk selebihnya dokumen tersebut. Jika langkah ini dilangkau, anda terpaksa memadankan suara dengan nama berdasarkan ingatan atau konteks, yang masih boleh berhasil tetapi mengambil masa lebih lama dan lebih mudah tersilap semakin ramai penutur yang terlibat.
Jika anda merakam temu bual secara khusus, tabiat ini berbaloi dijadikan sebahagian daripada cara anda memulakan setiap sesi — lihat nota mengenai transkripsi temu bual untuk lebih lanjut tentang menyediakannya dengan baik sejak minit pertama. Untuk menukar rakaman siap menjadi teks berlabel setelah anda memilikinya, menukar audio kepada teks membincangkan langkah penukaran sebenar, dan aplikasi seperti aplikasi transkripsi daripada SozAI boleh menghasilkan label penutur, ringkasan dan terjemahan merentas pelbagai bahasa sebaik sahaja anda mempunyai rakaman tersebut — menamakan penutur selepas itu masih tanggungjawab anda, tetapi itu adalah bahagian yang cepat.
Apa yang perlu dijangka secara realistik
Walaupun dengan persediaan yang baik, beberapa situasi menghasilkan keputusan yang secara semula jadi tidak sempurna, dan lebih baik mengetahuinya lebih awal daripada menganggapnya sebagai kegagalan.
- Penutur yang menyertai separuh jalan rakaman, selepas sistem sudah menetapkan profil suaranya, selalunya digabungkan ke dalam penutur sedia ada berbanding diberikan label baharu tersendiri.
- Seseorang yang hanya menyebut beberapa patah perkataan sepanjang rakaman — persetujuan ringkas, soalan satu baris — kerap tergabung dengan sesiapa yang bercakap di sekelilingnya, sebab tidak cukup suaranya untuk sistem membina profil berasingan.
- Pertuturan bertindih yang sebenar, seperti yang dibincangkan sebelum ini, cenderung tergabung menjadi giliran satu penutur sahaja.
- Kumpulan besar dengan banyak suara yang berbunyi serupa akan menghasilkan lebih banyak kesilapan label berbanding kumpulan kecil dengan suara yang jelas berbeza, semata-mata sebab ada lebih banyak peluang untuk keliru.
Semua ini bukan sebab untuk melangkau transkripsi rakaman yang rumit — ini adalah sebab untuk menjangkakan satu semakan manual yang ringkas pada bahagian-bahagian yang terjejas, bukan menganggap keseluruhan dokumen perlu disemak semula. Jika anda merakam sesuatu yang anda tahu akan mempunyai kerumitan seperti ini, ada baiknya juga anda tentukan lebih awal sama ada anda perlukan setiap patah perkataan ditranskripsikan atau hanya sorotan yang berlabel; mentranskripsikan segalanya bukan sentiasa pilihan yang berguna, terutamanya untuk rakaman panjang di mana anda pada dasarnya hanya perlu tahu siapa berkata apa — jenis penggunaan yang dibincangkan dalam menukar rakaman kepada nota mesyuarat. Dan jika anda mahu menguji bagaimana sesuatu rakaman dilabel sebelum komited kepada fail yang lebih panjang, memuat turun aplikasi daripada halaman muat turun dan menjalankan sampel ringkas dahulu akan memberitahu anda lebih banyak berbanding sebarang nasihat umum.
Apa yang sebenarnya memberi kesan
Jika ada satu perkara yang perlu diambil daripada semua ini, ia adalah bahawa rakaman itu sendiri lebih penting berbanding perisian. Mikrofon yang diletakkan di tengah, bilangan suara yang kecil dan jelas berbeza, setiap orang menyebut nama mereka pada permulaan, dan penerimaan bahawa pertuturan bertindih akan memerlukan semakan manual — gabungan itu akan membawa anda lebih jauh berbanding sebarang tetapan atau pilihan ciri yang dibuat selepas fakta. Langkah pelabelan itu memang melakukan kerja sebenar, tetapi ia bekerja dengan apa sahaja yang diberikan oleh rakaman itu, dan rakaman yang dibuat dengan mengambil kira pengasingan penutur akan sentiasa dilabel dengan lebih baik berbanding rakaman yang dibuat tanpa mengambil kira perkara itu, tidak kira apa pun yang menjalankan transkripsi selepas itu.

