สรุปสั้น ๆ
ตัดสินใจเรื่องระดับความตรงตัวให้เรียบร้อยก่อนจะเริ่มพิมพ์ตัวอักษรแรก: แบบตรงตัวทุกคำ (full verbatim) เก็บทุกคำว่า “อืม” และการพูดผิดแล้วเริ่มใหม่ แบบตรงตัวฉบับสะอาด (clean verbatim) เก็บความหมายไว้แต่ตัดคำเติมช่องออก ส่วนแบบเรียบเรียง (edited) จัดไวยากรณ์ให้อ่านลื่น เลือกสัญลักษณ์สำหรับช่วงหยุด การพูดทับกัน และช่วงที่ฟังไม่ชัด เขียนเป็นคำอธิบายสัญลักษณ์ไว้ต้นเอกสาร และใส่ป้ายชื่อผู้พูดให้เหมือนกันทั้งฉบับ หากพิมพ์เอง คู่มือประวัติศาสตร์บอกเล่าของ Texas Tech University Libraries ประเมินว่าใช้เวลาพิมพ์ 6 ชั่วโมงต่อเสียง 1 ชั่วโมง ส่วนคู่มือรายวิชาของ Cornell University ระบุ 4 ถึง 6 ชั่วโมง ถอดความอัตโนมัติให้ฉบับร่างแรกได้ในไม่กี่นาที งานของคนจึงเปลี่ยนจากการพิมพ์เป็นการตรวจเทียบกับเสียงบันทึก
คุณมีไฟล์เสียงสัมภาษณ์อยู่ในมือ และมีคนต้องการบทถอดความที่ใช้อ้างอิง ลงรหัส หรือส่งงานได้ คำถามแรกไม่ใช่ว่าจะใช้แอปอะไร แต่คือจะเก็บคำพูดไว้มากแค่ไหน
คำเติมช่องและการเริ่มประโยคใหม่มีความสำคัญในการวิเคราะห์บทสนทนาและงานทางกฎหมายบางประเภท แต่ในงานอื่นเป็นเพียงสิ่งรบกวน บทความนี้อธิบายระดับความตรงตัวทั้งสามแบบ สัญลักษณ์ที่ใช้ทำเครื่องหมายช่วงหยุดและการพูดทับกัน เวลาที่ต้องใช้เมื่อทำด้วยมือ และสิ่งที่ถอดความอัตโนมัติทำได้ถูกและผิดจากการทดลองกับเสียงบันทึกจริง
วิธีถอดเทปสัมภาษณ์ที่ง่ายที่สุดคืออะไร
ให้ส่งไฟล์เสียงเข้าเอนจินแปลงเสียงเป็นข้อความก่อน แล้วค่อยแก้ชื่อคน สุ่มตรวจเทียบกับเสียง และเติมสัญลักษณ์ที่โครงการต้องการ วิธีนี้เร็วกว่าการเริ่มพิมพ์จากหน้ากระดาษเปล่า และเป็นสิ่งที่คนส่วนใหญ่หมายถึงเวลาพูดว่าง่ายที่สุด การพิมพ์เสียงพูดทั้งชั่วโมงทีละคำตั้งแต่ต้นคือทางที่ช้า ไม่ใช่ทางที่ง่าย
สำหรับคลิปสั้น เครื่องมือบนเบราว์เซอร์ของเราที่ ถอดเทปสัมภาษณ์ออนไลน์ ทำการถอดความรอบแรกให้โดยไม่ต้องมีบัญชี: อัปโหลดไฟล์เสียงแล้วระบบจะถอดความ 5 นาทีแรก ติดป้าย Speaker A, Speaker B ตามลำดับให้กับแต่ละช่วงที่คนพูด พร้อมเวลากำกับ และตรวจจับภาษาให้อัตโนมัติจาก 99 ภาษา ไฟล์ขนาดไม่เกิน 25 MB ส่งไปตามเดิม ไฟล์ที่ยาวกว่านั้นจะถูกตัดเหลือ 5 นาทีในเบราว์เซอร์ก่อนส่งข้อมูลใด ๆ ทั้งเสียงและบทถอดความจะถูกลบที่ผู้ให้บริการทันทีที่ได้ผลลัพธ์ และดูตัวอย่างได้สามครั้งต่ออุปกรณ์ต่อวัน
เท่านี้ก็พอให้เห็นแล้วว่าเครื่องมือคุ้มค่ากับไฟล์นั้นหรือไม่ หากต้องการถอดสัมภาษณ์ทั้งไฟล์ในรอบเดียว ติดป้ายผู้พูดตลอดทั้งไฟล์ และเก็บบทถอดความทุกฉบับไว้ในคลังที่ค้นหาได้ แอป SozAI ทำสิ่งนั้นได้ โดย 30 นาทีแรกใช้ฟรี ดูภาพรวมทั้งหมดได้ที่ การถอดเทปสัมภาษณ์ทำงานอย่างไร หรือ ดาวน์โหลดแอป
แบบตรงตัวทุกคำกับแบบตรงตัวฉบับสะอาดต่างกันอย่างไร
แบบตรงตัวทุกคำเก็บทุกคำตามที่พูดจริง ทั้งคำว่า “อืม” การเริ่มประโยคผิดแล้วเริ่มใหม่ คำที่พูดซ้ำ การพูดติดอ่าง และเสียงหัวเราะที่ได้ยิน ส่วนแบบตรงตัวฉบับสะอาดเก็บถ้อยคำและความหมายของผู้พูดไว้ แต่ตัดคำเติมช่อง การเริ่มประโยคใหม่ และการพูดซ้ำโดยไม่ตั้งใจออก แบบเรียบเรียงไปไกลกว่านั้นอีกขั้นด้วยการจัดไวยากรณ์และลำดับประโยคให้อ่านลื่น ซึ่งเป็นเหตุผลเดียวกับที่มันใช้เป็นหลักฐานว่าสิ่งที่พูดจริงคืออะไรไม่ได้อีกต่อไป
- แบบตรงตัวทุกคำ: การวิเคราะห์บทสนทนา งานทางกฎหมายและงานที่ใช้เป็นหลักฐานบางประเภท
- แบบตรงตัวฉบับสะอาด: งานวิจัยเชิงคุณภาพส่วนใหญ่ งานข่าว งานวิจัยผู้ใช้
- แบบเรียบเรียง: บทความถามตอบที่ตีพิมพ์
| ระดับ | สิ่งที่เก็บไว้ | การใช้งานทั่วไป |
|---|---|---|
| ตรงตัวทุกคำ | ทุกคำตามที่พูดจริง: คำเติมช่อง การเริ่มประโยคใหม่ การพูดซ้ำ การพูดติดอ่าง เสียงที่ได้ยิน | การวิเคราะห์บทสนทนา งานทางกฎหมายและงานที่ใช้เป็นหลักฐานบางประเภท |
| ตรงตัวฉบับสะอาด | ถ้อยคำและความหมายของผู้พูด โดยตัดคำเติมช่องและการเริ่มประโยคใหม่ออก | งานวิจัยเชิงคุณภาพส่วนใหญ่ งานข่าว งานวิจัยผู้ใช้ |
| เรียบเรียง | ไวยากรณ์และลำดับประโยคที่จัดให้อ่านลื่น | บทความถามตอบที่ตีพิมพ์ |
หากบทถอดความจะเข้าสู่โครงการวิจัยมากกว่าจะเป็นชิ้นงานตีพิมพ์ ให้ตัดสินใจเรื่องนี้ก่อนสัมภาษณ์ครั้งแรก ไม่ใช่หลังครั้งที่ห้า เพราะการเปลี่ยนระดับกลางทางหมายถึงต้องแก้บทถอดความฉบับก่อนหน้าให้ตรงกัน ประเด็นเฉพาะของงานวิจัย ได้แก่ การขอความยินยอม การปกปิดตัวตน และการเก็บรักษา อยู่ใน การถอดเทปสัมภาษณ์เพื่องานวิจัย
เขียนบทถอดความสัมภาษณ์อย่างไร
เริ่มด้วยคำอธิบายสัญลักษณ์: ระบุระดับความตรงตัว สัญลักษณ์ที่ใช้ และวิธีติดป้ายผู้พูด เขียนไว้ต้นเอกสารก่อนบรรทัดแรกของคำพูด ทุกคนที่จะลงรหัสหรืออ้างอิงบทถอดความในภายหลังต้องใช้คำอธิบายนี้ และคุณเองก็จะต้องใช้เมื่อผ่านไปหลายสัปดาห์แล้วลืมว่า (.) หมายถึงอะไร
ระบบที่เป็นที่รู้จักที่สุดสำหรับบทถอดความแบบละเอียดมาจาก Gail Jefferson ซึ่งอธิบายไว้ใน Glossary of transcript symbols with an introduction (2004) ตามที่สรุปไว้โดย Clift, Kendrick, Raymond และ Robinson (2024) วงเล็บเหลี่ยมซ้ายใช้ระบุจุดที่การพูดทับกันเริ่มต้น เครื่องหมายเท่ากับเชื่อมคำพูดที่ต่อกันโดยไม่มีช่องว่าง ตัวเลขในวงเล็บเช่น (0.5) คือความเงียบที่วัดเวลาได้เป็นวินาที และ (.) หมายถึงการหยุดที่สั้นเกินกว่าจะวัด แหล่งข้อมูลต่าง ๆ ไม่ตรงกันว่าการหยุดสั้นมากสั้นแค่ไหน ดังนั้นหากคำอธิบายสัญลักษณ์ของคุณใช้ (.) ก็ควรระบุว่าหมายถึงอะไร
โครงการสัมภาษณ์ส่วนใหญ่ไม่ต้องการรายละเอียดระดับนั้น และอ่านง่ายกว่าเมื่อไม่มี ระบบวงเล็บเหลี่ยมแบบเรียบง่ายครอบคลุมสิ่งที่เกิดขึ้นจริง: [ฟังไม่ชัด 00:12:31] สำหรับช่วงที่จับใจความไม่ได้ พร้อมเวลากำกับเพื่อกลับมาหาได้ [พูดทับกัน] เมื่อสองคนพูดพร้อมกัน [หัวเราะ] และเหตุการณ์ที่ไม่ใช่เสียงพูดอื่น ๆ ในวงเล็บเหลี่ยม และป้ายผู้พูดที่ต้นของทุกช่วงที่คนพูด
| สัญลักษณ์ | ความหมาย | ระบบ |
|---|---|---|
| [ | จุดที่การพูดทับกันเริ่มต้น | แบบ Jefferson |
| = | คำพูดที่ต่อกันโดยไม่มีช่องว่าง (latching) | แบบ Jefferson |
| (0.5) | ความเงียบที่วัดเวลาได้ เป็นวินาที | แบบ Jefferson |
| (.) | การหยุดที่สั้นเกินกว่าจะวัด | แบบ Jefferson |
| [ฟังไม่ชัด 00:12:31] | ช่วงที่จับใจความไม่ได้ พร้อมเวลากำกับ | แบบวงเล็บเหลี่ยม |
| [พูดทับกัน] | สองคนพูดพร้อมกัน | แบบวงเล็บเหลี่ยม |
| [หัวเราะ] | เสียงที่ไม่ใช่คำพูด | แบบวงเล็บเหลี่ยม |
นอกจากสัญลักษณ์แล้ว แนวทางการถอดความของ UK Data Service ระบุว่าบทถอดความควรมีรหัสเฉพาะ ใช้รูปแบบการจัดหน้าเหมือนกันตลอดโครงการ ใช้ป้ายผู้พูดเพื่อแสดงการสลับกันพูด และคงการขึ้นบรรทัดใหม่ไว้ เป็นเรื่องเล็กน้อย แต่เป็นสิ่งที่ช่วยให้ค้นหาและเปรียบเทียบบทถอดความได้ในภายหลัง แทนที่จะต้องอ่านทุกฉบับซ้ำ
ป้ายผู้พูดเป็นชื่อที่ซอฟต์แวร์ถอดความรู้ไม่ได้ จึงจะได้ Speaker A และ Speaker B ซึ่งคุณเปลี่ยนชื่อเองด้วยมือเมื่อรู้แล้วว่าใครเป็นใคร การติดป้ายผู้พูดให้สม่ำเสมอ อธิบายวิธีทำให้ชื่อไม่เพี้ยนไประหว่างไฟล์ตลอดทั้งโครงการ
ปกปิดตัวตนไปพร้อมกับการทำงาน ไม่ใช่ทำทีหลัง: แทนชื่อและรายละเอียดที่ระบุตัวบุคคลด้วยตัวแทนที่คงเส้นคงวา เช่น [ผู้เข้าร่วม 2] หรือ [เมือง] ในบทถอดความเลย และเก็บตารางที่จับคู่ตัวแทนกับชื่อจริงไว้ในไฟล์แยกต่างหาก การบันทึกเสียงบุคคลต้องได้รับความยินยอมเกือบทุกที่ และคณะกรรมการจริยธรรมการวิจัยมักต้องการความยินยอมเป็นลายลักษณ์อักษร การถอดความไม่ได้เปลี่ยนข้อกำหนดนั้น
ถอดเทปสัมภาษณ์ใช้เวลานานเท่าไร
ถ้าทำด้วยมือ ให้วางแผนเป็นชั่วโมง ไม่ใช่นาที คู่มือประวัติศาสตร์บอกเล่าของ Texas Tech University Libraries ระบุว่าแม้ผู้ถอดความที่มีประสบการณ์ก็มักทำงานที่อัตราพิมพ์ 6 ชั่วโมงต่อเสียง 1 ชั่วโมง ส่วน คู่มือรายวิชาของ Cornell University ให้ตัวเลขต่ำกว่า คือ 4 ถึง 6 ชั่วโมงต่อเสียงบันทึก 1 ชั่วโมง ความต่างส่วนใหญ่มาจากความสะอาดของเสียงและปริมาณสัญลักษณ์ที่เติมระหว่างทาง
ถอดความอัตโนมัติเปลี่ยนที่ไปของเวลา ไม่ได้ทำให้เวลาหายไป ฉบับร่างกลับมาในไม่กี่นาที สิ่งที่เหลือคือการฟังตามเทียบกับเสียงบันทึก แก้ชื่อและศัพท์เทคนิค แก้ว่าใครพูดอะไรตรงที่ป้ายสลับกัน และเติมสัญลักษณ์ที่โครงการต้องการ สำหรับสัมภาษณ์หนึ่งชั่วโมงนี่ก็ยังเป็นงานจริง เพียงแต่เป็นงานคนละแบบ การถอดความใช้เวลานานแค่ไหนจริง ๆ แยกรายละเอียดต่อไปอีก
ChatGPT ถอดเทปสัมภาษณ์ได้ไหม
แชตบอตจะแปลงไฟล์เสียงเป็นข้อความได้หรือไม่ขึ้นกับผลิตภัณฑ์ แต่บทถอดความสัมภาษณ์ต้องการมากกว่าข้อความ คือเวลากำกับที่ย้อนกลับไปดูได้และการสลับผู้พูดที่เชื่อถือได้ ซึ่งเป็นสิ่งที่เอนจินถอดความถูกสร้างมาให้ทำ จุดที่แชตบอตมีประโยชน์คือหลังขั้นตอนนั้น เช่น เกลาถ้อยคำ สรุป หรือจัดรูปแบบบทถอดความที่คุณมีอยู่แล้ว
ไม่ว่าทางใด ข้อความอัตโนมัติต้องตรวจเทียบกับเสียงบันทึกก่อนอ้างอิง และการตรวจนั้นเป็นส่วนที่ไม่มีเครื่องมือใดทำแทนได้
เอนจินแต่ละตัวต้องตรวจมากน้อยต่างกันพอสมควร การถอดความด้วย AI แม่นยำแค่ไหน อธิบายว่าควรคาดหวังอะไรและข้อผิดพลาดมักกระจุกอยู่ตรงไหน
สิ่งที่ถอดความอัตโนมัติจริงทำผิด
ถอดความอัตโนมัติเป็นฉบับร่าง และวิธีที่ชัดที่สุดที่จะเห็นว่าหมายถึงอะไรคือลองรันแล้วอ่านเทียบกับเสียงบันทึก เมื่อวันที่ 2 ตุลาคม 2026 เราทำเช่นนั้นกับ 5 นาทีแรกของเสียงบันทึกสาธารณะที่ใครก็ตรวจเทียบกับบทความนี้ได้
เราให้เอนจินที่อยู่เบื้องหลังเครื่องมือสัมภาษณ์ของ SozAI ถอดความ 5 นาทีแรก (300 วินาที) ของพอดแคสต์ Houston We Have a Podcast ของ NASA Johnson Space Center ตอนที่ 180 “Artemis Mission Management” โดยมีพิธีกร Gary Jordan และแขกรับเชิญ Mike Sarafin ซึ่งเป็นผลงานของ NASA จึงไม่ได้รับความคุ้มครองตามลิขสิทธิ์ ผลลัพธ์ที่ได้คือ 778 คำ ตรวจพบภาษาอังกฤษ และพบผู้พูด 2 คน บรรทัดเปิดตามที่เอนจินแสดงผลมีดังนี้
[00:00] Speaker A: Houston, we have a podcast. Welcome to the official podcast of the NASA Johnson Space Center, episode 180, Artemis Mission Management. I'm Gary Jordan, and I'll be your host today. [01:19] Speaker B: T-minus five seconds and counting. Mark. [01:22] Speaker A: Launch commit lights are correct. There she goes. Houston. We have a podcast. Mike Serafin, thanks for coming on Houston, We Have a Podcast today. [01:36] Speaker B: Thank you. It's a pleasure to be here to talk about these exciting Artemis missions we have ahead of us. Yeah, right? [01:43] Speaker A: Returning to the Moon. Not a bad thing to be a part of.
เพียงห้าช่วงที่คนพูดนี้ก็มีสามจุดที่ต้องให้คนตรวจ การนับถอยหลังปล่อยจรวดที่ 01:19 และ “Launch commit lights are correct. There she goes.” ที่ 01:22 เป็นเสียงจากเทปปล่อยจรวดในหอจดหมายเหตุที่ตัดต่อเข้ามาในพอดแคสต์ ไม่ใช่พิธีกรหรือแขกพูด แต่เอนจินกลับติดป้ายเป็น Speaker B และ Speaker A ส่วน “Yeah, right?” ที่ท้ายช่วง 01:36 จริง ๆ แล้วคือพิธีกรเริ่มพูดต่อ จึงควรอยู่ต้นช่วงถัดไป ไม่ใช่ท้ายช่วงของแขก และนามสกุลของแขกออกมาเป็น Serafin ทั้งที่เครดิตของตอนสะกดว่า Sarafin
ช่วงหลังแสดงให้เห็นว่าแบบตรงตัวฉบับสะอาดมีไว้ทำอะไร ผลลัพธ์ของเอนจินที่ 02:51 อ่านว่า: ‘Yes, so you’re, you’re right in that I lived in the operations realm for 22 of my 27 years in, in my NASA career.’ การตรวจแก้แบบตรงตัวฉบับสะอาดจะเปลี่ยนเป็น: ‘You’re right in that I lived in the operations realm for 22 of my 27 years in my NASA career.’ ส่วนแบบตรงตัวทุกคำจะเก็บการพูดซ้ำไว้ตามที่ออกมา เอนจินเองมีแนวโน้มเก็บการพูดซ้ำไว้ด้วยซ้ำ คือคงการซ้ำและการเริ่มประโยคใหม่ส่วนใหญ่ไว้ตลอดทั้งไฟล์ (‘you’re, you’re right’, ‘in, in my NASA career’, ‘That’s, that’s quite a number of’) ผลลัพธ์จึงใกล้แบบตรงตัวทุกคำมากกว่าแบบตรงตัวฉบับสะอาด หากโครงการต้องการแบบตรงตัวฉบับสะอาด ให้เผื่อรอบแก้ไขไว้ไม่ว่าเอนจินใดจะเป็นผู้สร้างฉบับร่าง

