Những điều cần nhớ
Một bản gỡ băng có thể đúng từng chữ nhưng vẫn gán nhầm cho người nói, vì nhận diện lời nói và xác định ai đang nói là hai việc hoàn toàn khác nhau. Việc gán nhãn người nói dựa vào đặc điểm giọng nói, nên nó làm tốt nhất khi có vài giọng khác biệt rõ rệt, được một micro thu ở mức âm lượng tương đương nhau. Nó gặp khó khi mọi người nói chồng lên nhau, khi có người nói nhỏ hoặc tham gia muộn, và nó sẽ không bao giờ tự đưa ra tên thật — phần đó bạn phải thêm vào sau.
Nếu bạn từng mở một bản gỡ băng cuộc trò chuyện nhóm và thấy phân nửa nội dung bị gán nhầm cho người nói, thì rất có thể phần chữ vẫn đúng. Vấn đề nằm ở một tầng khác — phần quyết định ai đang nói, không phải người đó nói gì. Phần này dựa vào loại thông tin khác và mắc lỗi theo cách khác, và gần như toàn bộ yếu tố quyết định nó có hoạt động tốt hay không đều được định đoạt ngay lúc ghi âm, trước khi bất kỳ phần mềm nào chạm vào file.
Đây là phần đáng để hiểu rõ nếu bạn sắp ghi âm một buổi phỏng vấn, một buổi tọa đàm, hay một cuộc nói chuyện gia đình, và bạn thực sự cần biết ai nói câu nào — không chỉ nội dung được nói ra. Một phần nằm ở việc bạn đặt micro ở đâu. Một phần khác là chấp nhận rằng có những tình huống sẽ không bao giờ được gán nhãn sạch sẽ, dù bạn dùng công cụ nào để xử lý.
Hai công việc riêng biệt, một bản gỡ băng
Nhận diện từ ngữ và xác định ai nói ra chúng không phải là một việc, dù cuối cùng chúng nằm chung trong một tài liệu. Việc đầu tiên lắng nghe âm thanh và suy ra ngôn ngữ — nó gần như không quan tâm giọng đó là của ai. Việc thứ hai nghe cùng đoạn âm thanh đó nhưng hỏi một câu khác: giọng này có khớp với giọng ở hai câu trước không, hay đây là một người nói mới? Câu hỏi thứ hai được trả lời dựa vào đặc điểm giọng nói — cao độ, âm sắc, nhịp điệu, “dấu vân tay” âm học của mỗi người — không phải dựa vào nội dung lời nói.
Đó là lý do một bản gỡ băng có thể đúng từng chữ mà vẫn gán sai câu cho người nói. Việc chuyển giọng nói thành văn bản đã thành công. Việc tách người nói thì không. Hai việc này có thể thất bại độc lập với nhau, và khi ai đó nói bản gỡ băng “sai”, nên kiểm tra xem việc nào thực sự bị lỗi, vì cách sửa sẽ khác nhau tùy vào câu trả lời.
Điều gì giúp việc tách người nói hoạt động tốt
Việc tách người nói hoạt động tốt nhất khi có một số ít giọng nói khác biệt rõ rệt, tất cả được thu bởi một vị trí micro duy nhất, nghe được mọi người ở mức âm lượng tương đối đồng đều. Đó là trường hợp lý tưởng: hai hoặc ba người, giọng khác biệt rõ, một thiết bị ghi âm đặt ở vị trí nghe được cả phòng đều nhau.
Mỗi khi lệch khỏi điều kiện lý tưởng đó, bạn sẽ phải trả giá. Càng nhiều người nói thì càng nhiều khả năng hai giọng nghe giống nhau đến mức lẫn vào nhau. Những giọng nghe tương tự — ví dụ hai người cùng tuổi, cùng vùng miền — khó phân biệt hơn một giọng trầm và một giọng cao. Và nếu một người được thu to hơn hẳn người khác, hệ thống sẽ bắt đầu coi sự khác biệt về âm lượng như thể đó là sự khác biệt giữa các người nói, trong khi thực ra không phải vậy.
Không có gì ở đây quá kỳ lạ. Nó gần giống với điều một người bình thường cũng sẽ nhận ra, nếu họ nhắm mắt lại và chỉ lắng nghe. Lợi thế của phần mềm là sự kiên nhẫn và nhất quán trong suốt hàng giờ âm thanh, không phải một giác quan đặc biệt nào mà người nghe không có.
Nơi mọi thứ sụp đổ: khi mọi người nói chồng lên nhau
Có một tình huống chắc chắn phá vỡ việc gán nhãn người nói, và không cách thiết lập nào khắc phục được: hiện tượng nói chồng thật sự, khi hai người cùng nói cùng lúc. Trong lúc chồng lấn đó, không có tín hiệu sạch thuộc về riêng một giọng nào — âm thanh là hỗn hợp của cả hai, và không có gì để gán rõ ràng. Điều thường xảy ra là lời của một người bị gộp vào lượt nói của người khác, khiến bản gỡ băng hiển thị như một câu nói liên tục của một người, trong khi thực chất đó là hai người nói cùng lúc.
Đây không phải lỗi có thể sửa sau này. Đó là giới hạn nằm trong chính bản chất của bài toán — bạn không thể “tách” hai giọng đã chồng lấn thành hai luồng sạch sau khi đã ghi xong, không thể làm việc đó một cách đáng tin cậy. Kỳ vọng thực tế là bất kỳ đoạn nào trong bản ghi có sự chồng lấn thật sự đều cần một lượt kiểm tra bằng tay để làm rõ ai nói gì, hoặc sẽ đơn giản giữ nguyên như hệ thống đã đoán. Nếu cuộc trò chuyện của bạn có nhiều người nói chồng lên nhau — một buổi tọa đàm nảy lửa, một bữa tối gia đình tranh luận gay gắt — hãy chuẩn bị tinh thần rằng đoạn đó sẽ cần sửa tay, và không nên đánh giá cả công cụ chỉ dựa vào đoạn đó.
Vị trí đặt micro quan trọng hơn loại micro
Khoảng cách đến micro ảnh hưởng đến việc gán nhãn người nói nhiều hơn chất lượng của micro. Một chiếc điện thoại đặt giữa bàn thường cho kết quả tách người nói tốt hơn một chiếc micro xịn nhưng lại đặt cạnh chỉ một người, vì những người nói nhỏ, ngồi xa hơn chính là những người bị “mất” đầu tiên. Nếu ai đó luôn nói nhỏ hơn hẳn những người khác vì họ ngồi xa micro nhất, khoảng cách âm lượng đó có thể ảnh hưởng đến việc gán nhãn người nói nhiều hơn bất kỳ sự khác biệt nào về thiết bị.
Với một cuộc trò chuyện nhóm, điều này gợi ra một quy tắc đơn giản: đặt thiết bị ghi âm ở vị trí trung tâm, không phải nơi thuận tiện nhất. Giữa bàn, không phải đầu bàn gần người chủ trì nhất. Nếu mọi người ngồi rải rác trong phòng thay vì ngồi gần nhau, đây là trường hợp khó hơn dù thiết bị có tốt đến đâu, và nên biết điều đó trước khi ghi âm, thay vì phát hiện ra sau đó.
Có tên thật thay vì “Người nói 1”, “Người nói 2”
Không có gì trong bản thân âm thanh cho hệ thống chuyển giọng nói thành văn bản biết tên của ai — nó có thể nhận ra có hai giọng khác nhau đang xuất hiện, nhưng nó không có cách nào biết một người tên là Lan và người kia tên là Nam. Vì vậy kết quả xuất ra sẽ được gán nhãn ẩn danh: Người nói 1, Người nói 2, và tiếp tục như thế. Việc chuyển những nhãn đó thành tên thật là một bước làm bằng tay, và chỉ cần làm một lần, ở đầu bản gỡ băng, khớp mỗi nhãn với một tên.
Điều duy nhất giúp bước đó trở nên dễ dàng thay vì tốn công là để mọi người nói tên mình ra miệng gần đầu buổi ghi âm. Việc này chỉ tốn khoảng mười giây và cho bạn một điểm mốc rõ ràng — bạn biết giọng nói “đây là Nam” ở gần đầu bản ghi chính là giọng cần gán nhãn Nam cho suốt phần còn lại của tài liệu. Bỏ qua bước này, bạn sẽ phải khớp giọng nói với tên dựa vào trí nhớ hoặc ngữ cảnh, cách này vẫn hiệu quả nhưng tốn thời gian hơn và càng dễ sai khi số người nói càng nhiều.
Nếu bạn ghi âm một buổi phỏng vấn cụ thể, thói quen này nên được đưa vào cách bạn bắt đầu mỗi buổi ghi — xem thêm ghi chú về gỡ băng phỏng vấn để biết cách thiết lập tốt ngay từ phút đầu tiên. Còn với việc chuyển một bản ghi âm hoàn chỉnh thành văn bản có gán nhãn, chuyển âm thanh thành văn bản nói rõ về bước chuyển đổi thực tế, và một ứng dụng như ứng dụng gỡ băng của SozAI có thể tạo nhãn người nói, tóm tắt và dịch trên nhiều ngôn ngữ khác nhau ngay khi bạn có bản ghi âm — việc đặt tên cho từng người nói sau đó vẫn là việc của bạn, nhưng đó là phần làm nhanh nhất.
Nên kỳ vọng điều gì cho thực tế
Dù đã thiết lập tốt, một số tình huống vẫn cho ra kết quả không hoàn hảo một cách có thể đoán trước, và nên biết trước những điều này thay vì coi đó là lỗi của công cụ.
- Một người tham gia giữa buổi ghi âm, sau khi hệ thống đã “định hình” xong các hồ sơ giọng nói, thường bị gộp vào một người nói đã có sẵn thay vì được gán nhãn riêng.
- Người chỉ nói vài từ trong suốt cả buổi ghi — một câu đồng ý ngắn, một câu hỏi một dòng — thường bị gộp vào người nói xung quanh họ, vì không có đủ dữ liệu giọng nói để hệ thống xây riêng một hồ sơ.
- Hiện tượng nói chồng thật sự, như đã nói ở trên, có xu hướng bị gộp vào lượt nói của một người.
- Một nhóm lớn với nhiều giọng nghe tương tự sẽ tạo ra nhiều lỗi gán nhãn hơn một nhóm nhỏ với các giọng khác biệt rõ, đơn giản vì có nhiều cơ hội gây nhầm lẫn hơn.
Không điều nào trong số này là lý do để bỏ qua việc gỡ băng một bản ghi phức tạp — chúng là lý do để chuẩn bị một lượt sửa tay ngắn cho những đoạn xảy ra vấn đề, thay vì cho rằng cả tài liệu cần kiểm tra lại từ đầu. Nếu bạn đang ghi âm thứ gì đó mà bạn biết sẽ có độ phức tạp kiểu này, cũng nên quyết định trước xem bạn cần gỡ băng toàn bộ hay chỉ cần những điểm chính đã gán nhãn; gỡ băng toàn bộ không phải lúc nào cũng là lựa chọn hữu ích, đặc biệt với các bản ghi dài mà bạn chủ yếu cần biết ai đã cam kết điều gì — đây là loại nhu cầu được nói đến trong phần chuyển bản ghi âm thành ghi chú cuộc họp. Và nếu bạn muốn thử xem một bản ghi cụ thể sẽ được gán nhãn ra sao trước khi xử lý một file dài, hãy lấy ứng dụng từ trang tải xuống và chạy thử một đoạn ngắn trước — điều đó sẽ cho bạn biết nhiều hơn bất kỳ lời khuyên chung nào.
Điều thực sự tạo ra khác biệt
Nếu chỉ rút ra được một điều từ tất cả những điều trên, đó là: bản ghi âm quan trọng hơn phần mềm. Một micro đặt ở vị trí trung tâm, một số ít giọng nói khác biệt rõ rệt, mọi người nói tên mình lúc bắt đầu, và việc chấp nhận rằng phần nói chồng lên nhau sẽ cần xem lại bằng tay — sự kết hợp đó sẽ đưa bạn đi xa hơn bất kỳ cài đặt hay tính năng nào được chọn sau đó. Bước gán nhãn thực sự có tác dụng, nhưng nó chỉ làm việc được với những gì bản ghi âm cung cấp, và một bản ghi âm được thực hiện với ý thức về việc tách người nói ngay từ đầu sẽ luôn được gán nhãn tốt hơn một bản ghi không có sự chuẩn bị đó, bất kể phần mềm nào xử lý việc chuyển văn bản sau đó.

