Chuyển đến nội dung

Phụ đề dễ tiếp cận thực sự cần những gì

17 min read 1 views Cập nhật lần cuối: Th8 2, 2026
A wall-mounted screen in an office corridor showing a video with a caption bar across the bottom

Ý chính

Phụ đề dễ tiếp cận không đơn thuần là có phụ đề. Chúng phải chứa cả lời nói và những âm thanh không phải lời nói nhưng mang ý nghĩa, phải đánh dấu rõ mỗi lần đổi người nói, và phải xuất hiện, biến mất đúng theo nhịp lời nói. Phụ đề dịch (subtitle) lại là một thứ khác hẳn, thường chỉ chứa lời nói và phần lớn là bản dịch. Bản chép lời (transcript) là văn bản thuần, không có mốc thời gian, dành cho những người không thể dùng trình phát video theo cách thông thường — vì vậy đây là một sản phẩm riêng, không phải thứ có thể thay thế cho phụ đề. Lỗi phổ biến nhất là dùng phụ đề tự động mà không qua bước rà soát, sửa lại.

Có ai đó nói với bạn rằng phụ đề phải “dễ tiếp cận”. Bạn đã có phụ đề rồi. Giờ bạn đang cố hiểu khoảng cách giữa hai câu đó là gì, mà chẳng ai giải thích cụ thể.

Khoảng cách đó hầu như không nằm ở việc video thiếu file phụ đề. Vấn đề là file phụ đề đó không dùng được, và điều này chỉ lộ ra khi một người khiếm thính hoặc nghe kém thử xem video bằng phụ đề đó. Dưới đây là những gì điều đó thực sự có nghĩa, theo đúng thứ tự bạn sẽ gặp phải.

Ba từ, ba sản phẩm, ba nhóm người xem khác nhau

Trong lời nói hằng ngày, phụ đề (caption), phụ đề dịch (subtitle) và bản chép lời (transcript) thường bị dùng lẫn cho nhau. Nhưng yêu cầu mà bạn được giao gần như chắc chắn không đánh đồng ba thứ này. Nếu yêu cầu nêu tên hai trong số đó, nghĩa là họ muốn hai sản phẩm khác nhau.

Caption chứa cả lời nói và những âm thanh không phải lời nói nhưng mang ý nghĩa. Chúng được viết với giả định rằng người xem không nghe được gì cả, nên bất cứ điều gì âm thanh đang thể hiện mà hình ảnh không cho thấy, đều phải được đưa vào chữ.

Subtitle thường chỉ chứa lời nói, và phần lớn là bản dịch. Chúng giả định rằng bạn nghe được video hoàn toàn bình thường, chỉ là không hiểu ngôn ngữ đang được nói. Một file subtitle sẽ không báo cho bạn biết chuông báo động vừa reo, vì người xem nghe được bằng ngôn ngữ đích không cần được nhắc điều đó.

Transcript là văn bản đứng độc lập, không có mốc thời gian. Không có tín hiệu hiển thị, không đồng bộ, không liên quan gì đến trình phát video. Nó phục vụ những người dùng trình đọc màn hình, những người không thể vận hành trình phát video, và những người đơn giản là muốn đọc thay vì ngồi xem hết video.

Sự phân biệt cuối này là điều người ta thường nhập nhằng nhất. Đăng một bản transcript bên cạnh video không thể thay cho yêu cầu về caption, và có file caption cũng không thể thay cho yêu cầu về transcript, vì hai thứ này đến với hai nhóm người khác nhau, qua hai con đường khác nhau. Nếu bạn chỉ làm một thứ rồi gọi nó là cả hai, thì thực chất bạn vẫn chỉ làm một thứ.

Cần nói rõ: nghĩa vụ về khả năng tiếp cận khác nhau theo quốc gia, theo ngành và theo từng tổ chức. Không có một chuẩn chung toàn cầu để bạn tự đối chiếu rồi coi như xong. Quy định quan trọng nhất là quy định mà tổ chức của bạn thực sự phải tuân theo, và luôn có người trong tổ chức biết đó là quy định nào, dù họ chưa nói cho bạn. Hãy hỏi trước khi xây cả một quy trình dựa trên suy đoán.

Caption chứa cả âm thanh, không chỉ lời nói

Đây là phần khiến nhiều người bất ngờ, vì họ vẫn nghĩ caption chỉ đơn giản là chuyển lời nói thành chữ. Tiếng cửa đóng sầm. Tiếng chuông báo động. Tiếng cười vọng ra ngoài khung hình. Tiếng điện thoại reo khiến người trong hình đột ngột dừng nói giữa câu. Không cái nào trong số đó là lời nói, và không cái nào nhìn thấy được.

Nếu một người xem không nghe được âm thanh xem video của bạn, và có điều gì xảy ra mà họ không thể lý giải, thì caption đã thất bại ngay ở mục đích tồn tại của nó. Người trong hình phản ứng với một tiếng động mà bạn chưa từng đề cập, giờ trông như đang hành xử vô lý, chẳng vì lý do gì.

Câu hỏi cần đặt ra không phải là “có âm thanh không” mà là “âm thanh đó có mang ý nghĩa không”. Tiếng ồn nền của phòng không cần chú thích. Nhạc nền mà không ai phản ứng gì thường cũng không cần. Nhưng tiếng chuông báo động khiến mọi người rời khỏi phòng thì cần. Tiếng cười cũng cần, khi nó cho biết một câu nói được đón nhận ra sao. Đây là việc bạn phải tự cân nhắc, và là một sự cân nhắc thực sự chứ không phải quy tắc có thể tự động hóa — đó cũng là lý do vì sao cần có người rà soát lại file bằng mắt. Nếu bạn muốn tìm hiểu kỹ hơn cách xử lý việc này trong thực tế, hướng dẫn về closed caption có nói chi tiết về cách làm.

Nhưng cũng không nên làm quá tay. Một file caption chú thích cả tiếng sột soạt nhỏ nhất sẽ tranh mất thời gian đọc của người xem với lời nói, khiến họ bị tụt lại phía sau video. Chỉ đưa vào những gì làm thay đổi ý nghĩa của cảnh. Còn lại thì bỏ qua.

Cho biết ai đang nói

Một file caption dồn lời của ba người lại thành một khối, không hề đánh dấu chỗ người này ngừng và người kia bắt đầu, thì về mặt kỹ thuật là có tồn tại nhưng thực chất là không dùng được. Đây là một trong những lỗi phổ biến nhất ở những file đã “qua” mọi bước kiểm tra hình thức, vì kiểm tra đó chỉ hỏi có caption hay không, không hỏi caption có đọc hiểu được hay không.

Hãy nghĩ về những gì người nghe được có được mà không phải tốn công gì. Giọng người này khác giọng người kia. Bạn biết câu trả lời vừa rồi là của một người khác vì nó phát ra từ một cổ họng khác, và nhiều khi bạn còn nghe được nó phát ra từ hướng nào trong phòng. Bỏ hết âm thanh đi, tất cả những điều đó biến mất. Trên hình, một cú lấy cảnh phản ứng hoặc khung hình cận có thể khiến người đang nói không xuất hiện trong khung hình suốt cả một câu.

Quy ước để đánh dấu việc đổi người nói khác nhau tùy đơn vị và tùy nền tảng, và bất kỳ quy ước phổ biến nào cũng đều dùng được, miễn là bạn áp dụng nhất quán trong toàn bộ file. Điều duy nhất không hiệu quả là không đánh dấu gì cả. Một cuộc phỏng vấn, một buổi tọa đàm, bản ghi âm cuộc họp, bất cứ thứ gì có hơn một người nói, đều cần được đánh dấu mỗi lần đổi lượt, kể cả khi hai người đang trao đổi những câu ngắn liên tục. Thực ra, chính lúc đó lại càng cần đánh dấu hơn, vì đó là lúc người đọc dễ mất mạch nhất.

Mốc thời gian bám sát lời nói

Caption phải xuất hiện đúng lúc lời được nói ra và biến mất đúng lúc lời dừng lại. Một caption xuất hiện chậm một nhịp nghĩa là người xem đọc được câu nói sau khi đã thấy phản ứng với câu đó. Một caption còn nấn níu sang cả cảnh sau nghĩa là họ đang đọc một cảnh trong khi mắt nhìn một cảnh khác.

Với một dòng caption đơn lẻ, lỗi đó không nghiêm trọng. Nhưng lặp lại suốt mười phút, nó trở nên mệt mỏi, và video trở nên khó theo dõi hơn khi có caption so với khi không có. “Trôi mốc thời gian” là nguyên nhân thường gặp nhất: file bắt đầu đồng bộ nhưng càng về sau càng lệch, thường vì file được tạo dựa trên một bản video, rồi lại gắn vào một bản khác có thêm vài giây ở đầu hoặc cuối.

Hãy kiểm tra ở cuối file, không phải đầu file. Ai cũng kiểm tra đoạn đầu. Nếu dòng caption cuối cùng trong một video dài vẫn khớp đúng với lời nói, thì phần giữa nhiều khả năng cũng ổn. Nếu nó đã lệch, cả file cần được canh lại mốc thời gian từ đầu, không phải sửa vá từng chỗ. Một công cụ kiểm tra cấu trúc như công cụ kiểm tra file SRT sẽ phát hiện các dòng caption chồng chéo hoặc sai định dạng trước khi bạn tải lên, tuy nó không thể cho bạn biết chữ nghĩa trong đó có đúng hay không.

Caption tự động và bước rà soát khiến chúng dùng được

Dùng caption tự động mà không qua bước sửa lại là cách phổ biến nhất khiến một tổ chức có caption không đáp ứng đúng yêu cầu của chính mình. Caption tự động thường đi kèm những quyết định về dấu câu mà bạn không nên tin tưởng, không hề đánh dấu đổi người nói, và không có âm thanh không-lời nào cả, vì hệ thống chỉ được yêu cầu chuyển lời nói thành chữ, và nó đã làm đúng như vậy, không hơn.

Điều đó không có nghĩa caption tự động vô dụng. Chúng là một bản nháp tốt, và giúp tiết kiệm thời gian thật cho phần việc thuần túy là gõ chữ. Sai lầm là coi kết quả đầu ra đó là sản phẩm cuối, thay vì coi nó là nguyên liệu thô. Điều biến nguyên liệu thô thành sản phẩm hoàn chỉnh là một người đọc lại file, đối chiếu với video, và sửa bốn thứ: những từ bị nhận sai, ranh giới câu, các lần đổi người nói, và những âm thanh mang ý nghĩa.

Để có bản nháp đầu tiên, SozAI chuyển file âm thanh, video, bản ghi âm và đường link YouTube thành văn bản, kèm nhãn người nói, hỗ trợ hơn 99 ngôn ngữ, trên ứng dụng iOS, Android và macOS. Trang này cũng có các công cụ subtitle và đếm chữ miễn phí, chạy hoàn toàn trong trình duyệt của bạn, không tải file nào lên đâu cả. Nhãn người nói giúp bạn có sẵn phần đánh dấu đổi lượt nói; còn các tín hiệu âm thanh và mốc thời gian cuối cùng vẫn là phần bạn phải tự thêm vào.

Hãy dành thời gian cho bước rà soát này. Nó ngắn hơn việc chép lời từ đầu, nhưng dài hơn con số không, và đó chính là toàn bộ sự khác biệt giữa một file “có tồn tại” và một file “dùng được”.

Những gì vẫn có thể sai sau khi bạn đã làm hết những điều trên

Còn khá nhiều, và tốt hơn là bạn nên biết trước ở đâu.

  • Tên riêng, thuật ngữ chuyên ngành và tên sản phẩm thường bị nhận sai khi chép lời tự động, và cứ để sai như vậy, vì người rà soát không am hiểu chủ đề sẽ không nhận ra một thuật ngữ đã bị lệch đi một chút.
  • File caption bị gắn nhầm vào một bản dựng video khác sau khi chỉnh sửa, và mốc thời gian lệch theo. Không ai kiểm tra lại sau khi cắt bớt video.
  • Bản transcript lặng lẽ không bao giờ được làm, vì nó là sản phẩm không có vị trí rõ ràng trong quy trình xuất bản, và không có cảnh báo lỗi nào khi nó thiếu.
  • Một file subtitle đã dịch bị tải lên như thể đó là file caption, khiến người xem khiếm thính dùng ngôn ngữ gốc chỉ nhận được lời nói mà không có tín hiệu âm thanh nào.

Không lỗi nào trong số này lộ ra khi chỉ kiểm tra lấy mẫu ba mươi giây đầu — vốn là kiểu kiểm tra mà hầu hết video thực tế nhận được. Nếu bạn đang xây dựng một quy trình, hãy đặt bước kiểm tra ở cuối file và sau bản dựng cuối cùng, không phải trước đó.

Điều khác cần lưu ý: dù bạn làm file caption cẩn thận đến đâu, điều đó cũng không tự nói lên nghĩa vụ pháp lý của bạn là gì. Nghĩa vụ đó đến từ quy định mà tổ chức của bạn phải tuân theo, và chi tiết thực tế về cách các yêu cầu này thường được viết ra được trình bày trong bài về chép lời và tuân thủ quy định về khả năng tiếp cận. Hãy tìm câu trả lời đó trước, rồi áp dụng những kỹ thuật nói trên vào bất cứ yêu cầu cụ thể nào mà nó đặt ra.

Câu trả lời

Frequently Asked Questions

Caption và subtitle khác nhau ở điểm nào?

Caption chứa cả lời nói và những âm thanh không phải lời nói nhưng mang ý nghĩa, như tiếng cửa, tiếng chuông báo động hay tiếng cười, và được viết cho người xem không nghe được âm thanh. Subtitle thường chỉ chứa lời nói và phần lớn là bản dịch, dành cho người nghe được âm thanh nhưng không hiểu ngôn ngữ đang nói. Tải lên một file subtitle ở nơi cần caption sẽ khiến người xem khiếm thính thiếu mất thông tin về âm thanh mà họ cần.

Caption có cần bao gồm âm thanh nền không?

Chỉ cần bao gồm những âm thanh mang ý nghĩa, không phải mọi âm thanh. Tiếng cửa đóng, tiếng chuông báo động, tiếng điện thoại reo làm ai đó ngừng nói, tiếng cười cho biết một câu nói được đón nhận ra sao — những thứ đó cần có trong caption, vì chỉ nhìn hình ảnh thì không đủ để biết. Tiếng ồn nền của phòng và nhạc nền không được ai chú ý thường không cần. Chú thích quá nhiều sẽ tranh mất thời gian đọc của người xem với lời nói.

Caption tự động có đủ để đạt chuẩn dễ tiếp cận không?

Không, nếu thiếu bước rà soát sửa lại. Caption tự động thường đi kèm những quyết định về dấu câu không đáng tin, không đánh dấu đổi người nói, và hoàn toàn không có âm thanh không-lời, vì hệ thống chỉ được yêu cầu chuyển lời nói thành chữ. Chúng là một bản nháp có ích và tiết kiệm thời gian gõ chữ thật sự. Sau đó cần có người đọc lại file, đối chiếu với video, và sửa các từ bị sai, ranh giới câu, việc đổi người nói và các tín hiệu âm thanh.

Tôi có cần cả transcript bên cạnh caption không?

Thường là có, và transcript không thể thay thế cho file caption. Transcript là văn bản đứng độc lập, không có mốc thời gian, dành cho người dùng trình đọc màn hình hoặc bất kỳ ai không thể vận hành trình phát video. Caption dành cho người xem video mà không nghe được. Hai thứ này đến với hai nhóm người khác nhau qua hai con đường khác nhau, nên nếu yêu cầu nêu tên cả hai, nghĩa là cần hai sản phẩm riêng biệt.

Làm sao để thể hiện việc đổi người nói trong caption?

Đánh dấu mỗi lần đổi lượt nói, dùng bất kỳ quy ước nào mà nền tảng hoặc quy chuẩn của đơn vị bạn đang dùng, và áp dụng nhất quán trong toàn bộ file. Một file caption dồn lời nói của nhiều người lại mà không đánh dấu chỗ đổi lượt thì về kỹ thuật là có tồn tại nhưng thực chất không dùng được. Người nghe được nhận biết đổi người nói miễn phí qua âm giọng khác nhau; người đọc caption sẽ không biết gì trừ khi bạn đưa thông tin đó vào chữ. Những đoạn trao đổi nhanh giữa hai người càng cần được đánh dấu.

Mốc thời gian của caption cần khớp với lời nói đến mức nào?

Đủ khớp để caption xuất hiện đúng lúc lời được nói ra và biến mất đúng lúc lời dừng lại. Một caption xuất hiện chậm khiến người xem đọc được câu nói sau khi đã thấy phản ứng với nó, còn một caption còn nấn níu sang cảnh sau sẽ khiến họ bị tụt lại một cảnh. Nên kiểm tra ở cuối một file dài hơn là ở đầu, vì độ lệch thường tích lũy dần, và khi đó cần canh lại toàn bộ mốc thời gian thay vì chỉ sửa vá từng chỗ.

Merey Tleugazin

Nhà sáng lập SozAI. Xây dựng công cụ chuyển lời nói thành văn bản cho các chuyên gia trên toàn thế giới.

SozAI
SozAI — Tải miễn phíChép lời audio & video ngay lập tức
Tải ứng dụng