핵심 요약
텍스트를 SRT로 변환한다는 것은 두 가지 작업을 한다는 뜻입니다. 먼저 일반 텍스트를 읽기 쉬운 자막 큐로 나누고, 각 큐에 시작/종료 타임코드를 지정해야 합니다. 이미 문장이 준비되어 있다면 전체 전사 소프트웨어는 필요하지 않습니다. 필요한 것은 깔끔한 타이밍, 읽기 쉬운 줄바꿈, 올바른 자막 형식을 만들어 주는 텍스트-SRT 변환 워크플로입니다. 가장 빠른 방법은 브라우저 기반 텍스트-SRT 변환기에 스크립트를 붙여 넣고, 큐로 자동 분할한 뒤 타이밍을 설정하고, 마지막으로 가독성을 위해 짧게 수동 검토를 하는 것입니다. 자막 파일이 익숙하지 않다면 SRT 파일이 무엇인지도 함께 이해해 두면 플레이어와 편집기가 무엇을 기대하는지 파악하는 데 도움이 됩니다.
전사문, 스크립트, 강의 노트, 가사 또는 다른 일반 텍스트가 있고 자막이 필요하다면, 어려운 부분은 파일 확장자가 아닙니다. 핵심은 타이밍입니다. 올바른 .srt 파일은 번호가 매겨진 자막 블록에 타임코드와 텍스트가 들어 있는 형태일 뿐이지만, 자막이 전문적으로 보이려면 각 블록이 읽을 수 있을 만큼 짧아야 하고 자연스럽게 따라갈 수 있을 만큼 충분히 오래 표시되어야 합니다.
그래서 “txt to srt”는 단순히 복사해서 붙여 넣고 저장하는 작업이 아닙니다. 텍스트를 자막 크기에 맞는 덩어리로 나누고, 길이를 추정하거나 지정한 다음, 실제 사람이 말하는 방식에 맞도록 타이밍을 조정해야 합니다. 아래에는 실무적인 단계별 과정과 함께, 가장 흔한 자막 실수를 막아 주는 규칙을 정리했습니다.
텍스트를 SRT로 변환할 때 실제로 필요한 작업
사람들이 “script to srt”나 “텍스트를 자막으로 변환”을 검색할 때는 보통 다음 두 가지 중 하나를 의미합니다.
- 이미 문장은 준비되어 있습니다. 텍스트는 있고, 그것을 타이밍이 포함된 자막 큐로 바꾸어야 합니다.
- 오디오나 비디오만 있습니다. 이 경우에는 자막 변환 전에 먼저 전사가 필요합니다.
이 글은 첫 번째 경우, 즉 이미 텍스트가 있는 상황에 초점을 맞춥니다. 이 경우 변환 작업은 두 가지 핵심 작업으로 이루어집니다.
1. 텍스트를 자막 큐로 나누기
자막은 문단이 아닙니다. 좋은 자막 큐에는 보통 짧은 한 문장 또는 의미 있는 한 구절이 들어갑니다. 하나의 큐에 너무 많은 텍스트를 밀어 넣으면 시청자는 줄을 놓치거나, 읽기 위해 영상을 멈추게 됩니다.
예를 들어, 아래 일반 텍스트 문장은 하나의 자막으로는 너무 깁니다.
“시작하기 전에 이 도구가 어떻게 작동하는지, 자동으로 어떤 타이밍을 생성하는지, 그리고 최종 파일을 내보내기 전에 무엇을 직접 확인해야 하는지 설명드리겠습니다.”
더 나은 자막 분할은 다음과 같습니다.
시작하기 전에,
이 도구가 어떻게 작동하는지 설명드리겠습니다.
자동으로 어떤 타이밍을 생성하는지,
그리고 무엇을 직접 확인해야 하는지.
최종 파일을 내보내기 전에 말입니다.
2. 시작 및 종료 타임코드 지정하기
모든 SRT 큐에는 다음 형식의 시작 시간과 종료 시간이 필요합니다.
00:00:12,500 –> 00:00:15,200
텍스트가 실제 발화가 아닌 스크립트에서 나온 것이라면, 읽기 속도나 화자의 실제 말하기 속도를 기준으로 타이밍을 추정해야 합니다. 그래서 자동 타이밍은 초안으로는 유용하지만, 중요한 영상의 최종 답은 아닙니다.
영어 기준으로 편안한 읽기 속도를 위한 대략적인 전문 기준은 초당 15~17자입니다. 이보다 빠르면 많은 시청자가 따라가기 어렵습니다. 반대로 너무 느리면 자막이 늦게 느껴지거나 화면에 지나치게 오래 머무는 것처럼 보일 수 있습니다.
단계별 가이드: 브라우저에서 일반 텍스트를 SRT로 변환하기
가장 빠른 방법을 원한다면 txt to srt 변환용으로 만들어진 브라우저 도구를 사용하면 됩니다. 아래 워크플로는 단순하고 실용적이며, 이미 스크립트가 준비된 경우 특히 효과적입니다.
1단계: 스크립트 또는 전사문 붙여 넣기
변환기를 열고 일반 텍스트를 붙여 넣은 뒤, 큐를 생성하기 전에 내용을 검토합니다. 입력 텍스트를 깔끔하게 정리하는 것이 중요합니다. 화자 메모, 장면 지시문, 다른 형식에서 가져온 타임스탬프, 반복되는 헤더처럼 화면에 표시되면 안 되는 요소는 제거해야 합니다.
좋은 원본 텍스트:
- 구어체 문장. “다시 오신 것을 환영합니다. 오늘은 가격, 설정, 내보내기를 다루겠습니다.”
- 적절한 문장부호. 마침표와 쉼표는 도구가 자연스러운 분할 지점을 찾는 데 도움이 됩니다.
- 자막 트랙당 하나의 언어만 사용. 여러 언어가 섞인 텍스트는 어색한 큐 분할을 만들기 쉽습니다.
좋지 않은 원본 텍스트:
- 빽빽한 텍스트 덩어리. 문장부호 없이 이어지는 긴 문단.
- 불필요한 서식 노이즈. 글머리표, 타임스탬프, 이모지, 무대 지시문, 또는 줄바꿈이 깨진 PDF 복사 텍스트.
- 전사문 군더더기. 자막에 넣고 싶지 않은 과도한 “음”, “어”, 또는 중복 단어.
2단계: 텍스트를 자막 크기의 큐로 자동 분할하기
자동 분할 기능을 사용해 텍스트를 자막 읽기 제한에 맞는 덩어리로 나눕니다. 이렇게 하면 텍스트 한 덩어리를 번호가 붙은 큐로 바꿔 주므로, 각 자막을 일일이 수동으로 만들 필요가 없어 시간을 절약할 수 있습니다.
목표는 단순히 “더 작은 덩어리”가 아닙니다. 목표는 읽기 쉬운 덩어리입니다. 시작 기준으로는 다음을 권장합니다.
- 줄은 짧게 유지합니다. 한 줄은 42자를 넘기지 않는 것이 좋습니다.
- 최대 두 줄까지만 사용합니다. 세 줄 이상이면 화면을 너무 많이 가리게 됩니다.
- 의미 단위로 나눕니다. 가능하면 쉼표, 접속사, 자연스러운 멈춤 지점에서 나눕니다.
예를 들어 하나의 큐에 “우리는 고객 인터뷰를 분석했고 온보딩과 관련한 세 가지 공통 문제를 발견했습니다”라고 되어 있다면, 다음처럼 나누지는 마십시오.
우리는 고객 인터뷰를 분석했고
온보딩과 관련한 세 가지 공통 문제를 발견했습니다
이 정도는 허용 가능합니다. 하지만 다음은 더 좋지 않습니다.
우리는 고객
인터뷰를 분석했고 온보딩과 관련한 세 가지 공통 문제를 발견했습니다
두 번째 버전은 어색한 위치에서 구를 끊습니다. 기계적인 길이보다 가독성이 더 중요합니다.
3단계: 자동 타이밍 적용하기
텍스트 분할이 끝나면 타이밍을 생성합니다. 좋은 텍스트-SRT 변환기는 텍스트 길이를 기준으로 각 큐의 표시 시간을 추정해, 자막이 읽을 만큼 충분히 오래 화면에 남도록 합니다. 이는 스크립트 기반 프로젝트, 러프컷, 내부 검토용 영상, 또는 최종 보이스오버 타이밍이 확정되기 전에 자막을 준비하는 경우에 특히 적합합니다.
여기서 실용적인 장점 하나는 처리가 브라우저 안에서 이루어진다는 점입니다. 따라서 SRT를 만드는 동안 텍스트가 업로드되지 않습니다. 이는 비공개 스크립트, 고객 초안, 내부 회의 자료에 유용합니다.
타이밍 기준은 다음을 참고하십시오.
- 최소 길이: 큐당 약 1초.
- 최대 길이: 큐당 약 7초.
- 읽기 속도: 대략 초당 15~17자.
예를 들어 30자짜리 자막은 보통 약 2초 정도가 필요합니다. 70자 분량의 두 줄 자막은 4~5초가 필요할 수 있습니다. 자동 타이밍은 상당히 근접한 결과를 주지만, 긴 큐, 너무 짧은 큐, 그리고 말하기 속도가 변하는 구간은 여전히 검토해야 합니다.
4단계: 줄바꿈과 문구 조정하기
다운로드하기 전에 모든 자막 블록을 훑어보며 무겁거나 부자연스럽게 느껴지는 부분을 수정합니다. 이 단계에서 평범해 보이는 자막이 전문적으로 보이는 자막으로 바뀝니다.
다음 사항을 확인하십시오.
- 너무 긴 큐. 읽는 속도가 느려진다면 두 개의 자막으로 나눕니다.
- 좋지 않은 줄바꿈. 이름, 동사, 짧은 구는 가능한 함께 유지합니다.
- 불필요한 군더더기. 사용 목적상 축약 자막이 가능하다면, 축어 자막 대신 반복 단어를 제거합니다.
원본이 정식 스크립트라면 이 단계는 대체로 빠르게 끝납니다. 거친 전사문에서 가져온 경우라면 몇 분 정도 정리 시간이 필요할 수 있습니다.
5단계: .srt 파일 다운로드하기
큐 텍스트와 타이밍을 확인한 뒤 파일을 .srt로 내보냅니다. 그다음 사용 중인 비디오 플랫폼, 편집기 또는 플레이어에서 테스트합니다. 플랫폼이 파일을 거부하거나 자막 표시가 이상하다면, 다른 문제를 살피기 전에 먼저 SRT validator로 형식을 검증해 보십시오.
결과를 전문적으로 보이게 만드는 자막 제작 규칙
자동 변환은 시간을 절약해 주지만, 좋은 자막을 만들려면 여전히 기본 원칙이 필요합니다. 아래 규칙이 “형식상 문제는 없지만 어색한 자막”과 “보기 편한 자막”의 차이를 만듭니다.
읽기 쉬운 줄 길이 유지하기
- 한 줄 최대 42자. 대부분의 영상 레이아웃에서 신뢰할 수 있는 기준입니다.
- 큐당 최대 2줄. 자막에 3줄이 필요하다면 거의 항상 분할이 필요합니다.
- 줄 길이의 균형을 맞춥니다. 매우 긴 한 줄과 매우 짧은 한 단어 줄보다, 길이가 비슷한 두 줄이 보통 더 읽기 쉽습니다.
읽기 속도 기준 지키기
전문 자막 제작자는 직감만이 아니라 초당 문자 수를 기준으로 작업하는 경우가 많습니다. 일반 시청자를 대상으로 할 때 초당 15~17자는 매우 좋은 기본값입니다. 더 빠른 속도는 짧은 소셜 클립에는 가능할 수 있지만, 이를 지속적으로 넘기면 가독성은 빠르게 떨어집니다.
예시:
- 50자를 2초 동안 표시 = 초당 25자, 대부분의 시청자에게 너무 빠릅니다.
- 50자를 3.5초 동안 표시 = 약 초당 14자, 훨씬 낫습니다.
자연스러운 말하기 쉼에 맞춰 타이밍 잡기
타이밍이 처음에는 추정치로 시작하더라도, 큐 경계는 말의 흐름과 맞아야 합니다. 가능하면 문장부호, 쉼, 절의 경계, 화자 전환 지점에서 자막을 끝내십시오. 생각이 채 끝나지 않은 지점에서 자막이 끊기고 다음 큐가 즉시 나타나면 기계적으로 느껴집니다.
무리 없는 길이 범위 유지하기
경험칙으로 각 자막은 1초에서 7초 사이로 표시되게 유지하는 것이 좋습니다. 1초 미만은 대체로 읽기 어렵고, 7초를 넘으면 문장이 매우 짧지 않은 이상 화면에 멈춰 있는 느낌을 줄 수 있습니다.
첫 번째 내보내기 이후 타이밍을 미세 조정하는 방법
대부분의 script-to-SRT 작업은 내보낸 뒤 한 번 더 검토가 필요합니다. 특히 실제 영상이나 보이스오버가 준비된 경우에는 더욱 그렇습니다. 무엇을 봐야 하는지만 알면 미세 조정은 어렵지 않습니다.
전체 자막 트랙 한꺼번에 이동하기
모든 자막이 같은 정도로 일관되게 빠르거나 늦게 표시된다면, 각 큐를 하나씩 수정하지 마십시오. 파일 전체를 이동하면 됩니다. 전용 자막 시간 이동 도구는 전체 SRT에 고정 오프셋을 더하거나 빼는 가장 빠른 방법입니다.
예를 들어 모든 줄이 1.2초씩 너무 빨리 나온다면, 파일 전체에 +1.2초 이동을 적용하면 됩니다.
문제가 있는 구간만 다시 타이밍 맞추기
처음 부분은 맞지만 뒤로 갈수록 어긋난다면, 원본 스크립트와 실제 발화의 속도가 다를 가능성이 높습니다. 이 경우에는 다음과 같이 조정합니다.
- 빽빽한 큐는 줄입니다. 빠르게 읽어야 하는 긴 자막은 분할합니다.
- 중요한 줄은 늘립니다. 중요한 내용이나 기술적인 내용은 표시 시간을 더 길게 잡습니다.
- 전환 지점을 다시 맞춥니다. 시작과 종료를 쉼의 경계로 이동합니다.
최종 사용 플랫폼 안에서 테스트하기
모든 플레이어가 자막을 같은 방식으로 렌더링하지는 않습니다. 항상 실제 목적지에서 미리 보기 하십시오. YouTube, 강의 플랫폼, 미디어 서버 또는 편집 소프트웨어에서 직접 확인해야 합니다. 최종 플랫폼이 SRT보다 WebVTT를 더 선호한다면, 최종 버전을 내보내기 전에 VTT vs SRT 비교 글을 읽어 보시는 것이 좋습니다.
텍스트-SRT 변환에서 흔히 발생하는 실수와 해결 방법
| 실수 | 겉으로 보이는 문제 | 해결 방법 |
|---|---|---|
| 빽빽한 텍스트 덩어리 | 하나의 큐에 전체 문장이나 문단 길이의 블록이 들어감 | 의미 단위로 더 짧은 큐로 나누고, 최대 2줄을 지키며, 한 줄 42자를 목표로 합니다 |
| 읽기에 너무 빠른 큐 | 텍스트가 많은 자막이 2초도 안 되어 지나감 | 읽기 속도가 초당 15~17자에 가까워질 때까지 길이를 늘리거나 큐 수를 더 늘립니다 |
| 쉼표 대신 점을 쓴 밀리초 표기 | 타임코드가 00:00:05,500이 아니라 00:00:05.500으로 표시됨 | SRT는 밀리초 구분에 점이 아니라 쉼표를 사용해야 합니다 |
| 빈 줄 누락 | 자막 블록이 붙어서 파싱에 실패함 | 각 큐에는 번호, 타임코드 줄, 자막 텍스트, 그리고 빈 줄이 필요합니다 |
| 잘못된 인코딩 | 악센트 문자나 비영어 문자가 깨져 보임 | 파일을 UTF-8로 저장하고 업로드 전에 특수 문자를 다시 확인합니다 |
변환보다 전사가 먼저 필요한 경우
텍스트-SRT 변환은 이미 문장이 준비되어 있을 때만 가능합니다. 실제로 가지고 있는 것이 오디오나 비디오라면, 변환만으로는 문제가 해결되지 않습니다. 먼저 전사를 하고, 그다음 자막 형식으로 정리해야 합니다.
다음과 같은 경우에는 변환보다 전사가 필요합니다.
- 녹음 파일만 있습니다. 스크립트도, 전사문도, 자막도 없습니다.
- 화자가 즉흥적으로 말했습니다. 작성된 스크립트가 실제 발화 내용과 일치하지 않습니다.
- 정확한 싱크가 필요합니다. 문구와 타이밍이 추정된 읽기 기준이 아니라 실제 미디어를 반영해야 합니다.
원본이 YouTube 영상이라면, 먼저 발화된 텍스트를 추출하는 것이 가장 실용적인 출발점인 경우가 많습니다. YouTube transcript를 얻는 방법에 대한 이 가이드는, 자막으로 변환하기 전에 먼저 문장을 추출하는 데 도움이 됩니다.
또한 모바일에서 녹음, 전사, 자막 정리 작업을 자주 오간다면, Soz AI app은 음성을 캡처하고 자막으로 만들기 전 텍스트를 준비하는 데 유용한 간단한 보조 옵션이 될 수 있습니다.
자주 묻는 질문
소프트웨어를 설치하지 않고도 텍스트를 SRT로 변환할 수 있나요?
네. 이미 스크립트나 전사문이 있다면, 브라우저 기반 텍스트-SRT 변환기만으로도 많은 작업을 처리할 수 있습니다. 텍스트를 붙여 넣고, 자막 큐로 나누고, 타이밍을 적용하고, 결과를 검토한 뒤 .srt 파일을 다운로드하면 됩니다. 개인정보 보호가 중요한 작업에서는 브라우저 내부 처리 방식이 특히 유용한데, 텍스트를 업로드하지 않고 로컬에서 처리할 수 있기 때문입니다.
영상에 자막 타이밍을 정확히 맞추려면 어떻게 해야 하나요?
필요하다면 먼저 자동 타이밍으로 시작한 뒤, 실제 영상에 자막을 겹쳐 보면서 확인하십시오. 큐의 시작과 종료를 말의 쉼, 문장 끝, 화자 전환에 맞게 조정하면 됩니다. 전체 트랙이 같은 정도로 빠르거나 늦다면 파일 전체를 고정 오프셋만큼 이동시키십시오. 일부 구간만 어긋난다면 실제 말하기 속도가 원본 텍스트와 다르므로 해당 구간만 수동으로 다시 타이밍을 맞춰야 합니다.
SRT와 VTT 중 무엇을 써야 하나요?
SRT는 비디오 플랫폼, 편집기, 플레이어에서 폭넓게 지원되므로 가장 안전한 기본 선택입니다. 플랫폼이 명시적으로 요구하거나 WebVTT 지원과 연결된 웹 중심 기능이 필요할 때는 VTT를 사용하십시오. 확실하지 않다면 먼저 SRT로 내보내 테스트하고, 플랫폼이 VTT를 선호할 때만 전환하는 것이 좋습니다.
자막 한 줄은 몇 자 정도가 적당한가요?
전문적인 기준으로는 한 줄당 42자 이하, 자막당 최대 2줄이 안정적인 목표입니다. 이는 모든 플랫폼에 적용되는 절대 법칙은 아니지만, 실제 대부분의 자막 레이아웃에서 잘 작동합니다. 또한 줄 길이만 보지 말고 읽기 속도도 함께 확인해야 합니다. 짧은 줄이라도 표시 시간이 너무 짧으면 여전히 읽기 어려울 수 있습니다.
