Z tekstu do SRT: jak zamienić dowolny skrypt w napisy krok po kroku

13 min read 9 views Ostatnia aktualizacja: lip 19, 2026

Najważniejsze wnioski

Konwersja tekstu do formatu SRT oznacza wykonanie dwóch zadań: podzielenie zwykłego tekstu na czytelne segmenty napisów oraz przypisanie każdemu segmentowi kodów czasu rozpoczęcia i zakończenia. Jeśli masz już gotowy tekst, nie potrzebujesz pełnego oprogramowania do transkrypcji — potrzebujesz procesu konwersji tekstu do SRT, który tworzy poprawne znaczniki czasu, czytelne podziały wierszy i prawidłowe formatowanie napisów. Najszybszym sposobem jest wklejenie skryptu do przeglądarkowego konwertera tekstu do SRT, automatyczne podzielenie go na segmenty, ustawienie czasu, a następnie szybkie ręczne sprawdzenie czytelności. Jeśli dopiero zaczynasz pracę z plikami napisów, warto też zrozumieć, czym jest plik SRT, aby wiedzieć, czego oczekują od niego odtwarzacze i edytory.

Jeśli masz transkrypcję, skrypt, notatki z wykładu, tekst piosenki lub inny zwykły tekst i potrzebujesz napisów, najtrudniejsza część nie dotyczy rozszerzenia pliku. Chodzi o synchronizację czasową. Prawidłowy plik .srt to po prostu ponumerowane bloki napisów z kodami czasu i tekstem, ale żeby napisy wyglądały profesjonalnie, każdy blok musi być wystarczająco krótki, by dało się go przeczytać, i wyświetlany wystarczająco długo, by odbiór był naturalny.

Dlatego „txt do srt” to nie tylko kopiuj, wklej i zapisz. Trzeba podzielić tekst na fragmenty odpowiednie dla napisów, oszacować lub przypisać czas trwania, a następnie dopracować synchronizację tak, by odpowiadała temu, jak człowiek rzeczywiście mówi. Poniżej znajdziesz praktyczny proces krok po kroku oraz zasady, które pomagają uniknąć najczęstszych błędów w napisach.

Na czym naprawdę polega konwersja tekstu do SRT

Gdy użytkownicy szukają fraz typu „script to srt” lub „konwersja tekstu na napisy”, zwykle mają na myśli jedną z dwóch sytuacji:

  • Mam już gotowy tekst. Masz tekst i chcesz zamienić go w segmenty napisów z odpowiednim czasem.
  • Mam tylko audio lub wideo. W takim przypadku przed konwersją napisów nadal potrzebna jest transkrypcja.

Ten artykuł skupia się na pierwszym przypadku: masz już tekst. Wtedy konwersja obejmuje dwa podstawowe zadania.

1. Podziel tekst na segmenty napisów

Napisy to nie akapity. Dobry segment napisów zwykle zawiera jedno krótkie zdanie albo jedną sensowną frazę. Jeśli upchniesz zbyt dużo tekstu w jednym segmencie, widzowie albo nie nadążą z czytaniem, albo przestaną oglądać wideo, żeby przeczytać napis.

Na przykład to zdanie w formie zwykłego tekstu jest zbyt długie jako jeden napis:

„Zanim zaczniemy, chcę wyjaśnić, jak działa to narzędzie, jakie znaczniki czasu generuje automatycznie i co nadal należy sprawdzić ręcznie przed wyeksportowaniem gotowego pliku.”

Lepszy podział na napisy wyglądałby tak:

Zanim zaczniemy,
chcę wyjaśnić, jak działa to narzędzie.

Jakie znaczniki czasu generuje automatycznie,
i co nadal należy sprawdzić ręcznie.

Przed wyeksportowaniem gotowego pliku.

2. Przypisz kody czasu rozpoczęcia i zakończenia

Każdy segment SRT potrzebuje czasu rozpoczęcia i zakończenia w takim formacie:

00:00:12,500 –> 00:00:15,200

Jeśli tekst pochodzi ze skryptu, a nie z dokładnie wypowiedzianej mowy, musisz oszacować czas na podstawie prędkości czytania albo rzeczywistego tempa mówcy. Dlatego automatyczne ustawianie czasu jest przydatne jako pierwsza wersja robocza, ale nie jako ostateczne rozwiązanie w przypadku ważnych materiałów wideo.

Przybliżony profesjonalny cel dla wygodnego czytania po angielsku to 15–17 znaków na sekundę. Powyżej tej wartości wielu widzów nie nadąża. Znacznie poniżej niej napisy mogą sprawiać wrażenie opóźnionych albo wisieć na ekranie zbyt długo.

Krok po kroku: jak przekonwertować zwykły tekst do SRT w przeglądarce

Jeśli zależy Ci na najszybszej metodzie, skorzystaj z narzędzia w przeglądarce stworzonego do konwersji txt do srt. Poniższy proces jest prosty, praktyczny i dobrze sprawdza się wtedy, gdy masz już gotowy skrypt.

Krok 1: Wklej skrypt lub transkrypcję

Otwórz konwerter, wklej zwykły tekst i sprawdź go przed wygenerowaniem segmentów. Jakość materiału wejściowego ma znaczenie. Usuń wszystko, co nie powinno pojawić się na ekranie, na przykład notatki dla mówcy, wskazówki sceniczne, znaczniki czasu z innego formatu albo powtarzające się nagłówki.

Dobry tekst źródłowy:

  • Zwykłe, mówione zdania. „Witamy ponownie. Dzisiaj omówimy ceny, konfigurację i eksport.”
  • Lekka interpunkcja. Kropki i przecinki pomagają narzędziu znaleźć naturalne miejsca podziału.
  • Jeden język na jedną ścieżkę napisów. Tekst mieszający języki często powoduje niezręczny podział segmentów.

Słaby tekst źródłowy:

  • Ściany tekstu. Ogromne akapity bez interpunkcji.
  • Szum formatowania. Wypunktowania, znaczniki czasu, emoji, notatki sceniczne albo treść skopiowana z PDF-ów z błędnie połamanymi liniami.
  • Wypełniacze z transkrypcji. Nadmiar „yyy”, „eee” albo zduplikowane słowa, których nie chcesz w napisach.

Krok 2: Automatycznie podziel tekst na segmenty odpowiednie dla napisów

Użyj funkcji automatycznego podziału, aby rozbić tekst na fragmenty mieszczące się w granicach czytelności napisów. To oszczędza czas, ponieważ zamienia blok tekstu w ponumerowane segmenty, zamiast zmuszać Cię do ręcznego tworzenia każdego napisu.

Nie chodzi tylko o „mniejsze fragmenty”. Chodzi o fragmenty czytelne. Na początek:

  • Utrzymuj krótkie linie. Celuj w maksymalnie 42 znaki na linię.
  • Maksymalnie dwie linie. Więcej niż dwie linie zasłania zbyt dużą część kadru.
  • Dziel zgodnie z sensem. Jeśli to możliwe, rozbijaj tekst przy przecinkach, spójnikach albo naturalnych pauzach.

Jeśli jeden segment brzmi „Przeanalizowaliśmy wywiady z klientami i znaleźliśmy trzy typowe problemy związane z onboardingiem”, nie dziel go tak:

Przeanalizowaliśmy wywiady z klientami i znaleźliśmy
trzy typowe problemy związane z onboardingiem

To jest akceptowalne. Ale to jest gorsze:

Przeanalizowaliśmy wywiady z klientami
i znaleźliśmy trzy typowe problemy związane z onboardingiem

Druga wersja rozbija frazę w niezręcznym miejscu. Czytelność jest ważniejsza niż mechaniczne trzymanie się długości.

Krok 3: Zastosuj automatyczne ustawianie czasu

Gdy tekst jest już podzielony, wygeneruj znaczniki czasu. Dobry konwerter tekstu do SRT szacuje czas trwania segmentu na podstawie długości tekstu, tak aby każdy napis pozostawał na ekranie wystarczająco długo, by dało się go przeczytać. To idealne rozwiązanie dla projektów opartych na skrypcie, wstępnych montaży, wewnętrznych materiałów do weryfikacji albo sytuacji, gdy przygotowujesz napisy, zanim ostateczne tempo voiceoveru zostanie ustalone.

Praktyczna zaleta jest taka, że przetwarzanie odbywa się w przeglądarce, więc tekst nie jest przesyłany podczas tworzenia pliku SRT. To przydaje się przy prywatnych skryptach, wersjach roboczych dla klientów i wewnętrznych materiałach ze spotkań.

Trzymaj się tych zasad dotyczących czasu:

  • Minimalny czas trwania: około 1 sekundy na segment.
  • Maksymalny czas trwania: około 7 sekund na segment.
  • Prędkość czytania: mniej więcej 15–17 znaków na sekundę.

Na przykład napis o długości 30 znaków często potrzebuje około 2 sekund. Dwuwierszowy napis o długości 70 znaków może potrzebować 4–5 sekund. Automatyczne ustawianie czasu daje dobry punkt wyjścia, ale nadal warto sprawdzić długie segmenty, bardzo krótkie segmenty i miejsca, w których tempo mowy się zmienia.

Krok 4: Popraw podziały i brzmienie tekstu

Przed pobraniem przejrzyj każdy blok napisów i popraw wszystko, co wydaje się zbyt ciężkie albo nienaturalne. To właśnie na tym etapie przeciętnie wyglądające napisy zaczynają wyglądać profesjonalnie.

Zwróć uwagę na:

  • Zbyt długie segmenty. Podziel je na dwa napisy, jeśli czyta się je zbyt wolno.
  • Złe podziały linii. Trzymaj razem imiona, czasowniki i krótkie frazy.
  • Niepotrzebne wypełniacze. Usuń powtórzone słowa, jeśli Twój przypadek użycia pozwala na czyste napisy zamiast napisów dosłownych.

Jeśli źródłem jest formalny skrypt, ten etap zwykle przebiega szybko. Jeśli tekst pochodzi z surowej transkrypcji, przygotuj się na kilka minut czyszczenia.

Krok 5: Pobierz plik .srt

Po sprawdzeniu tekstu segmentów i synchronizacji wyeksportuj plik jako .srt. Następnie przetestuj go w swojej platformie wideo, edytorze lub odtwarzaczu. Jeśli platforma odrzuca plik albo napisy wyświetlają się dziwnie, sprawdź poprawność formatu za pomocą walidatora SRT, zanim zaczniesz szukać innych przyczyn problemu.

Zasady tworzenia napisów, które sprawiają, że efekt wygląda profesjonalnie

Automatyczna konwersja oszczędza czas, ale napisy nadal wymagają dopracowania. To właśnie te zasady stanowią różnicę między „technicznie poprawne” a „wygodne do oglądania”.

Zadbaj o czytelność linii

  • Maksymalnie 42 znaki na linię. To sprawdzony cel dla większości układów wideo.
  • Maksymalnie 2 linie na segment. Jeśli napis potrzebuje 3 linii, prawie zawsze należy go podzielić.
  • Stawiaj na zrównoważone linie. Dwie linie o podobnej długości zwykle czyta się lepiej niż jedną bardzo długą linię i jedno krótkie słowo pod spodem.

Szanuj prędkość czytania

Profesjonalni twórcy napisów często pracują w oparciu o liczbę znaków na sekundę, a nie tylko intuicję. Około 15–17 znaków na sekundę to mocna podstawa dla szerokiej publiczności. Szybsze tempo może sprawdzić się w krótkich klipach do social mediów, ale jeśli stale przekraczasz ten poziom, czytelność szybko spada.

Przykład:

  • 50 znaków w 2 sekundy = 25 znaków na sekundę, czyli za szybko dla większości widzów.
  • 50 znaków w 3,5 sekundy = około 14 znaków na sekundę, znacznie lepiej.

Dopasuj czas do naturalnych pauz w mowie

Nawet jeśli synchronizacja początkowo jest tylko oszacowana, granice segmentów powinny odpowiadać temu, jak płynie wypowiedź. Jeśli to możliwe, kończ napisy na interpunkcji, pauzach, granicach zdań składowych i zmianach mówcy. Jeśli napis urywa się w połowie myśli, a kolejny segment pojawia się natychmiast, efekt wydaje się mechaniczny.

Trzymaj się rozsądnych limitów czasu trwania

Przyjmuje się, że każdy napis powinien być widoczny od 1 do 7 sekund. Mniej niż 1 sekunda jest często nieczytelne. Powyżej 7 sekund napis może wyglądać na zamrożony, chyba że linia jest bardzo krótka.

Jak dopracować synchronizację po pierwszym eksporcie

Większość zadań typu script-to-SRT wymaga jeszcze jednego przejścia po eksporcie, zwłaszcza jeśli masz już właściwe wideo lub voiceover. Dopracowanie synchronizacji jest proste, jeśli wiesz, na co zwracać uwagę.

Przesuń całą ścieżkę napisów

Jeśli każdy napis pojawia się konsekwentnie za wcześnie albo za późno o tę samą wartość, nie edytuj każdego segmentu osobno. Przesuń cały plik. Dedykowane narzędzie do przesuwania czasu napisów to najszybszy sposób, aby dodać lub odjąć stałe przesunięcie w całym pliku SRT.

Przykład: jeśli każda linia pojawia się 1,2 sekundy za wcześnie, zastosuj przesunięcie +1,2 sekundy dla całego pliku.

Popraw czas tylko w problematycznych fragmentach

Jeśli początek jest poprawny, ale późniejsze sekcje zaczynają się rozjeżdżać, prawdopodobnie tempo skryptu źródłowego i rzeczywistej mowy różni się od siebie. W takim przypadku:

  • Skróć gęste segmenty. Podziel długie napisy, które wymuszają zbyt szybkie czytanie.
  • Wydłuż kluczowe linie. Zwiększ czas trwania ważnych lub technicznych treści.
  • Dopasuj punkty przejścia. Przesuń początki i końce do granic pauz.

Przetestuj w docelowej platformie

Nie wszystkie odtwarzacze renderują napisy w ten sam sposób. Zawsze sprawdzaj podgląd w rzeczywistym miejscu docelowym: na YouTube, na platformie kursowej, na serwerze multimediów albo w swoim oprogramowaniu do edycji. Jeśli Twoja platforma preferuje WebVTT zamiast SRT, przed eksportem ostatecznej wersji przeczytaj to bezpośrednie porównanie VTT i SRT.

Najczęstsze błędy przy konwersji tekstu do SRT i jak je naprawić

BłądJak wyglądaJak naprawić
Ściany tekstuJeden segment zawiera pełne zdania lub bloki tekstu wielkości akapituPodziel tekst zgodnie z sensem na krótsze segmenty, trzymaj się maksymalnie 2 linii i celuj w 42 znaki na linię
Segmenty zbyt szybkie do przeczytaniaNapisy migają przez mniej niż 2 sekundy, mimo że zawierają dużo tekstuZwiększ czas trwania albo podziel tekst na większą liczbę segmentów, aż prędkość czytania zbliży się do 15–17 znaków na sekundę
Przecinek zamiast kropki w milisekundachKody czasu używają formatu 00:00:05.500 zamiast 00:00:05,500SRT wymaga przecinków dla milisekund, a nie kropek
Brak pustych liniiBloki napisów zlewają się ze sobą i nie dają się poprawnie odczytaćKażdy segment musi zawierać numer, linię z kodem czasu, tekst napisu, a potem pustą linię
Nieprawidłowe kodowaniePolskie znaki lub znaki spoza angielskiego wyświetlają się niepoprawnieZapisz plik w UTF-8 i przed wysłaniem ponownie sprawdź znaki specjalne

Kiedy lepiej zrobić transkrypcję zamiast konwersji

Konwersja tekstu do SRT działa tylko wtedy, gdy masz już gotowy tekst. Jeśli w rzeczywistości masz tylko audio albo wideo, sama konwersja nie rozwiąże problemu. Najpierw potrzebujesz transkrypcji, a dopiero później formatowania napisów.

Typowe sygnały, że zamiast tego potrzebujesz transkrypcji:

  • Masz tylko nagranie. Bez skryptu, bez transkrypcji, bez napisów.
  • Mówca improwizował. Pisemny skrypt nie zgadza się z tym, co zostało powiedziane.
  • Potrzebujesz dokładnej synchronizacji. Treść i czas muszą odzwierciedlać rzeczywiste nagranie, a nie szacowany odczyt.

Jeśli źródłem jest film na YouTube, wyciągnięcie najpierw mówionego tekstu często jest najbardziej praktycznym punktem wyjścia. Ten poradnik o tym, jak uzyskać transkrypcję z YouTube, pomoże Ci wyodrębnić tekst, zanim zamienisz go na napisy.

A jeśli regularnie przechodzisz między nagrywaniem, transkrypcją i poprawianiem napisów na telefonie, aplikacja Soz AI to proste rozwiązanie pomocnicze do rejestrowania mowy i przygotowywania tekstu, zanim zamienisz go na napisy.

Najczęściej zadawane pytania

Czy mogę przekonwertować tekst do SRT bez instalowania oprogramowania?

Tak. Jeśli masz już skrypt albo transkrypcję, w wielu przypadkach wystarczy przeglądarkowy konwerter tekstu do SRT. Wklejasz tekst, dzielisz go na segmenty napisów, ustawiasz czas, sprawdzasz wynik i pobierasz plik .srt. W przypadku pracy z wrażliwymi danymi przetwarzanie po stronie przeglądarki jest szczególnie przydatne, ponieważ tekst może być obsługiwany lokalnie zamiast przesyłany.

Jak dokładnie zsynchronizować napisy z wideo?

W razie potrzeby zacznij od automatycznego ustawiania czasu, a następnie sprawdź napisy na tle rzeczywistego wideo. Dostosuj początki i końce segmentów tak, aby pasowały do pauz w mowie, końców zdań i zmian mówcy. Jeśli cała ścieżka jest za wcześnie albo za późno o tę samą wartość, przesuń cały plik o stały offset. Jeśli rozjeżdżają się tylko niektóre sekcje, popraw ich czas ręcznie, ponieważ tempo mowy różni się od tekstu źródłowego.

Czy lepiej użyć SRT czy VTT?

SRT to najbezpieczniejszy domyślny wybór, ponieważ jest szeroko obsługiwany przez platformy wideo, edytory i odtwarzacze. Użyj VTT, jeśli Twoja platforma wyraźnie tego wymaga albo jeśli potrzebujesz funkcji webowych związanych z obsługą WebVTT. Jeśli nie masz pewności, najpierw wyeksportuj SRT, przetestuj go i przejdź na VTT tylko wtedy, gdy Twoja platforma preferuje ten format.

Ile znaków powinna mieć linia napisów?

Dobrym profesjonalnym celem jest 42 znaki lub mniej na linię i nie więcej niż 2 linie na jeden napis. To nie jest uniwersalne prawo dla każdej platformy, ale sprawdza się w większości rzeczywistych układów napisów. Warto też kontrolować prędkość czytania, bo nawet krótka linia może być zbyt szybka, jeśli jest wyświetlana zbyt krótko.

Merey Tleugazin

Założyciel SozAI. Tworzy narzędzia, które zamieniają mowę w tekst dla profesjonalistów na całym świecie.

Soz AI
SozAI — Darmowe pobieranieTranskrybuj audio i wideo natychmiast
Pobierz aplikację