Przejdź do treści

Jak wyciągnąć tekst z pliku wideo na Macu

9 min read 1 views Ostatnia aktualizacja: sie 2, 2026
An open laptop showing a paused video, an external microphone on a stand beside it

Najważniejsze informacje

macOS sam z siebie nie transkrybuje pliku wideo. To, co zrobi bez żadnych pobrań, to wyeksportowanie ścieżki audio z wideo za pomocą QuickTime Player, co zostawi ci znacznie mniejszy plik do dalszej pracy. Wbudowane dyktowanie zapisuje to, co usłyszy mikrofon, na żywo, w miarę jak mówisz — to nie jest narzędzie do nagrania, które już masz. Transkrypcja to osobny krok, i jest to ten sam krok niezależnie od tego, na jakim komputerze pracujesz.

Masz na Macu plik wideo. Nagranie ekranu ze spotkania, wykład, który ktoś ci przesłał, klip, który sobie zapisałeś. Chcesz mieć te słowa w formie tekstu. Najlepiej bez zakładania konta w firmie, o której nigdy nie słyszałeś.

Całe zadanie dzieli się na dwie części. Najpierw trzeba wydobyć z wideo czysty plik audio. Potem trzeba ten dźwięk zamienić na tekst. Pierwszą część twój Mac już umie zrobić, od razu, oprogramowaniem, które masz na komputerze. Drugiej nie umie, i żadne przeszukiwanie Ustawień systemowych tego nie zmieni. Warto wiedzieć, gdzie przebiega ta granica — to oszczędza całe popołudnie szukania opcji w menu, która nie istnieje.

Co macOS już umie

QuickTime Player jest instalowany na każdym Macu. Odtwarza wideo, nagrywa ekran, a do tego może wyeksportować dźwięk z pliku wideo. Ta ostatnia funkcja jest tu przydatna i często to jedyny krok, jaki musisz wykonać, zanim przekażesz plik dalej, do innego narzędzia.

macOS ma też dyktowanie, które zamienia mowę na tekst w trakcie mówienia. Jest też Voice Memos (Dyktafon), który synchronizuje się z tą samą aplikacją na iPhonie przez iCloud. Te trzy funkcje razem pozwalają nagrywać dźwięk, przechowywać go i pisać głosem.

Żadna z nich nie odczyta istniejącego pliku wideo i nie da ci transkrypcji. Warto to powiedzieć jasno, bo te narzędzia leżą tak blisko siebie, że wydaje się, że taka funkcja musi się gdzieś kryć. Nie kryje się. Mac dobrze radzi sobie z tworzeniem nagrań, a słabo z zamianą ich na tekst.

Najpierw wyciągnij dźwięk

Plik wideo to kontener. Niesie w sobie obraz i ścieżkę audio, a transkrypcja zawsze dotyka tylko dźwięku. Obraz jest tu zbędnym balastem.

Więc zanim zrobisz coś innego, wyeksportuj dźwięk. QuickTime Player umie to zrobić, co znaczy, że ten pierwszy krok nic cię nie kosztuje i niczego nie musisz instalować. W efekcie dostajesz plik znacznie mniejszy niż wideo, od którego zacząłeś — czasem drastycznie mniejszy, w zależności od tego, czym było to wideo.

Ta różnica w rozmiarze przestaje być abstrakcją, gdy nagranie jest długie. Dwugodzinny wykład w formie wideo trudno przenosić, wysyłać czy przechowywać w kilku kopiach, podczas gdy zastanawiasz się, z jakiego narzędzia skorzystać. Te same dwie godziny w formie audio to skromny plik, którym operujesz bez zastanowienia. Jeśli masz cały folder nagrań do przetworzenia, wcześniejsze wydobycie dźwięku to różnica między wieczorem pracy a całym weekendem.

Wyodrębnienie dźwięku rozstrzyga też pytanie, które wielu ludzi zbija z pantałyku: czy potrzebują narzędzia, które konkretnie obsługuje zamianę plików wideo na tekst, czy wystarczy im zwykła transkrypcja audio. Gdy dźwięk stanie się osobnym plikiem, ta różnica przestaje mieć znaczenie. Każde narzędzie do transkrypcji, które przyjmuje audio, przyjmie też twój plik.

Dyktowanie to inne zadanie

Dyktowanie i transkrypcja są używane, jakby były tym samym słowem. Nie są, a różnica między nimi to właśnie to, co stoi między tobą a transkrypcją, którą chcesz uzyskać.

Dyktowanie słucha mikrofonu i zapisuje to, co usłyszy, na żywo, w miarę jak to się dzieje. Mówisz, tekst się pojawia. To metoda wpisywania tekstu. Transkrypcja bierze nagranie, które już istnieje — coś, co skończyło się godzinę temu albo rok temu — i produkuje z niego tekst. Jedno to urządzenie wejściowe, drugie to konwersja.

Można próbować obejść ten problem, odtwarzając wideo na głos i pozwalając dyktowaniu słuchać przez głośniki. Ludzie tak robią. Wychodzi to źle. Prosisz mikrofon o ponowne nagranie dźwięku, który już raz został nagrany, w konkretnym pomieszczeniu, z akustyką, jaką to pomieszczenie ma, i musisz przesiedzieć cały czas trwania nagrania, żeby to się wykonało. Godzina wideo kosztuje cię godzinę. Dla czegokolwiek dłuższego niż krótki klip to nie jest poważna opcja. Więcej na temat zamiany mowy na tekst na Macu i tego, gdzie kończy się wbudowana ścieżka, znajdziesz w innym miejscu, ale w skrócie: dyktowanie nigdy nie zostało zaprojektowane do pracy z plikami.

Kiedy nie masz jeszcze pliku

Wszystko powyższe zakłada, że wideo już jest na twoim dysku. Czasem nie jest. Rzeczą, z której chcesz wydobyć słowa, jest rozmowa w trakcie albo wideo odtwarzane w karcie przeglądarki, i nie masz z czego wyodrębnić dźwięku, bo nic nie zostało zapisane.

To tutaj Mac stawia swoją prawdziwą przeszkodę. Przechwytywanie dźwięku systemowego samego Maca — dźwięku wychodzącego z komputera, a nie wchodzącego przez mikrofon — nie jest czymś, co macOS domyślnie udostępnia. Nagrywanie ekranu daje ci obraz. Zdobycie towarzyszącego mu dźwięku to osobny problem, i to właśnie ten jeden krok najczęściej zatrzymuje ludzi w miejscu. Jeśli kiedykolwiek skończyłeś z bezgłośnym nagraniem spotkania i nie wiedziałeś, co zrobiłeś źle — właśnie na to trafiłeś. Nie zrobiłeś nic źle.

Istnieją sposoby, by to obejść, i warto je poznać, zanim będziesz ich potrzebować, a nie pięć minut w trakcie rozmowy, której nie da się powtórzyć. Sam mechanizm nagrywania ekranu na Macu razem z dźwiękiem to osobny temat. Tutaj ważne jest to, że to problem z przechwytywaniem, nie z transkrypcją, a jego rozwiązanie wraca cię do zwykłego przypadku: pliku na dysku.

Jedna droga pozwala obejść ten problem całkowicie. Voice Memos (Dyktafon) na Macu udostępnia nagrania tej samej aplikacji na iPhonie przez iCloud, więc wszystko, co nagrasz na telefonie, pojawia się na Macu bez wysyłania sobie pliku mailem czy szukania kabla. Przy rozmowie na żywo albo wykładzie, na którym siedzisz, nagrywanie telefonem i odbieranie pliku na komputerze jest mniej kłopotliwe niż walka z dźwiękiem systemowym. Rzecz jasna nic to nie pomoże z dźwiękiem, który sam Mac produkuje.

Zamiana dźwięku na tekst

Gdy dźwięk już istnieje jako plik, żadna z wcześniejszych decyzji nie ma już znaczenia. Transkrypcji nie interesuje, czy plik powstał z wideo, z telefonu, z nagrania ekranu czy z czegoś, co przesłał ci kolega. Nie interesuje jej też, że pracujesz na Macu. Od tego momentu to takie samo zadanie jak na każdym innym komputerze, co oznacza, że twój wybór dotyczy tylko narzędzia do transkrypcji i niczego więcej.

To też moment, w którym chęć uniknięcia rejestracji zderza się z rzeczywistością, więc powiem to bez owijania w bawełnę. Wszystko, co działa całkowicie w twojej przeglądarce, może obiecywać, że twój plik nigdy nie opuści komputera, i niektóre narzędzia naprawdę tak działają. Ale narzędzia przeglądarkowe tego typu obsługują raczej pliki z napisami i liczenie znaków — czyli tekst, który już jest tekstem. Faktyczne rozpoznawanie mowy w dwugodzinnym nagraniu to znacznie cięższa praca, a narzędzia, które ją wykonują, zwykle wymagają albo zainstalowanej aplikacji, albo wysłania pliku na ich serwery. Którejkolwiek opcji wybierzesz, to jest pytanie, które warto zadać, a odpowiedź powinna być łatwa do znalezienia.

SozAI to jedna z opcji: aplikacja do transkrypcji dla macOS, która obsługuje pliki audio i wideo, nagrania oraz linki z YouTube, z oznaczeniami mówców, podsumowaniami i tłumaczeniem na ponad 99 języków. Ta sama strona ma darmowe narzędzia przeglądarkowe do napisów i liczenia znaków, które działają całkowicie w przeglądarce, bez wysyłania czegokolwiek i bez konta — te nie transkrybują dźwięku, ale są przydatne, gdy masz już transkrypcję, nad którą chcesz pracować.

Czego transkrypcja ci nie zapewni

Poproś o znaczniki czasu, jeśli chodzi o powrót do konkretnego momentu. Transkrypcja bez nich to ściana tekstu, w której można szukać — znajdziesz zdanie — ale znalezienie zdania to nie to samo, co znalezienie miejsca w wideo, w którym zostało wypowiedziane. Jeśli transkrybujesz wykład, żeby przeskoczyć do tych dziesięciu minut, które były ważne, znaczniki czasu to cała ta funkcja. Jeśli transkrybujesz, żeby przeczytać tekst raz i nigdy więcej nie otwierać wideo, są zbędne. Zdecyduj, o co ci chodzi, zanim zaczniesz, bo dodanie ich później oznacza wykonanie tej pracy dwa razy.

Oczekuj, że tekst będzie odzwierciedlał nagranie, z którego powstał. Rozpoznawanie mowy pracuje na tym, co faktycznie zostało nagrane, a nagranie zrobione w pomieszczeniu, gdzie ludzie mówią jeden przez drugiego, daje mu mniej materiału niż czyste nagranie. Wyodrębnienie dźwięku z wideo nie poprawia jego jakości — po prostu izoluje to, co już tam było. Jeśli źródłowy dźwięk jest słaby, będziesz poprawiać transkrypcję, i żaden wcześniejszy krok tego nie naprawi.

I przyjmij do wiadomości, że część wideo nie przetrwa tej podróży. Slajdy, diagramy, wszystko, co zostało napisane na tablicy, kto na co wskazywał gestem — to wszystko wypada, bo świadomie odrzuciłeś obraz, żeby uzyskać plik, na którym można pracować. Dla rozmowy to nie jest żadna strata. Dla demonstracji czy prezentacji transkrypcja to tylko połowa zapisu, i będziesz chciał zachować oryginalne wideo obok niej.

Odpowiedzi

Frequently Asked Questions

Czy Mac może transkrybować plik wideo bez dodatkowego oprogramowania?

Nie. macOS może odtworzyć wideo, nagrać ekran i wyeksportować ścieżkę audio z pliku wideo za pomocą QuickTime Player, ale nie ma wbudowanej funkcji, która odczyta istniejące nagranie i wyprodukuje z niego tekst. Dyktowanie nie jest tym narzędziem, bo działa na żywym sygnale z mikrofonu. Transkrypcja już istniejącego pliku wymaga osobnego narzędzia, na Macu tak jak na każdym innym komputerze.

Jaka jest różnica między dyktowaniem a transkrypcją?

Dyktowanie zamienia mowę na tekst w momencie, gdy jest wypowiadana, słuchając mikrofonu na żywo, więc działa jako metoda wpisywania tekstu. Transkrypcja bierze nagranie, które już istnieje, i zamienia je na tekst później. Brzmią jak to samo zadanie, ale nie są: dyktowania nie można wskazać na plik, a odtwarzanie nagrania na głos, żeby dyktowanie mogło je usłyszeć, kosztuje cały czas trwania nagrania i ponownie nagrywa dźwięk, który już raz został nagrany.

Jak wydobyć tylko dźwięk z pliku wideo?

QuickTime Player, instalowany razem z macOS, może wyeksportować dźwięk z wideo, więc do tego kroku nie musisz niczego instalować. Plik wideo niesie ścieżkę audio razem z obrazem, a transkrypcja korzysta wyłącznie z dźwięku. Wyeksportowanie go daje znacznie mniejszy plik, co ma duże znaczenie przy długich nagraniach, które trudno przenosić czy wysyłać w formie wideo.

Czemu nie mogę nagrać dźwięku, który odtwarza mój Mac?

Przechwytywanie dźwięku systemowego samego Maca, czyli dźwięku wychodzącego z komputera, a nie wchodzącego przez mikrofon, nie jest czymś, co macOS domyślnie udostępnia. Dlatego nagrania ekranu z rozmów czy wideo odtwarzanego w przeglądarce tak często wychodzą bez dźwięku. To problem z przechwytywaniem, nie z transkrypcją, i to właśnie ten krok najczęściej zatrzymuje ludzi, zanim zdążą uzyskać jakikolwiek plik do pracy.

Czy nagrania głosowe zrobione na iPhonie pojawiają się na Macu?

Tak. Voice Memos (Dyktafon) na Macu udostępnia nagrania tej samej aplikacji na iPhonie przez iCloud, więc coś nagranego na telefonie jest dostępne na komputerze bez wysyłania sobie pliku mailem czy podłączania kabla. Przy rozmowie na żywo to często prostsze niż próba nagrania na Macu. Nie pomoże to jednak z dźwiękiem, który odtwarza sam Mac — to osobny problem.

Czy potrzebuję znaczników czasu w transkrypcji?

Tylko jeśli planujesz wracać do konkretnych momentów nagrania. Bez znaczników czasu tekst jest przeszukiwalny, więc znajdziesz zdanie, ale nie znajdziesz miejsca w wideo, w którym zostało wypowiedziane. Przy wykładzie czy długim spotkaniu, do którego zamierzasz wracać, znaczniki czasu są kluczowe. Przy czymś, co przeczytasz raz i odłożysz, są tylko zbędnym elementem na stronie.

Merey Tleugazin

Założyciel SozAI. Tworzy narzędzia, które zamieniają mowę w tekst dla profesjonalistów na całym świecie.

SozAI
SozAI — Darmowe pobieranieTranskrybuj audio i wideo natychmiast
Pobierz aplikację