Konwertuj PDF na tekst

Wyodrębnij tekst wszystkich stron do jednego pliku .txt w UTF-8 — bezpośrednio w przeglądarce.
Obsługa zakresów stron, bez wysyłania, wynik gotowy do skopiowania.

Upuść tutaj PDF, aby wyodrębnić tekst
Za darmo · Do 50 MB · Pro do 250 MB · Przetwarzane w Twojej przeglądarce

O wyodrębnianiu tekstu z PDF

Konwersja PDF na tekst odczytuje warstwę tekstową Twojego pliku PDF i tworzy plik .txt w UTF-8. Plan darmowy obsługuje do 50 stron; Pro odblokowuje większe dokumenty i konwersję wsadową. W odróżnieniu od niektórych konwerterów online, które wysyłają PDF na serwer do analizy, pdfmundo wyodrębnia tekst lokalnie przy użyciu pdf.js od Mozilli — plik nigdy nie opuszcza karty przeglądarki. Pliki wielołamowe (gazety, dwułamowe artykuły naukowe) mogą dać tekst z przeplatanymi łamami; jeśli zależy Ci na zachowaniu układu, użyj PDF → Word. Zeskanowane pliki PDF bez warstwy tekstowej nie zwrócą żadnego tekstu — najpierw użyj OCR PDF, aby dodać warstwę tekstową.

Najczęstsze pytania

Gdzie przetwarzany jest mój PDF?
W całości w karcie Twojej przeglądarki. Do odczytania warstwy tekstowej PDF-a używamy pdf.js od Mozilli. Nic nie trafia na nasz serwer.
Dlaczego mój wielołamowy PDF daje przeplatany tekst?
pdf.js zwraca fragmenty tekstu w kolejności, w jakiej występują w wewnętrznym strumieniu PDF-a, co przy układach wielołamowych może przeplatać łamy według położenia w pionie. Jeśli chcesz zachować kolejność czytania łamów, użyj PDF → Word — to narzędzie ma osobną logikę wykrywania łamów.
Co, jeśli mój PDF to skan bez warstwy tekstowej?
Wtedy nie ma czego wyodrębniać. Wykrywamy to i proponujemy link do naszego narzędzia OCR PDF, które dodaje warstwę tekstową do plików złożonych wyłącznie z obrazów. Najpierw uruchom OCR, a potem wróć po tekst.
Co, jeśli mój PDF jest zabezpieczony hasłem?
Narzędzie Cię o tym powiadomi. Najpierw usuń hasło w swoim programie do PDF, a potem wyodrębnij tekst.
Czy formatowanie zostanie zachowane?
Nie. Czysty tekst nie ma formatowania: bez pogrubienia, kursywy, rozmiarów czcionek i nagłówków. Jeśli potrzebujesz zachowania układu i formatowania, użyj PDF → Word.
Jakie kodowanie ma plik wynikowy?
Zawsze UTF-8. Bezstratne dla każdego PDF-a z treścią w Unicode, w tym emoji, pisma CJK, cyrylicy, greki, alfabetu arabskiego itd.
Jaki jest maksymalny rozmiar pliku?
50 MB i 50 stron w planie darmowym; 250 MB i 5000 stron w Pro.
Czy potrzebuję konta?
Nie. Narzędzie jest całkowicie darmowe i nie wymaga rejestracji.

Więcej narzędzi PDF

Gdy masz już czysty tekst, możesz najpierw dodać warstwę tekstową do skanu za pomocą OCR, przekonwertować z zachowaniem układu przez PDF → Word albo wydobyć obrazy stron przez PDF → JPG.

Zobacz wszystkie narzędzia