Konwertuj PDF na tekst
Wyodrębnij tekst wszystkich stron do jednego pliku .txt w UTF-8 — bezpośrednio w przeglądarce.
Obsługa zakresów stron, bez wysyłania, wynik gotowy do skopiowania.
Opcje wyodrębniania
Wybierz zakres stron albo zostaw puste, aby wyodrębnić tekst ze wszystkich stron.
Upuść kolejne pliki PDF, aby dodać je do kolejki.
Wyodrębniaj większe dokumenty i wsadowo dzięki Pro
Plan darmowy wyodrębnia do 50 stron na plik; Pro odblokowuje większe dokumenty i wyodrębnianie wsadowe z wielu plików PDF naraz. Ten sam klucz odblokowuje każde narzędzie Pro.
Przejdź na ProMasz już klucz Pro? Wklej go tutaj
O wyodrębnianiu tekstu z PDF
Konwersja PDF na tekst odczytuje warstwę tekstową Twojego pliku PDF i tworzy plik .txt w UTF-8. Plan darmowy obsługuje do 50 stron; Pro odblokowuje większe dokumenty i konwersję wsadową. W odróżnieniu od niektórych konwerterów online, które wysyłają PDF na serwer do analizy, pdfmundo wyodrębnia tekst lokalnie przy użyciu pdf.js od Mozilli — plik nigdy nie opuszcza karty przeglądarki. Pliki wielołamowe (gazety, dwułamowe artykuły naukowe) mogą dać tekst z przeplatanymi łamami; jeśli zależy Ci na zachowaniu układu, użyj PDF → Word. Zeskanowane pliki PDF bez warstwy tekstowej nie zwrócą żadnego tekstu — najpierw użyj OCR PDF, aby dodać warstwę tekstową.
Najczęstsze pytania
- Gdzie przetwarzany jest mój PDF?
- W całości w karcie Twojej przeglądarki. Do odczytania warstwy tekstowej PDF-a używamy pdf.js od Mozilli. Nic nie trafia na nasz serwer.
- Dlaczego mój wielołamowy PDF daje przeplatany tekst?
- pdf.js zwraca fragmenty tekstu w kolejności, w jakiej występują w wewnętrznym strumieniu PDF-a, co przy układach wielołamowych może przeplatać łamy według położenia w pionie. Jeśli chcesz zachować kolejność czytania łamów, użyj PDF → Word — to narzędzie ma osobną logikę wykrywania łamów.
- Co, jeśli mój PDF to skan bez warstwy tekstowej?
- Wtedy nie ma czego wyodrębniać. Wykrywamy to i proponujemy link do naszego narzędzia OCR PDF, które dodaje warstwę tekstową do plików złożonych wyłącznie z obrazów. Najpierw uruchom OCR, a potem wróć po tekst.
- Co, jeśli mój PDF jest zabezpieczony hasłem?
- Narzędzie Cię o tym powiadomi. Najpierw usuń hasło w swoim programie do PDF, a potem wyodrębnij tekst.
- Czy formatowanie zostanie zachowane?
- Nie. Czysty tekst nie ma formatowania: bez pogrubienia, kursywy, rozmiarów czcionek i nagłówków. Jeśli potrzebujesz zachowania układu i formatowania, użyj PDF → Word.
- Jakie kodowanie ma plik wynikowy?
- Zawsze UTF-8. Bezstratne dla każdego PDF-a z treścią w Unicode, w tym emoji, pisma CJK, cyrylicy, greki, alfabetu arabskiego itd.
- Jaki jest maksymalny rozmiar pliku?
- 50 MB i 50 stron w planie darmowym; 250 MB i 5000 stron w Pro.
- Czy potrzebuję konta?
- Nie. Narzędzie jest całkowicie darmowe i nie wymaga rejestracji.
Więcej narzędzi PDF
Gdy masz już czysty tekst, możesz najpierw dodać warstwę tekstową do skanu za pomocą OCR, przekonwertować z zachowaniem układu przez PDF → Word albo wydobyć obrazy stron przez PDF → JPG.
Zobacz wszystkie narzędzia