Převést PDF do textu
Získejte text všech stránek jako jeden soubor .txt v UTF-8 — přímo v prohlížeči.
Podpora rozsahů stránek, bez nahrávání, výstup připravený ke zkopírování.
Možnosti získávání textu
Zvolte rozsah stránek, nebo ponechte prázdné a získejte text ze všech stránek.
Přetáhněte další PDF a zařaďte je do fronty.
S Pro zpracujete větší dokumenty i dávky
Tarif zdarma získá text až z 50 stránek na soubor; Pro odemyká větší dokumenty a dávkové zpracování více PDF najednou. Stejný klíč odemkne každý nástroj Pro.
Přejít na ProUž máte klíč Pro? Vložte ho sem
O získávání textu z PDF
Převod PDF do textu přečte textovou vrstvu vašeho PDF a vytvoří soubor .txt v UTF-8. Tarif zdarma zvládne až 50 stránek; Pro odemyká větší dokumenty a dávkový převod. Na rozdíl od některých online převodníků, které vaše PDF kvůli analýze nahrávají na server, získává pdfmundo text lokálně pomocí pdf.js od Mozilly — váš soubor nikdy neopustí panel prohlížeče. Vícesloupcová PDF (noviny, dvousloupcové odborné články) mohou vrátit text, v němž se sloupce prolínají; pro extrakci zachovávající rozvržení použijte PDF → Word. Naskenovaná PDF bez textové vrstvy nevrátí žádný text — nejprve použijte OCR PDF a textovou vrstvu doplňte.
Časté dotazy
- Kde se moje PDF zpracovává?
- Výhradně v panelu vašeho prohlížeče. K přečtení textové vrstvy PDF používáme pdf.js od Mozilly. Na náš server se nic nenahrává.
- Proč moje vícesloupcové PDF vrací prolínající se text?
- pdf.js vrací textové položky v pořadí, v jakém jsou ve vnitřním datovém proudu PDF, což u vícesloupcových rozvržení může sloupce prolnout podle svislé pozice. Pro extrakci zachovávající pořadí čtení sloupců použijte PDF → Word — má vlastní logiku rozpoznávání sloupců.
- Co když je moje PDF naskenovaný obrázek bez textové vrstvy?
- Pak není co získávat. Rozpoznáme to a nabídneme odkaz na nástroj OCR PDF, který obrázkovým PDF doplní textovou vrstvu. Nejprve spusťte OCR a pak se vraťte pro text.
- Co když je moje PDF chráněné heslem?
- Nástroj vás na to upozorní. Nejprve heslo odstraňte ve svém programu pro PDF a pak text získejte.
- Zachová se formátování?
- Ne. Výstup v prostém textu je bez formátování: žádné tučné písmo, kurzíva, velikosti písma ani nadpisy. Pro extrakci se zachovaným rozvržením a formátováním použijte PDF → Word.
- Jaké kódování má výstup?
- Vždy UTF-8. Bezztrátové pro jakékoli PDF s obsahem v Unicode včetně emodži, CJK, cyrilice, řečtiny, arabštiny apod.
- Jaká je maximální velikost souboru?
- 50 MB a 50 stránek v tarifu zdarma; 250 MB a 5 000 stránek s Pro.
- Potřebuji účet?
- Ne. Nástroj je zcela zdarma a bez registrace.
Další nástroje pro PDF
Až budete mít prostý text, můžete naskenované PDF nejprve doplnit textovou vrstvou pomocí OCR, převést se zachovaným rozvržením přes PDF → Word nebo získat obrázky stránek přes PDF → JPG.
Zobrazit všechny nástroje