PDF do Excelu

Finanční zprávy. Výzkumné datové sady. Úřední archivy.
Některé tabulky by vaše zařízení opustit neměly. Získejte je v prohlížeči — nic se nenahrává.

Přetáhněte sem PDF pro získání tabulek
Max 25 MB na soubor

O získávání tabulek z PDF

Co tento nástroj získává

Dobře zarovnané tabulky, tabulky bez orámování (algoritmus vychází z geometrie textu, ne z viditelných linek) a tabulky pokračující přes více stránek (když si kotvy sloupců a záhlaví na stránkách odpovídají). Nalezené tabulky se zobrazí s úrovní spolehlivosti — vysokou, střední nebo nízkou —, abyste každou před dalším použitím posoudili.

Kdy ho použít

Finanční zprávy, výzkumné datové sady, posbírané veřejné rejstříky, úřední archivy, interní exporty dat — všude tam, kde je zdrojové PDF natolik citlivé, že nahrání do cizího převodníku je špatná volba, ale zároveň natolik strukturované, že ruční přepisování tabulek je také špatná volba.

Pohled na soukromí

Podle našeho průzkumu zpracovává každý dostupný konkurent pro převod PDF→Excel (Smallpdf, iLovePDF, PDFCandy, PDF24, Convertio) obsah na svých serverech, nebo používá nejednoznačné tvrzení o „práci v prohlížeči“. Adobe Acrobat funkci schovává za předplatné. Kvadrant „jen v prohlížeči“ tak zůstává neobsazený. PDF do Excelu běží výhradně na vašem zařízení přes pdf.js a SheetJS — vaše finanční zprávy, datové sady i archivní materiály zůstávají ve vašem prohlížeči.

Ukazatele spolehlivosti

Získávání tabulek z PDF je statistické, ne deterministické. Tento nástroj uvádí u každé tabulky úroveň spolehlivosti (vysoká / střední / nízká), odvozenou ze zarovnání sloupců, podílu prázdných buněk a počtu řádků. Žádný dostupný konkurent spolehlivost neuvádí — všichni slibují „zachovanou strukturu“, aniž by přiznali ztrátovost, která je extrakci podle polohy textu vlastní. Tato otevřenost je vedle soukromí druhým odlišujícím prvkem.

Co nezvládáme a proč

Naskenovaná PDF potřebují nejprve OCR — použijte OCR PDF a doplňte textovou vrstvu, pak se vraťte. U zašifrovaných PDF je nutné nejprve odstranit heslo ve vašem programu pro PDF. Poškozená PDF je třeba nejdřív opravit — k tomu slouží Opravit PDF. Tabulky s nízkou spolehlivostí označujeme výslovně; u kritických dat zůstává možností ruční úprava nebo jiné nástroje.

Po extrakci

Než získanou tabulku budete sdílet, přidejte jí heslo pomocí Zabezpečit PDF — finanční i výzkumné exporty tak zůstanou uložené zašifrované.

Převádějte PDF do Excelu bez nahrávání — vaše soubory neopustí zařízení

Na rozdíl od většiny online nástrojů probíhá převod vašeho PDF do Excelu výhradně ve vašem prohlížeči. Soubor se nikdy nenahrává na server, nikdy neukládá a nikdy neopustí vaše zařízení — smlouvy, finanční doklady i další citlivé dokumenty tak zůstávají soukromé.

Časté dotazy

Nahrávají se moje soubory?
Ne. Nic se nenahrává — převod běží výhradně ve vašem prohlížeči, takže váš soubor nikdy nedorazí na server a neopustí vaše zařízení. Nevidíme ho, protože ho nikdy nedostaneme.
S jakými PDF to funguje nejlépe?
S dobře zarovnanými textovými PDF (exporty z Excelu, generované zprávy, úřední data). Tabulky bez orámování fungují — algoritmus vychází z geometrie textu, ne z viditelných linek. Stránky s více tabulkami dají jeden list na tabulku. Naskenovaná PDF potřebují nejprve OCR přes nástroj OCR PDF.
Proč moje tabulka vypadá špatně?
Získávání tabulek z PDF je statistické. Algoritmus seskupuje textové položky podle polohy a z toho odvozuje řádky a sloupce. Dobře zarovnané tabulky dají výsledky s vysokou spolehlivostí; tabulky se sloučenými buňkami, víceřádkovým obsahem nebo neobvyklou sazbou mohou skončit se střední či nízkou spolehlivostí a viditelným upozorněním. U kritických dat tabulky s nízkou spolehlivostí zkontrolujte ručně nebo je upravte v Excelu či LibreOffice.
Můžu získat tabulky z naskenovaných PDF?
Ne. Tento nástroj vyžaduje PDF s vybíratelným textem. U naskenovaných (čistě obrázkových) PDF nejprve spusťte OCR PDF a doplňte textovou vrstvu, pak se vraťte k PDF do Excelu. Ve verzi 1 OCR nepřibalujeme — stávající nástroj OCR PDF tento případ pokrývá bez dalších nákladů.
Můžu získat tabulky z PDF chráněných heslem?
Ne. Verze 1 dešifrování odmítá. Nejprve heslo odstraňte ve svém programu pro PDF a pak se vraťte k PDF do Excelu. Vaše heslo přes pdfmundo neposíláme.
Nahrávají se moje PDF na vaše servery?
Ne. Celá extrakce běží ve vašem prohlížeči přes pdf.js a SheetJS. Finanční zprávy, výzkumné datové sady ani úřední archivy nikdy neopustí vaše zařízení. Nemáme servery, které by obsah přijímaly.
Mám zvolit XLSX, nebo CSV?
XLSX zachová strukturu více tabulek (jeden list na nalezenou tabulku), náznaky formátování záhlaví i metadata o spolehlivosti. XLSX zvolte, budete-li dál pracovat v Excelu či LibreOffice. CSV zvolte, když plníte datovou pipeline (Pandas, R, Python), která má radši prostý text; při více tabulkách se výstup zabalí do archivu ZIP.

Zpracovat další PDF

Nebo prozkoumejte zbytek katalogu.

Zpět na úvodní stránku →