PDF na Excel

Raporty finansowe. Zbiory danych badawczych. Archiwa urzędowe.
Niektóre tabele nie powinny opuszczać Twojego urządzenia. Wyodrębnij je w przeglądarce — nic nie jest wysyłane.

Upuść tutaj PDF, aby wyodrębnić tabele
Maks 25 MB na plik

O wyodrębnianiu tabel z PDF-ów

Co wyodrębnia to narzędzie

Dobrze wyrównane tabele, tabele bez obramowań (algorytm korzysta z geometrii tekstu, a nie z widocznych linii) oraz tabele ciągnące się przez kilka stron (gdy kotwice kolumn i nagłówki zgadzają się między stronami). Wykryte tabele pojawiają się z poziomem pewności — wysokim, średnim albo niskim — dzięki czemu przed dalszym użyciem możesz ocenić każdą z nich.

Kiedy z niego korzystać

Raporty finansowe, zbiory danych badawczych, zebrane rejestry publiczne, archiwa urzędowe, wewnętrzne eksporty danych — wszystko, gdzie źródłowy PDF jest na tyle wrażliwy, że wysyłanie go do zewnętrznego konwertera byłoby złym pomysłem, ale zarazem na tyle uporządkowany, że ręczne przepisywanie tabel również byłoby złym pomysłem.

Kwestia prywatności

Z naszego rozeznania wynika, że każdy dostępny konkurent w konwersji PDF→Excel (Smallpdf, iLovePDF, PDFCandy, PDF24, Convertio) przetwarza treść na swoich serwerach albo posługuje się niejednoznacznym hasłem „w przeglądarce”. Adobe Acrobat zamyka tę funkcję za abonamentem. Obszar „wyłącznie w przeglądarce” pozostaje niezajęty. PDF na Excel działa w całości na Twoim urządzeniu dzięki pdf.js i SheetJS — Twoje raporty finansowe, zbiory danych i materiały archiwalne zostają w przeglądarce.

Sygnały pewności

Wyodrębnianie tabel z PDF-a jest statystyczne, a nie deterministyczne. To narzędzie podaje dla każdej tabeli poziom pewności (wysoki / średni / niski), oparty na wyrównaniu kolumn, udziale pustych komórek i liczbie wierszy. Żaden dostępny konkurent nie podaje pewności — wszyscy obiecują „zachowaną strukturę”, nie przyznając, że wyodrębnianie na podstawie położenia tekstu jest z natury stratne. Ta przejrzystość to, obok prywatności, drugi wyróżnik.

Czego nie obsługujemy i dlaczego

Zeskanowane PDF-y wymagają najpierw OCR — użyj OCR PDF, aby dodać warstwę tekstową, a potem wróć. Przy zaszyfrowanych PDF-ach najpierw usuń hasło w swoim programie do PDF. Uszkodzone PDF-y trzeba najpierw naprawić — służy do tego Napraw PDF. Tabele o niskiej pewności są wyraźnie oznaczane; przy krytycznych danych ręczna korekta albo inne narzędzia pozostają dobrą opcją.

Po wyodrębnieniu

Zabezpiecz wyodrębniony arkusz hasłem przed udostępnieniem przez Zabezpiecz PDF — dzięki temu eksporty finansowe i badawcze pozostają zaszyfrowane w spoczynku.

Konwertuj PDF na Excel bez wysyłania — Twoje pliki nie opuszczają urządzenia

W odróżnieniu od większości narzędzi online konwersja PDF-a na Excel odbywa się w całości w Twojej przeglądarce. Plik nigdy nie jest wysyłany na serwer, nigdy przechowywany i nigdy nie opuszcza urządzenia — umowy, dokumenty finansowe i inne wrażliwe materiały pozostają prywatne.

Najczęstsze pytania

Czy moje pliki są wysyłane?
Nie. Nic nie jest wysyłane — konwersja działa w całości w Twojej przeglądarce, więc plik nigdy nie trafia na serwer i nie opuszcza urządzenia. Nie widzimy go, bo nigdy go nie otrzymujemy.
Jakie PDF-y sprawdzają się najlepiej?
Dobrze wyrównane PDF-y tekstowe (eksporty z Excela, generowane raporty, dane urzędowe). Tabele bez obramowań działają — algorytm korzysta z geometrii tekstu, a nie z widocznych linii. Strony z wieloma tabelami dają jeden arkusz na tabelę. Zeskanowane PDF-y wymagają najpierw OCR przy użyciu narzędzia OCR PDF.
Dlaczego moja tabela wygląda źle?
Wyodrębnianie tabel z PDF-a jest statystyczne. Algorytm grupuje fragmenty tekstu według położenia, aby wywnioskować wiersze i kolumny. Dobrze wyrównane tabele dają wyniki o wysokiej pewności; tabele ze scalonymi komórkami, treścią w wielu wierszach albo nietypowym układem mogą dać średnią lub niską pewność wraz z widoczną uwagą. Przy krytycznych danych przejrzyj tabele o niskiej pewności ręcznie albo popraw je w Excelu lub LibreOffice.
Czy mogę wyodrębnić tabele z zeskanowanych PDF-ów?
Nie. To narzędzie wymaga PDF-ów z zaznaczalnym tekstem. Przy zeskanowanych PDF-ach (samych obrazach) najpierw uruchom OCR PDF, aby dodać warstwę tekstową, a potem wróć do PDF na Excel. W wersji 1 nie dołączamy OCR — istniejące narzędzie OCR PDF pokrywa ten przypadek bez dodatkowego kosztu.
Czy mogę wyodrębnić tabele z PDF-ów chronionych hasłem?
Nie. Wersja 1 nie odszyfrowuje plików. Najpierw usuń hasło w swoim programie do PDF, a potem wróć do PDF na Excel. Nie przepuszczamy Twojego hasła przez pdfmundo.
Czy moje pliki PDF trafiają na wasze serwery?
Nie. Całe wyodrębnianie działa w Twojej przeglądarce dzięki pdf.js i SheetJS. Raporty finansowe, zbiory danych badawczych i materiały archiwalne nigdy nie opuszczają urządzenia. Nie mamy serwerów, które przyjmowałyby tę treść.
Wybrać XLSX czy CSV?
XLSX zachowuje strukturę wielu tabel (jeden arkusz na wykrytą tabelę), wskazówki dotyczące formatowania nagłówków oraz metadane pewności. Wybierz XLSX, jeśli będziesz pracować dalej w Excelu lub LibreOffice. Wybierz CSV, gdy zasilasz potok danych (Pandas, R, Python), który woli płaski tekst; przy wielu tabelach wynik pakowany jest do archiwum ZIP.

Wyodrębnij z innego PDF-a

Albo poznaj resztę katalogu.

Powrót na stronę główną →