PDF în Excel
Rapoarte financiare. Seturi de date de cercetare. Arhive publice.
Unele tabele n-ar trebui să îți părăsească dispozitivul. Extrage-le în browser — nu se încarcă nimic.
Se detectează tabelele…
{tableCount} tabel/tabele extrase
Reușit
Tabelele tale au fost extrase. Descarcă mai jos.
{tableCount} tabel/tabele extrase, cu observații
Reușit, cu observații
Extragerea s-a încheiat. Vezi observațiile de mai jos pentru detalii despre nivelurile de încredere și conținutul omis.
Observații despre extragere
Încredere pentru fiecare tabel
Extragerea tabelelor din PDF este statistică. Fiecare tabel detectat primește un nivel de încredere — ridicat (bine aliniat), mediu (oarecare ambiguitate structurală) sau scăzut (ambiguitate semnificativă; se recomandă verificarea).
Despre extragerea tabelelor din PDF-uri
Ce extrage acest instrument
Tabele bine aliniate, tabele fără chenar (algoritmul folosește geometria textului, nu liniile vizibile) și tabele care continuă pe mai multe pagini (când reperele de coloană și antetele se potrivesc de la o pagină la alta). Tabelele detectate apar cu niveluri de încredere — ridicat, mediu sau scăzut — ca să poți judeca fiecare tabel înainte de a-l folosi mai departe.
Când să îl folosești
Rapoarte financiare, seturi de date de cercetare, registre publice colectate, arhive administrative, exporturi interne de date — orice situație în care PDF-ul sursă e suficient de sensibil încât încărcarea într-un convertor terț să fie alegerea greșită, dar suficient de structurat încât rescrierea manuală a tabelelor să fie la fel de greșită.
Perspectiva confidențialității
Din cercetarea noastră, fiecare concurent accesibil pentru conversia PDF→Excel (Smallpdf, iLovePDF, PDFCandy, PDF24, Convertio) procesează conținutul pe serverele proprii sau folosește o formulare ambiguă de „procesare în browser”. Adobe Acrobat pune funcția în spatele unui abonament. Cadranul „doar în browser” rămâne neocupat. PDF în Excel rulează integral pe dispozitivul tău prin pdf.js și SheetJS — rapoartele financiare, seturile de date și materialele de arhivă rămân în browserul tău.
Indicatorii de încredere
Extragerea tabelelor din PDF este statistică, nu deterministă. Acest instrument afișează un nivel de încredere pentru fiecare tabel (ridicat / mediu / scăzut), calculat din alinierea coloanelor, proporția celulelor goale și numărul de rânduri. Niciun concurent accesibil nu afișează un nivel de încredere — toți promit „structură păstrată”, fără să recunoască pierderile inerente unei extrageri bazate pe poziționarea textului. Această transparență este, alături de confidențialitate, al doilea element de diferențiere.
Ce nu tratăm și de ce
PDF-urile scanate au nevoie întâi de OCR — folosește OCR PDF ca să adaugi un strat de text, apoi revino. La PDF-urile criptate trebuie eliminată mai întâi parola, din programul tău PDF. PDF-urile corupte trebuie reparate întâi — vezi Repară PDF. Tabelele cu încredere scăzută sunt semnalate explicit; pentru date critice, revizuirea manuală sau alte instrumente rămân opțiuni valabile.
După extragere
Adaugă o parolă foii extrase înainte de partajare, cu Protejează PDF — astfel exporturile financiare și de cercetare rămân criptate în repaus.
Convertește PDF în Excel fără încărcare — fișierele nu îți părăsesc dispozitivul
Spre deosebire de majoritatea instrumentelor online, conversia PDF-ului tău în Excel se face integral în browser. Fișierul nu este niciodată încărcat pe un server, niciodată stocat și nu îți părăsește dispozitivul — astfel contractele, documentele financiare și alte acte sensibile rămân private.
Întrebări frecvente
- Îmi sunt încărcate fișierele?
- Nu. Nu se încarcă nimic — conversia rulează integral în browserul tău, așa că fișierul nu ajunge niciodată pe un server și nu îți părăsește dispozitivul. Nu îl putem vedea pentru că nu îl primim niciodată.
- Cu ce fel de PDF-uri funcționează cel mai bine?
- Cu PDF-uri text bine aliniate (exporturi din Excel, rapoarte generate, date publice). Tabelele fără chenar funcționează — algoritmul folosește geometria textului, nu liniile vizibile. Paginile cu mai multe tabele produc câte o foaie pentru fiecare tabel. PDF-urile scanate au nevoie întâi de OCR, prin instrumentul OCR PDF.
- De ce arată greșit tabelul meu?
- Extragerea tabelelor din PDF este statistică. Algoritmul grupează elementele de text după poziție ca să deducă rânduri și coloane. Tabelele bine aliniate produc extrageri cu încredere ridicată; cele cu celule îmbinate, conținut pe mai multe rânduri sau aspecte neobișnuite pot da încredere medie ori scăzută, cu avertizări vizibile. Pentru date critice, verifică manual tabelele cu încredere scăzută sau curăță-le în Excel / LibreOffice.
- Pot extrage tabele din PDF-uri scanate?
- Nu. Acest instrument are nevoie de PDF-uri cu text selectabil. Pentru PDF-uri scanate (doar imagine), rulează întâi OCR PDF ca să adaugi un strat de text, apoi revino la PDF în Excel. În v1 nu includem OCR — instrumentul OCR PDF existent acoperă cazul fără costuri suplimentare.
- Pot extrage tabele din PDF-uri protejate cu parolă?
- Nu. v1 refuză decriptarea. Elimină mai întâi parola din programul tău PDF, apoi revino la PDF în Excel. Nu trecem parola ta prin pdfmundo.
- PDF-urile mele sunt încărcate pe serverele voastre?
- Nu. Toată extragerea rulează în browserul tău, prin pdf.js și SheetJS. Rapoartele financiare, seturile de date de cercetare și arhivele publice nu îți părăsesc niciodată dispozitivul. Nu avem servere care să primească acest conținut.
- Să aleg XLSX sau CSV?
- XLSX păstrează structura cu mai multe tabele (câte o foaie pentru fiecare tabel detectat), indiciile de formatare a antetelor și metadatele de încredere. Alege XLSX dacă vei lucra mai departe în Excel / LibreOffice. Alege CSV când alimentezi un flux de date (Pandas, R, Python) care preferă text simplu; rezultatele cu mai multe tabele se împachetează într-o arhivă ZIP.