Compară fișiere PDF
Două versiuni ale aceluiași PDF — care are diferențele?
Vezi fiecare diferență de text și de aspect, una lângă alta.
Trage aici originalul
Trage aici revizia
Fișierele sunt identice
Scăzut — nicio diferență
Ambele PDF-uri au produs același text și același rezultat vizual pe toate paginile comparate. Nicio diferență detectată.
{count} diferențe găsite
Mediu — diferențe detectate
Cele două PDF-uri au fost comparate pagină cu pagină. Panoul de sinteză de mai jos listează paginile modificate; vizualizarea alăturată arată fiecare modificare în context.
Comparare parțială
Ridicat — număr diferit de pagini
Cele două PDF-uri au un număr diferit de pagini ({a} față de {b}). Paginile comune au fost comparate normal; paginile nepereche sunt listate în panoul de sinteză.
Despre compararea PDF-urilor
Cum funcționează de fapt compararea
Algoritmul hibrid alege pentru fiecare pagină. Pentru fiecare pereche de pagini, instrumentul extrage textul prin API-ul getTextContent din pdf.js. Dacă ambele părți produc 50 de caractere sau mai mult, pagina trece printr-o comparare Myers la nivel de tokenuri — un algoritm clasic O(ND) care găsește scriptul minim de modificări între două secvențe de tokenuri. Sub 50 de caractere (de obicei pagini scanate sau aspecte formate doar din imagini), instrumentul trece la compararea pixelilor: ambele pagini sunt randate pe canvas la scara 1,0, apoi diferențele de pixeli pe celulă peste o toleranță sunt numărate ca zone modificate. Clasificarea (text modificat, imagine modificată sau identic) se află în rezultatul fiecărei pagini, ca panoul de sinteză să poată arăta ce fel de modificare a apărut și unde.
De ce alăturat bate suprapunerea
Compararea prin suprapunere (text șters tăiat cu roșu, text adăugat subliniat cu verde, desenate peste o singură randare a documentului) se citește firesc la diferențe scurte, dar pierde repede contextul la modificări mai lungi. Randarea alăturată arată ambele versiuni în întregime, cu derulare sincronizată, astfel încât aceeași zonă de pagină rămâne aliniată în cele două panouri. Panoul de sinteză servește drept index de navigare — sari la pagina 7 ca să vezi modificarea de acolo, fără să derulezi tot documentul. Metoda funcționează la fel de bine pentru o corectură de două rânduri și pentru o revizie de patruzeci de pagini; suprapunerea merge doar în primul caz.
Număr diferit de pagini — ce se întâmplă
Când cele două PDF-uri au un număr diferit de pagini, rezultatul este clasificat drept comparare parțială. Primele N pagini (N fiind numărul mai mic de pagini) sunt comparate normal, prin text sau imagine. Paginile în plus din partea mai lungă sunt listate în panoul de sinteză ca nepereche, ca să vezi care există doar într-o versiune. Cel mai frecvent caz este o revizie în care autorul a adăugat sau a eliminat pagini între versiuni — compararea funcționează în continuare pentru paginile comune, iar sinteza face explicită schimbarea structurală. Dacă numerele diferă mult (un document de două ori mai lung), PDF în text extrage textul simplu din ambele pentru o comparare doar de conținut, fără constrângerea alinierii paginilor.
De ce compararea rămâne în browser
Cazurile de utilizare ale comparării se concentrează pe documentele unde confidențialitatea contează cel mai mult: proiecte de contract trimise de partea adversă, versiuni redactate care așteaptă publicarea, exemplare de revizuire internă care nu trebuie să scape. Încărcarea ambelor versiuni pe un server terț adaugă risc exact atunci când nu ți-l dorești. Compară fișiere PDF rulează integral în browserul tău, prin pdf-lib și pdf.js — ambele fișiere rămân pe dispozitivul tău. Concurenții de pe server (iLovePDF, PDF24) cer încărcarea; compararea din Adobe Acrobat cere un abonament de 14,99 $ pe lună. Compararea din pdfmundo este gratuită, doar în browser, fără încărcare.
Când compararea nu e suficientă
Dacă unul dintre PDF-uri este protejat cu parolă, compararea nu îi poate citi conținutul — elimină mai întâi parola din programul tău PDF, apoi revino. Dacă unul dintre PDF-uri este corupt (descărcare trunchiată, eroare de firmware al scanerului, deteriorare de arhivă), pdf.js nu îl poate analiza — Repară PDF l-ar putea recupera; lanțul este compară → repară → compară din nou. Pentru fișiere care depășesc plafonul de 50 de pagini sau când contează doar conținutul textual, PDF în text extrage textul simplu din ambele PDF-uri pentru o comparare externă. Fișierele în care una dintre părți nu este deloc un PDF (text sau imagine redenumite în .pdf) sunt detectate din start prin verificarea octeților magici %PDF.
Întrebări frecvente
- Ce fel de modificări poate găsi?
- Modificări de text — adăugiri, ștergeri și schimbări detectate prin extragerea textului din PDF și comparare Myers la nivel de tokenuri. Modificări vizuale — modificări de imagini, deplasări de aspect sau orice diferență la nivel de pixel, detectate când extragerea textului oferă prea puțin material pentru o comparare de încredere (sub 50 de caractere pe pagină). Algoritmul hibrid alege automat pentru fiecare pagină: comparare de text acolo unde există text, comparare de pixeli acolo unde nu există. Panoul de sinteză clasifică fiecare pagină, ca să vezi ce fel de modificare a apărut și unde.
- Funcționează pentru PDF-uri scanate?
- Da, prin trecerea la compararea de imagini. Algoritmul verifică pentru fiecare pagină dacă extragerea textului a reușit (50 de caractere sau mai mult). Pentru paginile scanate fără text extractibil, trece automat la compararea pixelilor pe canvas. Această variantă acoperă și aspectele pline de imagini, în care textul este randat ca bitmap încorporat. Compromisul: compararea de imagini prinde fiecare diferență de pixel (utilă la verificarea redactărilor), dar nu deosebește modificările importante de zgomot, cum ar fi diferențele de randare a fonturilor. Folosește panoul de sinteză ca să te concentrezi pe paginile cu cele mai multe modificări.
- Ce se întâmplă dacă cele două PDF-uri au un număr diferit de pagini?
- Rezultatul este clasificat drept comparare parțială. Paginile comune sunt comparate normal; cele în plus din partea mai lungă apar în panoul de sinteză ca nepereche. Este cel mai frecvent caz la revizuirea versiunilor — autorul a adăugat sau a eliminat pagini între versiuni. Compararea funcționează în continuare pentru paginile comune, iar sinteza face explicită schimbarea structurală. Dacă diferența este mare (un document mult mai lung decât celălalt), <a href='/ro/pdf-to-text/'>PDF în text</a> poate fi mai potrivit pentru o comparare doar de conținut.
- PDF-urile mele sunt încărcate pe serverele voastre?
- Nu. Toată compararea rulează în browserul tău, prin pdf-lib și pdf.js. Ambele PDF-uri rămân pe dispozitivul tău. Aici contează în mod special: revizuirea versiunilor implică adesea conținut sensibil (contracte, documente redactate, situații financiare), unde încărcarea pe un server terț adaugă risc exact atunci când nu ți-l dorești. Concurenții de pe server cer încărcarea; compararea din pdfmundo rulează doar în browser, fără încărcare.
- De ce sunt semnalate ca diferite PDF-uri cu text identic?
- Codificarea textului în PDF are variante Unicode pentru caractere identice vizual. Cel mai frecvent caz: ligaturile. Literele „ff” codificate ca două puncte de cod separate (U+0066 + U+0066) față de glifa unică de ligatură „ff” (U+FB00). Ambele se afișează identic pe ecran, dar se compară diferit ca secvențe de caractere. Instrumentul aplică normalizarea Unicode NFKC textului extras înainte de comparare, ceea ce rezolvă automat cazul ligaturilor. Falsele pozitive persistente indică de obicei subseturi de fonturi diferite între cele două PDF-uri — identice vizual, dar codificate altfel. Panoul de sinteză arată unde sunt diferențele; poți inspecta paginile respective ca să verifici.
- Pot descărca un raport al diferențelor?
- Nu în v1. Vizualizarea alăturată și panoul de sinteză acoperă principalul caz de utilizare la revizuire. Un raport descărcabil (PDF adnotat, cu zonele evidențiate) este pe foaia de parcurs pentru v1.1. Deocamdată, capturile de ecran ale vizualizării alăturate sau ale panoului de sinteză acoperă majoritatea nevoilor de documentare.
- Care sunt limitele de dimensiune și de număr de pagini?
- 25 MB per fișier și 50 de pagini per fișier. Plafonul de pagini există pentru că memoria necesară comparării crește odată cu numărul de pagini: compararea de imagini randează ambele pagini pe canvas la rezoluție completă, ceea ce costă circa 10 MB per pereche de pagini. Plafonul de 50 de pagini menține memoria browserului sub control în cazul cel mai defavorabil, când toate paginile ajung la compararea de imagini. Majoritatea revizuirilor se încadrează în ambele limite; documentele mai lungi se compară de obicei mai bine pe bucăți (intervale de pagini anume, în rulări separate).
- Ce fac dacă unul dintre PDF-urile mele este corupt?
- Compararea se oprește cu un rezultat de tip „unul corupt” și un link direct către <a href='/ro/repair-pdf/'>Repară PDF</a>. Lanțul este compară → repară → compară din nou: repararea recuperează ce se poate din PDF-ul deteriorat, apoi aduci fișierul recuperat înapoi la comparare. Dacă fișierul reparat tot nu poate fi analizat, <a href='/ro/pdf-to-text/'>PDF în text</a> poate extrage textul simplu pentru o comparare externă, ca ultimă soluție.
Mai multe instrumente PDF, în curând
29 de instrumente în total — unire, împărțire, conversie, OCR, semnare, filigran și altele. Toate gratuite de încercat.
Înapoi la pagina principală →