Porovnat soubory PDF

Dvě verze téhož PDF — v čem se liší?
Uvidíte každý textový i vizuální rozdíl vedle sebe.

Přetáhněte sem dvě PDF k porovnání
Až 25 MB na soubor · Až 50 stránek na soubor

Sem přetáhněte originál

Sem přetáhněte revizi

O porovnávání PDF

Jak porovnání ve skutečnosti funguje

Hybridní algoritmus se rozhoduje pro každou stránku zvlášť. Pro každý pár stránek nástroj získá text přes API getTextContent v pdf.js. Pokud obě strany dají 50 a více znaků, stránka projde Myersovým porovnáním na úrovni tokenů — klasickým algoritmem O(ND), který najde nejkratší sled úprav mezi dvěma posloupnostmi tokenů. Pod 50 znaků (typicky naskenované stránky nebo čistě obrázkové sazby) nástroj přejde na pixelové porovnání: obě stránky se vykreslí na plátno v měřítku 1,0 a rozdíly pixelů v buňkách nad tolerancí se počítají jako změněné oblasti. Zařazení (změněný text, změněný obrázek, nebo shodné) je součástí výsledku každé stránky, takže souhrnný panel může ukázat, jaký druh změny kde nastal.

Proč je zobrazení vedle sebe lepší než překryv

Překryvné porovnání (odebraný text červeně přeškrtnutý, přidaný zeleně podtržený, vykreslené do jediného zobrazení dokumentu) se u krátkých rozdílů čte přirozeně, u delších změn ale rychle ztrácí souvislosti. Zobrazení vedle sebe ukazuje obě verze celé, se synchronním posuvem, takže stejná část stránky zůstává v obou panelech zarovnaná. Souhrnný panel slouží jako navigační rejstřík — skočte na stránku 7 a uvidíte tamní změnu, aniž byste procházeli celý dokument. Postup funguje stejně dobře u dvouřádkové opravy i u čtyřicetistránkové revize; překryv jen u toho prvního.

Rozdílný počet stránek — co se stane

Když mají obě PDF různý počet stránek, výsledek se označí jako částečné porovnání. Prvních N stránek (N je menší z počtů) se porovná běžně textově nebo obrazově. Přebývající stránky delší verze se v souhrnném panelu vypíšou jako nespárované, takže vidíte, které stránky existují jen v jedné verzi. Nejčastější případ je revize, v níž autor mezi verzemi stránky přidal nebo odebral — porovnání pro překrývající se stránky funguje dál a souhrn strukturální změnu jasně ukáže. Pokud se počty liší výrazně (jeden dokument dvakrát delší), PDF do textu získá z obou prostý text pro porovnání jen obsahu, bez nutnosti zarovnávat stránky.

Proč porovnání běží jen v prohlížeči

Případy použití porovnání se soustředí právě na dokumenty, u nichž na soukromí záleží nejvíc: návrhy smluv od protistrany, začerněné verze čekající na zveřejnění, interní kontrolní výtisky, které nemají uniknout. Nahrát obě verze na cizí server přidává riziko přesně ve chvíli, kdy o něj nestojíte. Porovnání souborů PDF běží výhradně ve vašem prohlížeči přes pdf-lib a pdf.js — oba soubory zůstávají ve vašem zařízení. Serveroví konkurenti (iLovePDF, PDF24) vyžadují nahrání; porovnání v Adobe Acrobatu vyžaduje předplatné za 14,99 $ měsíčně. Porovnání v pdfmundo je zdarma, jen v prohlížeči a bez nahrávání.

Kdy porovnání nestačí

Je-li některé PDF chráněné heslem, porovnání jeho obsah nepřečte — nejprve heslo odstraňte ve svém programu pro PDF a pak se vraťte. Je-li některé PDF poškozené (useknuté stahování, chyba firmwaru skeneru, archivní poškození), pdf.js ho nepřečte — Opravit PDF ho může zachránit; řetěz zní porovnat → opravit → porovnat znovu. U souborů nad limit 50 stránek, nebo když jde jen o textový obsah, získá PDF do textu z obou PDF prostý text pro externí porovnání. Soubory, z nichž jeden vůbec není PDF (text nebo obrázek přejmenovaný na .pdf), se odhalí předem kontrolou magických bajtů %PDF.

Časté dotazy

Jaké druhy změn nástroj najde?
Textové změny — doplnění, vypuštění a úpravy zjištěné pomocí extrakce textu z PDF a Myersova porovnání na úrovni tokenů. Vizuální změny — úpravy obrázků, posuny sazby nebo jakýkoli rozdíl na úrovni pixelů, zjištěné tehdy, když extrakce textu poskytne pro spolehlivé porovnání příliš málo (pod 50 znaků na stránku). Hybridní algoritmus volí automaticky pro každou stránku: textové porovnání tam, kde je text, pixelové tam, kde není. Souhrnný panel každou stránku zařadí, takže vidíte, jaký druh změny kde nastal.
Funguje to u naskenovaných PDF?
Ano, díky přechodu na obrazové porovnání. Algoritmus u každé stránky ověří, zda extrakce textu uspěla (50 a více znaků). U naskenovaných stránek bez čitelného textu automaticky přejde na pixelové porovnání na plátně. Tím se pokryjí i sazby plné obrázků, kde je text vložený jako bitmapa. Kompromis: obrazové porovnání zachytí každý rozdíl pixelů (hodí se při ověřování začernění), ale nerozliší podstatné změny od šumu, například rozdílného vykreslení písma. Souhrnný panel využijte k tomu, abyste se zaměřili na stránky s nejvíce změnami.
Co když mají obě PDF různý počet stránek?
Výsledek se označí jako částečné porovnání. Překrývající se stránky se porovnají běžně; přebývající stránky delší verze se v souhrnném panelu objeví jako nespárované. To je nejčastější případ při kontrole revizí — autor mezi verzemi stránky přidal nebo odebral. Porovnání pro společné stránky funguje dál a souhrn strukturální změnu jasně ukáže. Je-li rozdíl velký (jeden dokument mnohem delší), poslouží pro porovnání jen obsahu možná lépe <a href='/cs/pdf-to-text/'>PDF do textu</a>.
Nahrávají se moje PDF na vaše servery?
Ne. Celé porovnání běží ve vašem prohlížeči přes pdf-lib a pdf.js. Obě PDF zůstávají ve vašem zařízení. Právě zde na tom záleží: kontrola revizí se často týká citlivého obsahu (smlouvy, začerněné dokumenty, finanční výkazy), kde nahrání na cizí server přidává riziko přesně ve chvíli, kdy o něj nestojíte. Serveroví konkurenti nahrání vyžadují; porovnání v pdfmundo běží jen v prohlížeči, bez nahrávání.
Proč jsou PDF se shodným textem někdy označena jako odlišná?
Kódování textu v PDF zná varianty Unicode pro vizuálně shodné znaky. Nejčastější případ jsou ligatury: písmena „ff“ zapsaná jako dva samostatné kódové body (U+0066 + U+0066) oproti jedinému znaku ligatury „ff“ (U+FB00). Na obrazovce vypadají stejně, jako posloupnosti znaků se ale liší. Nástroj před porovnáním použije na získaný text normalizaci Unicode NFKC, což případ ligatur automaticky vyřeší. Přetrvávající falešné poplachy obvykle znamenají odlišné podmnožiny písem v obou PDF — vizuálně shodné, ale jinak zakódované. Souhrnný panel ukáže, kde rozdíly jsou; příslušné stránky si můžete prohlédnout a ověřit.
Můžu si stáhnout zprávu o rozdílech?
Ve verzi 1 ne. Zobrazení vedle sebe a souhrnný panel pokrývají hlavní scénář kontroly. Stažitelná zpráva o rozdílech (PDF se zvýrazněnými oblastmi) je v plánu pro verzi 1.1. Zatím většině dokumentačních potřeb vyhoví snímky obrazovky zobrazení vedle sebe nebo souhrnného panelu.
Jaký je maximální počet stránek a velikost souboru?
25 MB na soubor a 50 stránek na soubor. Limit stránek existuje proto, že spotřeba paměti roste s počtem stránek: obrazové porovnání vykreslí obě stránky na plátno v plném rozlišení, což stojí zhruba 10 MB na dvojici stránek. Limit 50 stránek drží paměť prohlížeče v mezích i v nejhorším případě, kdy všechny stránky spadnou do obrazového porovnání. Většina kontrol revizí se do obou limitů vejde; u delších dokumentů se vyplatí porovnávat po částech (konkrétní rozsahy stránek v samostatných průchodech).
Co když je jedno z mých PDF poškozené?
Porovnání skončí s výsledkem „jedno poškozené“ a přímým odkazem na <a href='/cs/repair-pdf/'>Opravit PDF</a>. Řetěz zní porovnat → opravit → porovnat znovu: oprava zachrání z poškozeného PDF, co půjde, a vy pak obnovený soubor přinesete zpět do porovnání. Pokud se opravený soubor stále nepodaří přečíst, může <a href='/cs/pdf-to-text/'>PDF do textu</a> jako poslední možnost získat prostý text pro externí porovnání.

Další nástroje pro PDF už brzy

Celkem 29 nástrojů — slučování, dělení, převody, OCR, podpis, vodoznak a další. Všechny zdarma k vyzkoušení.

Zpět na úvodní stránku →