Confronta file PDF

Due versioni dello stesso PDF — quale contiene le differenze?
Vedi ogni differenza di testo e di aspetto, affiancate.

Trascina qui due PDF da confrontare
Fino a 25 MB per file · Fino a 50 pagine per file

Trascina qui l'originale

Trascina qui la revisione

Informazioni sul confronto di PDF

Come funziona davvero il diff

L'algoritmo ibrido sceglie pagina per pagina. Per ogni coppia di pagine lo strumento estrae il testo tramite l'API getTextContent di pdf.js. Se entrambi i lati producono 50 caratteri o più, la pagina passa per un diff di Myers a livello di token — un classico algoritmo O(ND) che trova lo script di modifica minimo fra due sequenze di token. Sotto i 50 caratteri (tipicamente pagine scansionate o impaginazioni solo grafiche) lo strumento ripiega sul confronto pixel: entrambe le pagine vengono disegnate su canvas in scala 1,0, poi le differenze di pixel per cella oltre una tolleranza vengono contate come regioni modificate. La classificazione (testo modificato, immagine modificata o identica) sta nel risultato di ogni pagina, così il pannello di sintesi può mostrare che tipo di modifica è avvenuta e dove.

Perché l'affiancato batte la sovrapposizione

Il confronto sovrapposto (testo rimosso barrato in rosso, testo aggiunto sottolineato in verde, disegnati su un'unica resa del documento) si legge bene su differenze brevi ma perde presto il contesto su modifiche più lunghe. La resa affiancata mostra entrambe le versioni per intero, con scorrimento sincronizzato così che la stessa area di pagina resti allineata nei due riquadri. Il pannello di sintesi funge da indice di navigazione — salta a pagina 7 per vedere la modifica senza scorrere l'intero documento. Il metodo funziona altrettanto bene per una correzione di due righe e per una revisione di quaranta pagine; la sovrapposizione va bene solo per la prima.

Numero di pagine diverso — cosa succede

Quando i due PDF hanno un numero di pagine diverso, il risultato è classificato come confronto parziale. Le prime N pagine (N è il numero di pagine minore) vengono confrontate normalmente con diff testuale o per immagini. Le pagine in più del lato più lungo sono elencate nel pannello di sintesi come non abbinate, così vedi quali esistono solo in una versione. Il caso più comune è una revisione in cui l'autore ha aggiunto o rimosso pagine tra le versioni — il confronto funziona comunque per le pagine sovrapposte e la sintesi rende esplicito il cambiamento strutturale. Se lo scarto è ampio (un documento lungo il doppio dell'altro), Da PDF a Testo estrae il testo semplice da entrambi per un confronto di solo contenuto, senza vincolo di allineamento delle pagine.

Perché il confronto resta nel browser

I casi d'uso del confronto si concentrano sui documenti in cui la riservatezza conta di più: bozze di contratto inviate dalla controparte, versioni oscurate in attesa di pubblicazione, copie di revisione interna che non devono trapelare. Caricare entrambe le versioni su un server di terzi aggiunge rischio proprio quando non lo vuoi. Confronta file PDF gira interamente nel tuo browser tramite pdf-lib e pdf.js — entrambi i file restano sul tuo dispositivo. I concorrenti lato server (iLovePDF, PDF24) richiedono il caricamento; il confronto di Adobe Acrobat richiede un abbonamento da 14,99 $ al mese. Quello di pdfmundo è gratuito, solo nel browser, senza caricamenti.

Quando il confronto non basta

Se uno dei PDF è protetto da password, il confronto non può leggerne il contenuto — rimuovi prima la password nel tuo software PDF, poi torna qui. Se uno dei PDF è danneggiato (download troncato, bug del firmware dello scanner, danno d'archivio), pdf.js non riesce ad analizzarlo — Ripara PDF potrebbe recuperarlo; la catena è confronta → ripara → riconfronta. Per file oltre il tetto di 50 pagine, o quando conta solo il contenuto testuale, Da PDF a Testo estrae il testo semplice da entrambi i PDF per un diff esterno. I file di cui uno non è affatto un PDF (testo o immagine rinominati in .pdf) vengono rilevati in fase preliminare tramite il controllo dei byte magici %PDF.

Domande frequenti

Che tipi di modifiche riesce a trovare?
Modifiche di testo — aggiunte, rimozioni e cambiamenti rilevati tramite estrazione del testo del PDF e diff di Myers a livello di token. Modifiche visive — ritocchi di immagini, spostamenti di impaginazione o qualsiasi differenza a livello di pixel, rilevate quando l'estrazione di testo restituisce troppo poco per un diff affidabile (meno di 50 caratteri per pagina). L'algoritmo ibrido sceglie automaticamente pagina per pagina: diff testuale dove c'è testo, diff pixel dove non c'è. Il pannello di sintesi classifica ogni pagina, così vedi che tipo di modifica è avvenuta e dove.
Funziona con i PDF scansionati?
Sì, grazie al ripiego sul diff per immagini. L'algoritmo verifica pagina per pagina se l'estrazione del testo è riuscita (50 caratteri o più). Per le pagine scansionate senza testo estraibile passa automaticamente al confronto pixel su canvas. Il ripiego copre anche le impaginazioni ricche di immagini in cui il testo è reso come bitmap incorporate. Il compromesso: il diff per immagini coglie ogni differenza di pixel (utile per verificare gli oscuramenti) ma non distingue le modifiche significative dal rumore, come differenze nella resa dei caratteri. Usa il pannello di sintesi per concentrarti sulle pagine con più modifiche.
E se i due PDF hanno un numero di pagine diverso?
Il risultato è classificato come confronto parziale. Le pagine sovrapposte vengono confrontate normalmente; quelle in più del lato più lungo compaiono nel pannello di sintesi come non abbinate. È il caso più comune nella revisione delle versioni — l'autore ha aggiunto o rimosso pagine tra le versioni. Il confronto funziona comunque per le pagine comuni e la sintesi rende esplicito il cambiamento strutturale. Se la differenza è ampia (un documento molto più lungo dell'altro), <a href='/it/pdf-to-text/'>Da PDF a Testo</a> può servire meglio per un confronto di solo contenuto.
I miei PDF vengono caricati sui vostri server?
No. L'intero confronto avviene nel tuo browser tramite pdf-lib e pdf.js. Entrambi i PDF restano sul tuo dispositivo. Qui conta in modo particolare: la revisione delle versioni riguarda spesso contenuti delicati (contratti, documenti oscurati, estratti finanziari) dove il caricamento su un server di terzi aggiunge rischio proprio quando non lo vuoi. I concorrenti lato server richiedono il caricamento; il confronto di pdfmundo gira solo nel browser, senza caricamenti.
Perché PDF con testo identico risultano diversi?
La codifica del testo nei PDF prevede varianti Unicode per caratteri visivamente identici. Il caso più comune sono le legature: le lettere «ff» codificate come due code point separati (U+0066 + U+0066) contro il singolo glifo di legatura «ff» (U+FB00). Entrambe si vedono uguali sullo schermo ma si confrontano diversamente come sequenze di caratteri. Lo strumento applica la normalizzazione Unicode NFKC al testo estratto prima del diff, il che risolve automaticamente il caso delle legature. Falsi positivi persistenti indicano di solito sottoinsiemi di caratteri diversi tra i due PDF — visivamente identici ma codificati in modo differente. Il pannello di sintesi mostra dove sono le differenze; puoi ispezionare le pagine interessate per verificare.
Posso scaricare un rapporto delle differenze?
Non nella v1. La vista affiancata e il pannello di sintesi coprono il caso d'uso principale della revisione. Un rapporto scaricabile (PDF annotato con le aree evidenziate) è nella roadmap della v1.1. Per ora, screenshot della vista affiancata o del pannello di sintesi coprono la maggior parte delle esigenze di documentazione.
Quali sono i limiti di dimensione e di pagine?
25 MB per file e 50 pagine per file. Il tetto sulle pagine esiste perché la memoria del confronto cresce con il numero di pagine: il diff per immagini disegna entrambe le pagine su canvas a piena risoluzione, il che costa circa 10 MB per coppia di pagine. Il tetto di 50 pagine mantiene la memoria del browser sotto controllo nel caso peggiore, in cui tutte le pagine finiscono nel diff per immagini. La maggior parte delle revisioni rientra in entrambi i limiti; per documenti più lunghi conviene confrontare a blocchi (intervalli di pagine specifici in esecuzioni separate).
E se uno dei miei PDF è danneggiato?
Il confronto si interrompe con un esito «uno danneggiato» e un link diretto a <a href='/it/repair-pdf/'>Ripara PDF</a>. La catena è confronta → ripara → riconfronta: la riparazione recupera quello che può dal PDF danneggiato, poi riporti il file recuperato nel confronto. Se il file riparato ancora non si analizza, <a href='/it/pdf-to-text/'>Da PDF a Testo</a> può estrarre il testo semplice per un confronto esterno come ultima risorsa.

Altri strumenti PDF, in arrivo

29 strumenti in totale — unire, dividere, convertire, OCR, firmare, filigranare e altro. Tutti gratuiti da provare.

Torna alla home →