Comparer des fichiers PDF

Deux versions du même PDF — laquelle contient les différences ?
Voyez chaque différence de texte et de visuel, côte à côte.

Déposez ici deux PDF à comparer
Jusqu'à 25 Mo par fichier · Jusqu'à 50 pages par fichier

Déposez l'original ici

Déposez la révision ici

À propos de la comparaison de PDF

Comment fonctionne réellement le diff

L'algorithme hybride choisit page par page. Pour chaque paire de pages, l'outil extrait le texte via l'API getTextContent de pdf.js. Si les deux côtés produisent 50 caractères ou plus, la page passe par un diff de Myers au niveau des jetons — un algorithme classique en O(ND) qui trouve le script d'édition minimal entre deux séquences de jetons. En dessous de 50 caractères (typiquement des pages numérisées ou des mises en page uniquement graphiques), l'outil bascule sur la comparaison pixel : les deux pages sont rendues sur un canvas à l'échelle 1,0, puis les écarts de pixels par cellule au-delà d'une tolérance sont comptés comme régions modifiées. La classification (texte modifié, image modifiée ou identique) figure dans le résultat de chaque page, pour que le panneau de synthèse montre quel type de changement s'est produit et où.

Pourquoi le côte à côte l'emporte sur la superposition

La comparaison par superposition (texte supprimé barré en rouge, texte ajouté souligné en vert, dessinés sur un seul rendu du document) se lit naturellement sur de courtes différences mais perd vite le contexte sur des changements plus longs. Le rendu côte à côte affiche les deux versions en entier, avec défilement synchronisé pour que la même zone de page reste alignée dans les deux panneaux. Le panneau de synthèse sert d'index de navigation — allez directement à la page 7 pour voir le changement sans faire défiler tout le document. Le procédé fonctionne aussi bien pour une correction de deux lignes que pour une révision de quarante pages ; la superposition ne convient qu'au premier cas.

Nombre de pages différent — ce qui se passe

Quand les deux PDF n'ont pas le même nombre de pages, le résultat est classé comparaison partielle. Les N premières pages (N étant le plus petit nombre de pages) sont comparées normalement par diff texte ou image. Les pages supplémentaires du côté le plus long sont listées dans le panneau de synthèse comme non appariées, pour que vous voyiez lesquelles n'existent que dans une version. Le cas le plus courant est une révision où l'auteur a ajouté ou retiré des pages entre les versions — la comparaison fonctionne toujours pour les pages qui se recouvrent, et la synthèse rend le changement structurel explicite. Si l'écart est important (un document deux fois plus long que l'autre), PDF en Texte extrait le texte brut des deux pour une comparaison de contenu sans contrainte d'alignement des pages.

Pourquoi la comparaison reste dans le navigateur

Les cas d'usage de la comparaison se concentrent sur les documents où la confidentialité compte le plus : projets de contrat envoyés par la partie adverse, versions caviardées en attente de publication, copies de relecture interne qui ne doivent pas fuiter. Envoyer les deux versions à un serveur tiers ajoute du risque précisément au moment où vous n'en voulez pas. Comparer des fichiers PDF s'exécute entièrement dans votre navigateur via pdf-lib et pdf.js — les deux fichiers restent sur votre appareil. Les concurrents côté serveur (iLovePDF, PDF24) exigent un envoi ; la comparaison d'Adobe Acrobat requiert un abonnement à 14,99 $ par mois. Celle de pdfmundo est gratuite, uniquement dans le navigateur, sans aucun envoi.

Quand la comparaison ne suffit pas

Si l'un des PDF est protégé par mot de passe, la comparaison ne peut pas lire le contenu — retirez d'abord le mot de passe dans votre logiciel PDF, puis revenez. Si l'un des PDF est corrompu (téléchargement tronqué, bogue de micrologiciel de scanner, dégât d'archivage), pdf.js ne peut pas l'analyser — Réparer un PDF peut le récupérer ; la chaîne est comparer → réparer → recomparer. Pour les fichiers dépassant le plafond de 50 pages, ou quand seul le contenu textuel compte, PDF en Texte extrait le texte brut des deux PDF pour un diff externe. Les fichiers dont l'un n'est pas du tout un PDF (texte ou image renommé en .pdf) sont détectés en amont via la vérification des octets magiques %PDF.

Questions fréquentes

Quels types de changements l'outil détecte-t-il ?
Les changements de texte — ajouts, suppressions et modifications détectés via l'extraction du texte PDF et un diff de Myers au niveau des jetons. Les changements visuels — modifications d'images, décalages de mise en page ou toute différence au niveau du pixel, détectés quand l'extraction de texte fournit trop peu de matière pour un diff fiable (moins de 50 caractères par page). L'algorithme hybride choisit automatiquement page par page : diff texte là où il y a du texte, diff pixel ailleurs. Le panneau de synthèse classe chaque page pour que vous voyiez quel type de changement s'est produit et où.
Cela fonctionne-t-il pour les PDF numérisés ?
Oui, grâce au repli sur le diff d'image. L'algorithme vérifie page par page si l'extraction de texte a réussi (50 caractères ou plus). Pour les pages numérisées sans texte extractible, il bascule automatiquement sur la comparaison de pixels via canvas. Ce repli couvre aussi les mises en page riches en images où le texte est rendu sous forme de bitmaps intégrés. Le compromis : le diff d'image détecte chaque différence de pixel (utile pour vérifier un caviardage) mais ne distingue pas les changements significatifs du bruit, comme des différences de rendu de police. Utilisez le panneau de synthèse pour vous concentrer sur les pages où les changements sont les plus nombreux.
Et si les deux PDF n'ont pas le même nombre de pages ?
Le résultat est classé comparaison partielle. Les pages qui se recouvrent sont comparées normalement ; les pages supplémentaires du côté le plus long apparaissent dans le panneau de synthèse comme non appariées. C'est le cas le plus courant en relecture de révision — l'auteur a ajouté ou retiré des pages entre les versions. La comparaison fonctionne toujours pour les pages communes, et la synthèse rend le changement structurel explicite. Si l'écart est important (un document bien plus long que l'autre), <a href='/fr/pdf-to-text/'>PDF en Texte</a> conviendra sans doute mieux pour une comparaison de contenu.
Mes PDF sont-ils envoyés sur vos serveurs ?
Non. Toute la comparaison s'exécute dans votre navigateur via pdf-lib et pdf.js. Les deux PDF restent sur votre appareil. Cela compte particulièrement ici : les cas de relecture concernent souvent des contenus sensibles (contrats, documents caviardés, relevés financiers) où l'envoi à un serveur tiers ajoute du risque précisément au moment où vous n'en voulez pas. Les concurrents côté serveur exigent un envoi ; la comparaison de pdfmundo reste dans le navigateur, sans envoi.
Pourquoi des PDF au texte identique sont-ils signalés comme différents ?
L'encodage du texte PDF comporte des variantes Unicode pour des caractères visuellement identiques. Le cas le plus courant : les ligatures. Les lettres « ff » encodées en deux points de code distincts (U+0066 + U+0066) contre le glyphe de ligature unique « ff » (U+FB00). Les deux s'affichent à l'identique mais se comparent différemment en tant que séquences de caractères. L'outil applique une normalisation Unicode NFKC au texte extrait avant le diff, ce qui règle automatiquement le cas des ligatures. Des faux positifs persistants indiquent en général un sous-ensemble de police différent entre les deux PDF — visuellement identiques mais encodés autrement. Le panneau de synthèse montre où sont les différences ; vous pouvez inspecter les pages concernées pour vérifier.
Puis-je télécharger un rapport de différences ?
Pas en v1. La vue côte à côte et le panneau de synthèse couvrent le cas d'usage principal de la relecture. Un rapport téléchargeable (PDF annoté avec zones surlignées) figure à la feuille de route v1.1. Pour l'instant, des captures de la vue côte à côte ou du panneau de synthèse couvrent la plupart des besoins de documentation.
Quelles sont les limites de taille et de nombre de pages ?
25 Mo par fichier et 50 pages par fichier. Le plafond de pages existe parce que la mémoire de comparaison croît avec le nombre de pages : le diff d'image rend les deux pages sur canvas en pleine résolution, ce qui coûte environ 10 Mo par paire de pages. Le plafond de 50 pages contient la mémoire du navigateur dans le pire cas où toutes les pages basculent sur le diff d'image. La plupart des relectures de révision tiennent dans ces deux limites ; les documents plus longs gagnent à être comparés par tranches (des plages de pages précises, en plusieurs passes).
Et si l'un de mes PDF est corrompu ?
La comparaison s'arrête avec un résultat « un fichier corrompu » et un lien direct vers <a href='/fr/repair-pdf/'>Réparer un PDF</a>. La chaîne est comparer → réparer → recomparer : la réparation récupère ce qu'elle peut du PDF endommagé, puis vous ramenez le fichier récupéré dans la comparaison. Si le fichier réparé ne s'analyse toujours pas, <a href='/fr/pdf-to-text/'>PDF en Texte</a> peut extraire le texte brut pour une comparaison externe en dernier recours.

D'autres outils PDF, bientôt disponibles

29 outils au total — fusionner, diviser, convertir, OCR, signer, filigraner et plus encore. Tous gratuits à essayer.

Retour à l'accueil →