Aller au contenu
Klarfile

Les fonctions, et ce qu'elles font vraiment

Chaque fonction est décrite avec sa limite. Quatre familles ici : les documents, qui travaillent sur un plan de pages ; les images, qui se transforment une par une ; les vidéos et leurs sous-titres, dont les flux sont recopiés sans être ré-encodés ; et les archives, dont le contenu se recopie d'une boîte dans une autre.

Un seul plan de travail

« Fusionner », « diviser », « supprimer des pages », « pivoter », « réorganiser » sont cinq façons de dire la même chose : quelles pages, dans quel ordre.

Ici, on dépose ce qu'on veut (des PDF, des photos, des scans, des vidéos), on arrange, on exporte. Une fusion est un plan où l'on a tout gardé ; une découpe, un plan où l'on n'a gardé que trois pages. Chaque page est affichée en vignette avant l'export.

Voir les soixante-dix outils

Images → PDF, et PDF → images

Des images vers un PDF

Déposez vos photos et vos scans : ils deviennent des pages. Plus rien ne les distingue ensuite d'un PDF : on les réordonne, on les fait pivoter, on les intercale entre deux pages d'un contrat, on les numérote.

Chaque image est posée au centre d'une feuille A4 ou Lettre, sans déformation et sans agrandissement forcé ; une petite image reste petite plutôt que de devenir floue. Les formats acceptés sont le JPEG et le PNG, les deux qu'un PDF sait porter tels quels. Les données EXIF de vos photos ne survivent pas : seuls les pixels sont recopiés, pas l'appareil, ni la date, ni les coordonnées GPS.

Convertir des images en PDF

Un PDF vers des images

Chaque page ressort en PNG ou en JPEG, à 72, 150 ou 300 points par pouce. Au-delà d'une page, les fichiers arrivent dans une archive ZIP.

Les images sont rendues à partir du document produit, avec son ordre, ses rotations, sa numérotation et son filigrane, pas des fichiers d'origine.

Une page devenue image est aplatie : plus de texte sélectionnable, plus de champs de formulaire. Ce n'est pas un caviardage : ce qui est dessiné reste lisible à l'œil, donc à un logiciel de reconnaissance de caractères.

Convertir un PDF en images

Numéroter

On vient de fusionner trois PDF, d'en ôter huit pages et d'en réordonner douze : les numéros imprimés sur les originaux ne veulent plus rien dire. La numérotation s'applique donc au document produit, d'un bout à l'autre, quel que soit le nombre de fichiers dont il vient.

  • La forme : « 3 », « - 3 - », « 3/12 », « Page 3 sur 12 ».
  • La position : les neuf points de la page, marge comprise.
  • Le premier numéro, et la première page numérotée : deux réglages distincts, parce qu'une couverture et trois pages de garde ne se numérotent pas, et que la pagination doit quand même commencer à 1 sur la quatrième feuille.
  • L'alternance recto-verso : les numéros passent à l'extérieur, à droite sur les pages impaires, à gauche sur les paires. Sans cela, la moitié des numéros d'un document relié tombe dans la pliure.

Les pages couchées sont traitées comme telles : sur un tableau en paysage, le numéro s'imprime dans le bon sens et au bon endroit.

Ouvrir cet outil

Filigraner

« COPIE », « BROUILLON », « CONFIDENTIEL : Ne pas diffuser ». Un filigrane sert à ce qu'une page photocopiée, photographiée ou imprimée porte encore la mention. Il se pose donc par-dessus le contenu, jamais dessous, et en transparence, pour se voir sans empêcher de lire.

En diagonale au centre, ou répété en mosaïque sur toute la page : le second se recadre beaucoup moins facilement. La taille s'ajuste seule à chaque feuille, y compris en paysage.

Ce n'est pas une protection. Un filigrane est un dessin par-dessus une page ; quelqu'un de déterminé l'enlève. C'est une mention qui suit le document quand il change de main.

Ouvrir cet outil

Ajouter du texte et des images

Une mention, une date, un numéro de pièce, un tampon « REÇU LE », une signature scannée, un logo : posés à la position voulue, sur toutes les pages, la première ou la dernière, avec leur taille, leur inclinaison et leur opacité.

C'est l'immense majorité des « modifier un PDF » réels : compléter un formulaire imprimable, parapher, dater, tamponner, marquer une pièce d'un numéro.

Ce n'est pas un traitement de texte. On ne réécrit pas le contenu d'un PDF, on ne remplace pas un mot dans une phrase, on ne réajuste pas des paragraphes : un PDF est une mise en page figée. Ce qui se fait ici est d'ajouter une couche par-dessus.

Les textes s'écrivent avec les polices standard du PDF, qui couvrent le français et les langues d'Europe de l'Ouest. Un caractère qu'elles ne connaissent pas est signalé pendant la frappe, jamais au moment d'enregistrer.

Ouvrir cet outil

Alléger

Un contrat de vingt pages en texte pèse cent kilo-octets ; le même contrat scanné en pèse quarante fois plus. Ce qui pèse dans un PDF, ce sont les images, stockées en pleine résolution parce que le photocopieur numérise à 600 ppp. Alléger, c'est les redimensionner et les ré-encoder, et rien d'autre.

  • On ne rasterise jamais. Le texte reste du texte, donc sélectionnable et cherchable, et une page reste une page.
  • On ne touche pas aux petites images, logos, en-têtes et signatures : le gain se compterait en octets, la perte se verrait à l'écran.
  • On laisse ce qu'on ne sait pas relire à coup sûr : transparence, CMJN, JPEG 2000, fax. Et le rapport affiché après l'export dit combien d'images ont été laissées, et pourquoi.

Ouvrir cet outil

Nettoyer, ce qui sort, et ce qui ne sort pas

Le document exporté est reconstruit, jamais retouché : on part d'un PDF vide et l'on y recopie les pages voulues.

  • Ce qui est supprimé l'est vraiment. Un PDF modifié « par ajout » conserve ses versions antérieures dans le fichier : la page qu'on croit avoir ôtée est toujours là, sous la nouvelle. C'est ainsi que des documents caviardés ont été « dé-caviardés » après publication. Ici, ce qui n'est pas recopié n'existe pas.
  • Les métadonnées partent : auteur, titre, logiciel producteur (qui porte souvent le nom du poste de travail), et les dates, remplacées par l'époque zéro plutôt que par l'heure à laquelle vous travailliez.
  • Le contenu actif est désamorcé : JavaScript de document, actions à l'ouverture, pièces jointes, formulaires XFA, annotations qui lancent un programme. Les liens ordinaires restent : ils ne se déclenchent que sur un clic.

À l'entrée, on ne croit ni le nom du fichier ni son type déclaré : les deux sont écrits par celui qui l'envoie. Ce sont les octets qui sont lus. Et un PDF protégé par mot de passe demande son mot de passe, il n'est jamais forcé.

Rogner

Un livre scanné à plat porte deux centimètres de gris sur trois côtés ; un ticket photographié flotte au milieu d'une feuille A4. On trace le cadre à garder sur la page, en la regardant. Le cadre est retenu en fractions du format : des pages en A4, en Lettre et en A3 se cadrent pareil.

Rogner cadre, cela n'efface pas. Une page PDF porte une boîte de découpe et les lecteurs n'affichent que ce qu'elle délimite, mais le contenu qui dépasse reste dans le fichier, et n'importe quel éditeur peut rendre la boîte à sa taille d'origine. Si ce qui dépasse doit disparaître pour de bon, c'est caviarder qu'il vous faut.

Rogner un PDF

Signer, et poser un calque

Signer, c'est le même geste qu'ajouter une image : on dépose la photo de sa signature comme un fichier ordinaire, on la pose du doigt à l'endroit voulu, on ajoute la date et la mention. Le document produit est reconstruit page par page : la signature fait partie de la page, ce n'est pas une annotation qu'on décolle. Les données EXIF de la photo ne survivent pas : ni l'appareil, ni la date, ni les coordonnées GPS.

Ce n'est pas une signature électronique au sens du règlement eIDAS. Rien ici ne certifie votre identité, n'horodate le geste ni ne scelle le document par un certificat : c'est l'équivalent d'une signature manuscrite photocopiée. Pour un acte qui exige une signature qualifiée, il faut un prestataire de confiance, qui reçoit votre document.

Superposer pose un PDF sur un autre : un papier à en-tête sur un courrier, un cadre de plan sur quarante feuilles de dessin, un tampon sur une annexe. Le calque s'ajuste au format de chaque page sans se déformer, et son opacité se règle. Il se pose par-dessus, jamais dessous : glisser un fond sous le contenu coûterait à la page son texte sélectionnable, ses liens et ses champs de formulaire.

Signer un PDF Superposer deux PDF

Sortir ce qui est dans le document

Le texte

Tout le texte d'un PDF dans un fichier .txt, avec un repère par page, pour retrouver la page 12. Les pages sans texte sont nommées comme telles plutôt que laissées vides. Sur un dossier scanné, la première ligne dit « aucune des 12 pages ne porte de texte extractible ».

On rend le texte tel que le document le porte : les mots coupés en fin de ligne restent coupés, les colonnes ne sont pas démêlées, les tableaux ne sont pas reconstruits. Une page scannée ne porte aucun texte : rendre le scan cherchable la lit et y pose le texte reconnu, puis l'extraction fonctionne sur le document produit, sans le redéposer.

Le Markdown

Les titres, les paragraphes, les listes, les liens et les tableaux simples d'un PDF, dans un fichier .md. Ici la structure est devinée à partir de la mise en page, et le résultat est montré page par page avant d'être enregistré, avec ce qui a été trouvé, ce qui a été retiré (en-têtes et numéros de page répétés) et les pages qui semblent en colonnes, où l'ordre de lecture est probablement faux.

Les images

Ce sont les images incorporées au document, et non une photo de chaque page, qui est le travail de PDF vers images : les trois photos du constat, le scan du justificatif, le graphique posé dans le rapport. Un JPEG ressort octet pour octet : aucune génération de perte n'est ajoutée à celle qu'avait déjà mise le scanner. Une image posée sur trente pages n'est sortie qu'une fois.

Ce qu'on ne sait pas relire à coup sûr est laissé dans le document : JPEG 2000, fax CCITT, CMJN, palette indexée, et l'écran dit combien d'images et pourquoi.

Extraire le texte PDF en Markdown Extraire les images

Comparer deux versions

Deux versions d'un contrat, d'une offre, d'un mémoire : l'outil dit quels mots ont changé, page par page. Aucune des deux ne quitte votre appareil.

Les pages sont d'abord appariées par leur ressemblance, jamais par leur rang : sans cela, une page de garde ajoutée en tête ferait passer tout le reste du document pour réécrit. Les mots des pages appariées sont ensuite comparés de façon à montrer le plus petit ensemble qui explique le passage d'un texte à l'autre : une virgule ajoutée reste une virgule ajoutée. Le texte inchangé est resserré autour de chaque modification ; ce qui a changé ne l'est jamais.

Le rapport s'enregistre en texte brut, les mots retirés préfixés d'un « - » et les ajoutés d'un « + », la convention de tous les outils de comparaison.

Cet outil compare le texte, et rien d'autre : ni les images, ni la mise en page, ni les couleurs, ni les tableaux en tant que tableaux. Un document scanné ne porte pas de texte extractible : deux scans se compareraient donc comme deux pages vides, et l'écran le dit plutôt que de vous annoncer deux documents identiques.

Comparer deux PDF

Vérifier avant d'envoyer

Inspecter un PDF dit ce que le fichier raconte de lui-même : combien d'enregistrements par ajout y dorment, s'il est du texte ou un scan, quelles polices ne voyagent pas avec lui, quel contenu actif il porte, et s'il est signé électroniquement. Ce dernier point compte parce que tout ce qui sort d'ici est reconstruit : le document produit ne portera plus la signature.

L'empreinte SHA-256 répond à une autre question : le fichier que j'ai reçu est-il celui qui a été publié ? Soixante-quatre caractères le disent. Elle sert aussi à vérifier que deux exports du même plan sont identiques bit pour bit : exportez deux fois, et comparez.

Inspecter un PDF Calculer une empreinte

Les images, la seconde famille

Ce sont les mêmes gestes, sur des fichiers qu'on manipule dix fois plus souvent : alléger une photo pour qu'elle passe par courriel, la redimensionner pour un formulaire qui refuse au-delà de 2 Mo, la recadrer, la convertir parce qu'un site n'accepte que le JPEG. Les services qui font cela demandent eux aussi qu'on téléverse la photo.

Six outils : compresser, redimensionner, rogner, convertir entre JPEG, PNG et WebP, pivoter et filigraner. Tout passe par le décodeur d'images du navigateur : aucune dépendance n'a été ajoutée pour cette famille.

Les données EXIF ne survivent pas. Une photo de téléphone porte le modèle de l'appareil, la date, l'heure et souvent les coordonnées GPS de l'endroit où elle a été prise. Seuls les pixels sont recopiés : ce qui ressort d'ici ne dit plus où vous étiez.

Ce qu'on ne fera pas : agrandir par intelligence artificielle, détourer un arrière-plan, retoucher un visage. Ces trois-là demandent un modèle de plusieurs dizaines de mégaoctets à télécharger depuis un serveur tiers.

Les images RAW d'appareil photo et les HEIC d'iPhone s'ouvrent, et chacun a sa page, qui dit ce qu'il coûte : ouvrir un RAW ressort l'aperçu que le boîtier a écrit, octet pour octet et sans ré-encodage ; convertir un HEIC décode et ré-encode, donc une génération de compression de plus, et son décodeur d'un mégaoctet et demi ne se télécharge qu'au premier HEIC déposé.

Compresser une image Redimensionner une image

Ce qui n'est pas garanti

Le repérage du contenu actif affiché à l'ouverture d'un document se fait sur les octets bruts. Un PDF dont les objets sont compressés (le cas le plus courant) peut cacher un script à ce balayage. Ce signalement prévient, il ne protège pas. La protection, c'est de ne jamais rien exécuter du document et de reconstruire la sortie, ce que fait chaque export.