Klarfile

OCR d'un PDF scanné, sans téléverser le document

Un scan est une image : on ne peut rien y chercher, rien y sélectionner. On lit donc chaque page et l'on pose le texte reconnu PAR-DESSUS, en invisible. La page garde exactement l'aspect qu'elle avait ; ce qui change, c'est qu'on peut enfin y chercher un nom.

Ce que fait cet outil

Ce que ça ne fait pas : Une reconnaissance de caractères se trompe, et elle se trompe en silence : un 1 devient un l, un nom propre perd son accent. Ce n'est donc pas une transcription certifiée, et il ne faut pas s'en servir pour ce qu'on ne relira pas. L'écriture manuscrite n'est pas lue du tout. Les colonnes ne sont pas démêlées et les tableaux ne sont pas reconstruits en tableaux. Les mots qu'une police standard ne sait pas écrire — le grec, le cyrillique, les langues à diacritiques d'Europe centrale — ne sont pas posés du tout plutôt que posés à moitié, et l'écran les compte. Enfin, le moteur et le modèle de langue pèsent quelques mégaoctets, téléchargés depuis ce site à la première lecture puis gardés par le navigateur : la première page est plus longue que les suivantes.

Aucun fichier n'est téléversé. Coupez le réseau une fois cette page chargée : l'outil continue de fonctionner. Comment le vérifier vous-même.

Les autres outils