Outils

OCR - rendre un PDF interrogeable

Une numérisation est une image : rien à rechercher, à sélectionner ou à copier. L'OCR lit les mots et pose une couche de texte invisible sur la page, mot par mot là où chacun a été imprimé, pour qu'une recherche surligne le bon endroit et qu'une sélection suive la ligne. La reconnaissance se fait dans votre navigateur avec Tesseract, en trente-quatre langues, et l'image numérisée reste exactement telle qu'elle était.

Déposez vos fichiers PDF ici

Faites-les glisser directement depuis votre bureau

ou
  • Fichiers PDF uniquement
  • Jusqu'à 15 Mo chacun
  • 2 fichiers par traitement - illimité avec Pro

Questions fréquentes

L'OCR change-t-il l'aspect de la numérisation ?

Non. L'image numérisée reste octet pour octet telle qu'elle était ; ce qui est ajouté est une couche de texte invisible par-dessus, la même construction qu'utilisent Acrobat et tous les logiciels de numérisation pour un PDF interrogeable. Rechercher, sélectionner et copier fonctionnent ; l'impression ne change pas.

La reconnaissance est-elle fiable ?

C'est le moteur neuronal de Tesseract 5, celui qu'on trouve derrière la plupart des OCR open source, exécuté en WebAssembly dans votre navigateur. Une numérisation propre à 300 dpi d'un texte imprimé sort presque sans faute ; une page de travers, pâle ou photographiée, moins bien - redressez-la d'abord avec Redresser un PDF. Les mots dont le moteur n'était pas sûr sont quand même placés, pour qu'une recherche les trouve, et l'outil indique leur nombre.

Quelles langues, et puis-je en choisir plusieurs ?

Hongrois, anglais, allemand, français, italien, espagnol, polonais, roumain, slovaque, tchèque, croate, slovène, serbe (latin et cyrillique), ukrainien, russe, bulgare, grec, turc, danois, suédois, norvégien, finnois, néerlandais, portugais, latin, arabe, persan, hébreu, chinois (simplifié et traditionnel), japonais, coréen et l'allemand en Fraktur pour les impressions gothiques d'avant-guerre, dans n'importe quelle combinaison - un contrat bilingue se lit avec deux. Chaque langue est un téléchargement distinct que le navigateur conserve ensuite.

Le PDF est-il envoyé ?

Rien n'est envoyé : le fichier est ouvert et traité dans votre navigateur et ne quitte jamais votre appareil. Fermez l'onglet, et il a disparu. Le moteur OCR et ses fichiers de langue proviennent eux aussi de ce site : même le choix de la langue n'est envoyé nulle part.

Quelles pages lit-il ?

Par défaut, seulement celles qui n'ont pas encore de couche de texte, car une page d'origine numérique en a déjà une et une seconde doublerait chaque résultat de recherche. Si un OCR précédent a mal fonctionné, passez à toutes les pages - la nouvelle couche se place sous l'ancienne.

Combien de temps cela prend-il ?

Plus longtemps que tout le reste ici - la reconnaissance est un vrai travail, et chaque page demande un moment même sur une machine rapide : mieux vaut lancer une longue numérisation et la laisser tourner. La première fois, le moteur de reconnaissance et les données de langue sont aussi téléchargés (quelques mégaoctets, depuis ce site et non un CDN) ; ensuite, votre navigateur les garde en cache, et le bouton indique l'avancement, page par page.

Il vous manque quelque chose, ou le résultat vous a surpris ?