Extraire le texte d’un PDF

Sort la couche de texte en fichier .txt simple, découpé page par page. Pratique pour citer, faire une recherche, ou reprendre le contenu ailleurs.

Avant d’envoyer quoi que ce soit — vous n’aurez pas à le faire

Rien n’est sorti de mon scan.
C’est que le scan n’a pas de couche de texte — c’est une photo de page. La lire demande de l’OCR, que l’app iPhone Privascan fait sur l’appareil, gratuitement.
Pourquoi la mise en page diffère-t-elle de la page ?
Un PDF enregistre où chaque fragment de texte est dessiné, pas des phrases ni des paragraphes. L’extraction suit l’ordre dans lequel les fragments sont dessinés, qui correspond en général à l’ordre de lecture, et parfois non — les colonnes et les tableaux sont là où cela se voit.
Les accents sont-ils préservés ?
Oui, là où le document indique l’encodage qu’il utilise. Un document dont les polices masquent cette information derrière des index de glyphes peut produire des trous, ce qui tient au fichier et non à cet outil.

D’autres outils qui laissent votre fichier là où il est