Extraire le texte d’un PDF
Obtenez le texte brut d'un document, dans un fichier simple que vous pouvez chercher, coller, comparer ou donner à un programme.
Extraire le texte d’un PDF en ligne
Extraire le texte, c'est ce qu'on veut quand la mise en forme gêne : ce sont les mots eux-mêmes qu'il faut, pour les chercher, les coller dans un script, comparer deux révisions, ou les donner à un outil qui ne lit que du texte simple. PDF Vision lit le document côté serveur avec Poppler — le moteur pdftotext utilisé partout sous Linux — et rend le texte de chaque page séparément ainsi qu'un bloc combiné, téléchargeable en .txt. La condition importante est que le PDF contienne réellement du texte. Un fichier produit par Word, par un logiciel comptable ou par un export web en contient. Un scan, non : c'est une image de mots, et aucun extracteur ne trouvera des caractères qui n'ont jamais été écrits dans le fichier. Quand le résultat revient vide ou presque, c'est la raison — l'outil le signale et vous renvoie vers l'OCR, qui reconnaît d'abord les lettres dans l'image. Fichiers jusqu'à 10 Mo et 100 pages, traités sur nos serveurs : un compte est nécessaire.
Comment extraire le texte d’un PDF
Téléversez le PDF
Jusqu'à 10 Mo et 100 pages. Le document doit avoir du texte sélectionnable — si vous pouvez surligner un mot dans un lecteur, l'extraction fonctionnera.
Le texte est relevé
Poppler lit le document côté serveur et rend le texte de chaque page, gardées distinctes, plus un bloc combiné.
Téléchargez le .txt
Enregistrez le fichier texte, ou copiez directement depuis la page ce dont vous avez besoin.
Pourquoi l'utiliser
Du texte brut, pas une remise en page
Convertir en Word tente de reconstruire la mise en forme et peut déplacer des éléments. L'extraction rend les mots tels quels, ce dont un script, une recherche ou une comparaison a réellement besoin.
Page par page autant qu’en entier
Chaque page est rendue séparément : vous pouvez citer une page précise ou traiter un document page à page, au lieu de démêler un long bloc.
Vous dit quand le PDF est un scan
Un résultat vide est diagnostiqué plutôt que laissé sans explication : un document sans couche de texte est signalé et vous êtes renvoyé vers l'OCR au lieu de réessayer la même chose.