Extraire le texte

Extraire le texte d’un PDF

Obtenez le texte brut d'un document, dans un fichier simple que vous pouvez chercher, coller, comparer ou donner à un programme.

Extraire le texte d’un PDF en ligne

Extraire le texte, c'est ce qu'on veut quand la mise en forme gêne : ce sont les mots eux-mêmes qu'il faut, pour les chercher, les coller dans un script, comparer deux révisions, ou les donner à un outil qui ne lit que du texte simple. PDF Vision lit le document côté serveur avec Poppler — le moteur pdftotext utilisé partout sous Linux — et rend le texte de chaque page séparément ainsi qu'un bloc combiné, téléchargeable en .txt. La condition importante est que le PDF contienne réellement du texte. Un fichier produit par Word, par un logiciel comptable ou par un export web en contient. Un scan, non : c'est une image de mots, et aucun extracteur ne trouvera des caractères qui n'ont jamais été écrits dans le fichier. Quand le résultat revient vide ou presque, c'est la raison — l'outil le signale et vous renvoie vers l'OCR, qui reconnaît d'abord les lettres dans l'image. Fichiers jusqu'à 10 Mo et 100 pages, traités sur nos serveurs : un compte est nécessaire.

Comment extraire le texte d’un PDF

  1. Téléversez le PDF

    Jusqu'à 10 Mo et 100 pages. Le document doit avoir du texte sélectionnable — si vous pouvez surligner un mot dans un lecteur, l'extraction fonctionnera.

  2. Le texte est relevé

    Poppler lit le document côté serveur et rend le texte de chaque page, gardées distinctes, plus un bloc combiné.

  3. Téléchargez le .txt

    Enregistrez le fichier texte, ou copiez directement depuis la page ce dont vous avez besoin.

Pourquoi l'utiliser

Du texte brut, pas une remise en page

Convertir en Word tente de reconstruire la mise en forme et peut déplacer des éléments. L'extraction rend les mots tels quels, ce dont un script, une recherche ou une comparaison a réellement besoin.

Page par page autant qu’en entier

Chaque page est rendue séparément : vous pouvez citer une page précise ou traiter un document page à page, au lieu de démêler un long bloc.

Vous dit quand le PDF est un scan

Un résultat vide est diagnostiqué plutôt que laissé sans explication : un document sans couche de texte est signalé et vous êtes renvoyé vers l'OCR au lieu de réessayer la même chose.

Questions fréquentes

Rien n’est sorti, ou presque rien. Pourquoi ?
Presque certainement parce que le PDF est un scan. Une page scannée est une image de mots, pas des mots : il n'y a aucun caractère dans le fichier qu'un extracteur puisse trouver. Passer l'OCR d'abord reconnaît les lettres dans l'image et produit une couche de texte ; l'extraction fonctionne ensuite normalement.
La mise en page est-elle conservée ?
Non, et c'est le principe. Vous obtenez le texte, pas la mise en forme — ni colonnes, ni bordures de tableaux, ni polices. Si le document doit rester un document, convertissez-le en Word. Si ce sont les mots qu'il vous faut, pour une recherche, un script ou une comparaison, l'extraction est le bon outil.
Quelles sont les limites ?
Fichiers jusqu'à 10 Mo et 100 pages. Le texte de chaque page est rendu séparément autant que combiné, et le téléchargement est un simple fichier .txt.
Les tableaux sont-ils extraits en tableaux ?
Non. Un tableau devient le texte qu'il contient, dans l'ordre de lecture, sans la grille. Pour conserver les lignes et les colonnes en cellules, utilisez le convertisseur PDF vers Excel, qui reconstruit la structure au lieu de l'aplatir.
Faut-il un compte ?
Oui — l'extraction s'exécute sur nos serveurs, la connexion est donc nécessaire. La création de compte est gratuite.

Outils liés