PDF en Markdown

Convertir un PDF en Markdown

Obtenez un fichier Markdown dont les titres sont des titres et les listes des listes — pas un bloc de texte uniforme.

Convertir un PDF en Markdown en ligne

Un PDF ne contient aucune structure. Il contient des glyphes à des coordonnées : rien n'y dit « cette ligne est un titre » ou « ces trois lignes forment une liste ». C'est pourquoi extraire le texte d'un PDF donne un mur de lignes où un titre se lit exactement comme un paragraphe — parfait pour chercher une chaîne, inutilisable pour reconstituer un document. Cet outil reconstruit la structure à partir de ce que la page montre réellement. Une ligne composée nettement plus grande que le corps devient un titre, et d'autant plus haut qu'elle s'en écarte — mesurée par rapport à la taille dominante du document lui-même, jamais à un seuil fixe, de sorte qu'un texte composé en 9 points et un autre en 14 sont chacun lus selon leurs propres proportions. Les lignes séparées par un interligne ordinaire se recollent en paragraphes, puisqu'un PDF coupe chaque phrase en fin de ligne. Les puces et les numérotations redeviennent des listes Markdown. Le gras est déduit de la police elle-même et marqué à l'endroit exact où il se trouve, ce qui préserve une emphase au milieu d'une phrase. Il en sort un fichier .md que vous collez dans une documentation, une application de notes ou une chaîne de recherche augmentée — le format que ces outils attendent vraiment.

Comment convertir un PDF en Markdown

  1. Téléversez le PDF

    Jusqu'à 10 Mo et 100 pages. Le document doit avoir une vraie couche de texte : si vous pouvez sélectionner un mot dans un lecteur, la conversion fonctionnera.

  2. La structure est reconstruite

    Les titres d'après la taille relative, les listes d'après leurs marqueurs, les paragraphes recollés, le gras marqué à sa place.

  3. Copiez ou téléchargez le .md

    Relisez à l'écran, copiez en un clic, ou enregistrez le fichier Markdown.

Pourquoi l'utiliser

Les titres restent des titres

Les niveaux viennent de la taille dominante du document lui-même : la hiérarchie survit au lieu de s'aplatir en un bloc uniforme.

Le format que réclament les outils d’IA

Les chaînes de recherche augmentée et les applications de notes digèrent bien mieux du Markdown que du texte brut : la structure leur dit ce qui compte et où commence une section.

Il dit ce qu’il n’a pas su faire

Un tableau rendu en lignes, un scan sans couche de texte, un document plus long que la limite de pages : chacun est signalé plutôt que laissé à découvrir dans le fichier.

Questions fréquentes

En quoi est-ce différent de l'extraction de texte ?
L'extraction rend les mots sans rien autour : toutes les lignes se ressemblent, un titre se lit comme une phrase. Ici la structure est reconstruite — les titres deviennent des # et des ##, les puces des listes, les lignes d'un même paragraphe se recollent, et le gras est marqué. On extrait le texte pour chercher une chaîne ; on convertit en Markdown pour garder un document lisible, ou pour le donner à un outil qui lit du Markdown.
Comment les titres sont-ils reconnus ?
Par leur taille RELATIVE. L'outil détermine la taille dominante du document — celle qu'emploie la majorité des caractères — et traite comme titre ce qui la dépasse nettement, le niveau montant avec l'écart. Ce détail compte : un seuil fixe ferait de chaque ligne d'un document composé en 16 points un titre, et n'en trouverait aucun dans un document composé en 9.
Les tableaux deviennent-ils des tableaux Markdown ?
Non, et c'est délibéré. Un tableau de PDF n'est qu'un alignement de colonnes ; en reconstruire la grille revient à deviner, et une grille mal devinée produit un tableau qui a l'air juste et se lit faux. Les rangées ressortent donc en lignes de texte, et l'outil vous signale qu'il a rencontré des colonnes. Quand il vous faut de vraies cellules, la conversion PDF vers Excel les reconstruit.
Que se passe-t-il avec un PDF scanné ?
Un scan est une image : il n'y a aucune couche de texte, donc rien à structurer. Plutôt que de vous rendre un fichier vide, l'outil vous le dit et vous oriente vers l'OCR, qui ajoute cette couche. La conversion fonctionne ensuite normalement.
Le gras et l’italique sont-ils conservés ?
Le gras oui, et il est marqué là où il se trouve — au milieu d'une phrase si c'est là qu'il est, pas sur la ligne entière. Il est déduit de la police employée par le document. L'italique n'est pas marqué dans cette version.
Faut-il un compte ?
Oui — la conversion s'exécute sur nos serveurs, la connexion est donc nécessaire. La création de compte est gratuite.

Outils liés