DocToTable - PDF to Excel Converter
Retour au blog

Extraction de tableaux par OCR : préserver la structure des données

DocToTable Team
7 min de lecture
ocrscannéexcelcsvtutoriel

Convertissez des PDF en tableaux en quelques secondes

Sans inscription. Extraction haute précision. Export instantané vers CSV ou Excel.

L’essentiel

  • Si vous ne pouvez pas sélectionner le texte, un OCR est nécessaire avant l’extraction.
  • Les principaux leviers : qualité du scan à 300 DPI, pages droites et bon contraste.
  • Vérifiez attentivement l’aperçu — notamment les chiffres et la ponctuation —, puis exportez.

Convertissez des PDF en tableaux en quelques secondes

Sans inscription. Extraction haute précision. Export instantané vers CSV ou Excel.

Vue d’ensemble du guide

Quand l’OCR est-il nécessaire ?

Vous avez besoin d’un OCR si :

  • vous ne pouvez pas sélectionner le texte du PDF — le curseur met toute la page en surbrillance au lieu de sélectionner des mots ;
  • le fichier est une photo ou la numérisation d’un document imprimé ;
  • le système d’origine a exporté une image pixellisée plutôt que du véritable texte.

Des caractères aux contours irréguliers, la texture visible du papier et des artefacts de prise de vue — ombres ou inclinaison — sont autant de signes qu’un fichier a été scanné. Dans ce cas, l’OCR transforme l’image de la page en caractères reconnus afin qu’un détecteur de tableaux puisse repérer les lignes et les colonnes.

PDF natif ou scanné : les différences en un coup d’œil

  • PDF natif : texte sélectionnable, caractères nets, polices cohérentes → aucun OCR nécessaire dans la plupart des cas.
  • PDF scanné : texte non sélectionnable, artefacts d’image → OCR nécessaire avant l’extraction du tableau.

Pour les PDF natifs et les processus multipages, consultez notre guide de référence : Comment convertir des tableaux PDF en Excel.

Qualité d’image et mise en page : les difficultés et leurs solutions

La précision de l’OCR dépend directement de la qualité de la source. Voici les principaux facteurs :

  • Résolution : 300 DPI ou plus constitue une bonne base pour les documents imprimés.
  • Contraste : un texte pâle ou un quadrillage gris clair réduit la reconnaissance.
  • Inclinaison : les pages penchées entraînent des colonnes décalées et des cellules fusionnées.
  • Bruit : les artefacts de compression et les ombres brouillent la forme des caractères.
  • Mises en page complexes : en-têtes fusionnés, tableaux imbriqués ou filigranes superposés.

Solutions pratiques :

  • Numérisez de nouveau le document à 300 DPI ou plus, bien droit et avec un éclairage homogène.
  • Augmentez le contraste ou utilisez une source numérique propre si vous en disposez.
  • Recadrez les arrière-plans, tampons et filigranes lorsqu’ils recouvrent le tableau.
  • Si vous devez prendre une photo, placez l’appareil perpendiculairement à la page et utilisez une lumière uniforme.

Illustration d’un cas d’usage général

Comment fonctionne le processus OCR de DocToTable

DocToTable traite les pages scannées en deux étapes :

  1. Reconnaissance OCR : transforme les pixels de la page en zones de texte avec leurs coordonnées, en préservant la position des caractères.
  2. Compréhension du tableau : repère les lignes d’en-tête, les limites des colonnes et les regroupements de cellules à partir de la cartographie du texte reconnu.

Cette combinaison permet à DocToTable de reconstruire des tableaux structurés même lorsque les lignes sont pâles ou absentes. DocToTable détecte automatiquement les colonnes et affiche le résultat avant le téléchargement, afin que vous puissiez déterminer si un nettoyage après l’exportation est nécessaire.

Principales fonctionnalités :

  • Fonctionne avec les documents scannés d’une ou plusieurs pages.
  • Gère les champs numériques, y compris les décimales et les symboles monétaires.
  • Préserve les lignes d’en-tête pour assurer une correspondance cohérente des colonnes.
  • Exporte au format Excel (.xlsx) ou CSV (.csv) selon votre processus.

Convertissez des PDF en tableaux en quelques secondes

Sans inscription. Extraction haute précision. Export instantané vers CSV ou Excel.


Pas à pas : convertir un tableau scanné en Excel ou CSV

Suivez ces étapes pour obtenir des résultats fiables sur des reçus, relevés, tableaux de recherche et autres documents.

  1. Ouvrez DocToTable et importez votre PDF scanné, ou un PDF composé d’images.
  2. Laissez l’OCR se terminer. Un aperçu s’affiche une fois la reconnaissance achevée.
  3. Vérifiez la ligne d’en-tête et la structure détectées — par exemple Référence, Description, Qté, Montant. Si le résultat n’est pas exploitable, améliorez le scan et relancez uniquement ce PDF.
  4. Exportez le résultat, puis modifiez la feuille téléchargée si vous avez besoin d’un autre ensemble de colonnes.
  5. Si le tableau s’étend sur plusieurs pages, vérifiez que les en-têtes et pieds de page ne sont pas ajoutés comme des lignes supplémentaires.
  6. Choisissez Excel pour les processus qui nécessitent une mise en forme, ou CSV pour les pipelines et les imports.
  7. Téléchargez le fichier et contrôlez quelques totaux ou décomptes afin de valider la qualité de l’OCR.

Guides par cas d’usage :

Tableaux scannés sur une ou plusieurs pages

  • Une page : confirmez une seule ligne d’en-tête et des limites de colonnes nettes, puis exportez directement.
  • Plusieurs pages : vérifiez que la même structure de colonnes se répète, excluez les numéros et pieds de page, et conservez l’ordre des données d’une page à l’autre.

Exemples

Exemple A — Page de facture scannée :

  • Scan à 300 DPI avec des colonnes nettes : Description, Qté, Prix unitaire, Montant.
  • L’OCR reconnaît les lignes de facturation ; exportez vers Excel pour mettre en forme les montants et les totaux.

Exemple B — Annexe de recherche multipage :

  • Les tableaux se poursuivent sur plusieurs pages avec des en-têtes répétés.
  • Excluez les numéros de page dans l’aperçu et exportez vers une seule feuille continue.

Contrôle qualité : comment améliorer la précision de l’OCR

Avant la conversion :

  • Privilégiez une résolution d’au moins 300 DPI et utilisez les niveaux de gris ou la couleur s’ils améliorent le contraste.
  • Aplatissez les pages courbées et évitez les déformations de perspective dues à l’appareil photo.
  • Supprimez si possible les tampons et filigranes qui recouvrent le texte.

Dans l’aperçu :

  • Agrandissez les chiffres (0/1/7) et la ponctuation (., -) afin de repérer les erreurs de reconnaissance.
  • Vérifiez que les colonnes détectées automatiquement regroupent les champs de même nature.
  • Pour les tableaux multipages, contrôlez la cohérence de l’ordre des colonnes.

Après l’exportation :

  • Contrôlez les totaux : comparez les sous-totaux, taxes et totaux du PDF avec les valeurs dans Excel.
  • Exécutez quelques formules rapides : =TRIM(), =VALUE(SUBSTITUTE(A2,",",".")), =DATEVALUE().
  • Ajoutez des filtres et figez la ligne d’en-tête pour les grands jeux de données.

Si vous traitez régulièrement les mêmes rapports, enregistrez une liste de contrôle ou une macro Excel pour standardiser le nettoyage.


Questions fréquentes

Comment savoir si mon PDF nécessite un OCR ?

Si vous ne pouvez pas sélectionner le texte du PDF et que la page se comporte comme une image, vous avez besoin d’un OCR. Les artefacts de numérisation visibles — ombres, inclinaison ou contours de texte irréguliers — constituent un autre indice.

Quelle résolution choisir pour convertir un tableau par OCR vers Excel ?

Visez 300 DPI. Les résolutions inférieures, comme les captures d’écran à 96 DPI, peuvent fonctionner, mais la précision augmente avec un texte plus net et un contraste plus élevé.

Comment améliorer la précision de l’OCR sur des tableaux petits ou denses ?

Augmentez la résolution du scan, gardez les pages bien à plat et améliorez le contraste. Dans l’aperçu, confirmez la structure détectée et relancez ce PDF si vous disposez d’un scan plus propre.

DocToTable peut-il convertir un PDF scanné en CSV pour un pipeline de BI ?

Oui. Exportez au format CSV pour l’importer dans des bases de données ou des outils de BI. Utilisez Excel si vous avez besoin de mise en forme ou d’une vérification manuelle.

Les scans multipages seront-ils regroupés dans une seule feuille ?

Oui, à condition que la structure des colonnes soit cohérente. Excluez les en-têtes et pieds de page de la zone de données dans l’aperçu.


Conclusion

L’OCR rend accessibles les données tabulaires contenues dans les PDF scannés. Avec une source propre et un contrôle rapide de l’aperçu, DocToTable les convertit de façon fiable vers Excel ou CSV pour l’analyse ou l’importation.

Pour les processus généraux, consultez : Comment convertir des tableaux PDF en Excel.

Convertissez des PDF en tableaux en quelques secondes

Sans inscription. Extraction haute précision. Export instantané vers CSV ou Excel.

Convertissez des PDF en tableaux en quelques secondes

Sans inscription. Extraction haute précision. Export instantané vers CSV ou Excel.

Extraction de tableaux par OCR : | Blog | DocToTable