
Des documents sous contrôle.L’IA extrait. Les règles vérifient.
Un protocole qui mesure les champs, les incohérences, la revue et le coût conforme.
Classification
Benchmark d’ingénierie
État des preuves
Corpus à constituer, protocole publié
Secteur
Finance opérationnelle et traitement documentaire
Capacités mobilisées
OCR, Extraction IA, Règles métier, Human-in-the-loop
Périmètre de preuve
Aucun taux de précision, temps gagné ou coût unitaire n’est annoncé avant annotation et exécution du corpus.
Synthèse exécutive
Ce que ce cas démontre
Le modèle extrait des candidats, mais les contrôles déterministes décident si le document peut continuer automatiquement. Tout écart comptable, champ critique absent ou confiance insuffisante déclenche une revue humaine traçable.
Le système métier dans lequel la solution s’inscrit
- 01Les documents arrivent sous forme de PDF natifs, scans, photos mobiles et modèles fournisseurs hétérogènes.
- 02Un document peut contenir des champs lisibles mais rester incohérent au niveau total, TVA, devise ou référence.
- 03Les équipes ont besoin de données structurées, d’une preuve du document source et d’un chemin clair pour les exceptions.
- 04La conformité dépend autant de la provenance et de la traçabilité que de l’exactitude moyenne.
Le problème opérationnel à résoudre
L’extraction de champs est une étape, pas une décision comptable. Une automatisation sûre doit distinguer incertitude visuelle, ambiguïté sémantique et incohérence déterministe.
- Mesurer les champs critiques séparément des champs secondaires.
- Tester la robustesse aux rotations, ombres, compression, tampons et écritures manuscrites.
- Vérifier les relations entre sous-total, taxes, remises et total.
- Empêcher qu’un faible score de confiance soit transformé silencieusement en donnée métier.
Pourquoi les outils existants ne suffisaient pas
Un OCR seul ne résout pas les variantes de mise en page. Un LLM seul peut produire une structure plausible mais fausse. Le contrôle nécessite plusieurs couches indépendantes.
L’hypothèse testée et la chaîne de contrôle
Un pipeline hybride peut diminuer le temps de saisie tout en maintenant une borne d’erreur stricte sur les champs comptables critiques.
- 01
PDF ou image
- 02
OCR
- 03
Extraction IA
- 04
Règles déterministes
- 05
Score de confiance
- 06
Revue humaine
- 07
Donnée structurée
L’approche construite par Atlas
Le pipeline conserve l’image originale, extrait le texte, propose une structure, applique les validations métier et route les écarts vers une file de revue.
- 01Classer le document et contrôler sa qualité avant extraction.
- 02Extraire les valeurs avec coordonnées de provenance lorsque disponibles.
- 03Normaliser dates, devises, identifiants fiscaux, unités et montants.
- 04Appliquer les règles arithmétiques et les référentiels fournisseur ou client.
- 05Calculer un niveau de confiance par champ et par document.
- 06Présenter à l’humain uniquement les champs incertains avec leur zone source.
Les décisions qui structurent la solution
Conserver la provenance
Chaque valeur structurée doit pouvoir être reliée au document, à la page et si possible à la zone qui l’a produite.
Séparer validité et confiance
Un champ peut avoir une confiance élevée tout en violant une règle métier. Les deux signaux restent distincts.
Définir les champs critiques
La référence, le fournisseur, la devise, les montants et les taxes reçoivent des seuils plus stricts que les notes descriptives.
Versionner le pipeline
OCR, modèle, prompts, règles et référentiels sont enregistrés pour rendre les résultats reproductibles.
Impact métier
Ce que la solution doit changer
Les objectifs ci-dessous seront mesurés sur le même corpus avant toute publication de gain ou de précision.
- Réduire le temps passé à recopier des documents lisibles.
- Diriger la revue humaine vers les champs réellement risqués.
- Détecter les incohérences arithmétiques avant l’intégration comptable.
- Documenter la raison de chaque rejet ou correction.
Comment la solution est validée
Le benchmark sépare un jeu de réglage et un jeu d’évaluation verrouillé, annoté par des personnes connaissant les règles documentaires.
- Échantillonnage par type de document, fournisseur, qualité d’image, longueur et devise.
- Mesure par champ, par ligne et par document complet.
- Tests de règles sur totaux, taxes, remises, doublons et références croisées.
- Chronométrage de la revue humaine avec et sans préremplissage.
- Analyse séparée des faux positifs et des faux négatifs sur les champs critiques.
Le protocole publié avant la mesure
Périmètre
Au moins 200 documents anonymisés répartis entre factures, bons de commande et bons de livraison.
Corpus
Documents natifs, scans et photos avec annotations de vérité terrain, y compris défauts de qualité et mises en page rares.
Baseline
Saisie et contrôle manuels complets par une personne formée au processus.
Méthode
Évaluation sur jeu verrouillé, mesure champ par champ, revue chronométrée et analyse des erreurs par criticité.
Conditions d’acceptation
- Tout écart arithmétique bloque l’intégration automatique.
- Les champs critiques absents ou sous le seuil passent en revue humaine.
- Le document original et la version du pipeline restent liés à chaque résultat.
- La performance doit être publiée par segment de qualité, pas seulement en moyenne globale.
Les métriques à suivre
Ces indicateurs définissent le protocole de mesure. Ils ne constituent pas des résultats publiés tant qu’un pilote ou le client n’a pas validé les données.
| Indicateur | Ce qu’il vérifie | Mode de mesure |
|---|---|---|
| Exactitude champ | Mesurer chaque valeur extraite | Valeurs exactes sur valeurs annotées, par type de champ |
| Document parfait | Mesurer l’automatisation sans correction | Documents dont tous les champs critiques sont exacts |
| Taux de revue | Quantifier le travail humain restant | Documents et champs envoyés en revue sur le corpus |
| Détection des incohérences | Vérifier les règles | Anomalies connues correctement bloquées ou signalées |
| Temps de traitement | Comparer les parcours | Temps machine, attente et temps humain actif par document |
| Coût conforme | Évaluer la valeur réelle | Coût total divisé par les documents intégrables sans erreur critique |
Résultats publiés et points de rupture
Résultats non publiés
Le protocole précède le benchmark. Les résultats seront accompagnés du volume, des segments, des seuils et des limites du corpus.
Ce qui doit faire échouer ou limiter le système
- Confusion entre total HT, TVA et total TTC sur une mise en page atypique.
- Fusion de deux lignes lorsque le scan coupe une séparation visuelle.
- Lecture plausible mais incorrecte d’un identifiant ou d’une décimale.
- Score global élevé malgré une erreur isolée sur un champ critique.
Sécurité, données et contrôle humain
- 01Anonymiser ou pseudonymiser les documents d’évaluation et limiter leur rétention.
- 02Contrôler les types de fichiers, la taille, les contenus actifs et les traitements antivirus.
- 03Chiffrer les documents et séparer les accès au corpus, aux annotations et aux exports.
- 04Éviter l’envoi d’un document complet lorsqu’un traitement local ou un recadrage suffit.
Les enseignements à retenir
- 01Une moyenne de précision masque les erreurs sur les champs les plus conséquents.
- 02Les règles arithmétiques constituent un contrôle indépendant du modèle.
- 03La revue humaine doit afficher la preuve, pas seulement la valeur proposée.
- 04Un changement de modèle oblige à rejouer le jeu d’évaluation verrouillé.
Recommandation de mise en production
Déployer d’abord sur un type documentaire stable, avec file de revue obligatoire. Élargir fournisseur par fournisseur après mesure des champs critiques et des exceptions.
Références méthodologiques officielles
NIST
AI Risk Management Framework Core
Consulté le 15/08/2026
NIST
Generative Artificial Intelligence Profile, NIST AI 600-1
Consulté le 15/08/2026
European Union
General Data Protection Regulation, Article 5 principles
Consulté le 15/08/2026
GS1
EANCOM standard for electronic business messages
Consulté le 15/08/2026
Pour aller plus loin
Capacités et services liés

Votre contexte mérite une solution mesurable.
Nous cadrons le problème, les contraintes, les décisions et les preuves attendues avant de proposer une trajectoire de livraison.
Évaluer votre contexte