- Le mode de reconnaissance (Fast, Balanced, Normal ou Accurate) détermine la vitesse de reconnaissance et la qualité du calque de texte ainsi obtenu. Pour spécifier un mode de reconnaissance, dans le Document Definition Editor, cliquez sur Document Definition → Document Definition Properties… → Recognition.
- Les langues de reconnaissance sont les langues utilisées pour la reconnaissance. Pour spécifier les langues de reconnaissance, dans le Document Definition Editor, cliquez sur Document Definition → Document Definition Properties… → Document Definition Settings, puis cliquez sur Modifier dans le groupe Pays et langues pour sélectionner les langues requises.
Dans FlexiCapture for Invoices, les langues de reconnaissance sont liées aux paramètres de pays. Lorsque vous ajoutez un pays de facturation au groupe Pays et langues, les langues correspondantes apparaissent automatiquement dans les paramètres de la définition de document. Les champs de facture sont extraits lors de la reconnaissance.
Utiliser un FlexiLayout
Unité commerciale et fournisseur
- Paramètres de définition de document : formats IBAN, VATID et NationalVATID, ainsi que les mots-clés correspondants.
- Champs de l’enregistrement du jeu de données : IBAN, VATID, NationalVATID, Name, Street, City, ZIP.
Algorithme de détection automatique d’entreprise
- Les identifiants uniques de l’entreprise sont renseignés. Le fait de renseigner les colonnes contenant des valeurs uniques (VATID, NationalVATID, IBAN) améliore considérablement la probabilité d’une détection correcte, car ces valeurs sont propres à chaque entreprise.
- Il n’y a pas de doublons parmi les enregistrements d’entreprise. L’absence de doublons améliorera les chances de détecter correctement l’entreprise. Pour plus d’informations, voir Suppression des doublons dans la base de données externe.
- Il n’y a pas d’enregistrements non pertinents. La présence d’enregistrements obsolètes ou non valides dans le jeu de données peut entraîner une détection incorrecte de l’entreprise en raison de similitudes fortuites entre différentes valeurs des champs.
- Tous les champs sont renseignés pour chaque fiche d’entreprise. Renseignez autant d’informations que possible sur les entreprises. Plus les champs sont renseignés, plus la probabilité de détecter correctement l’entreprise est élevée.
- Les colonnes à valeurs multiples servent à stocker une même information lorsqu’elle est représentée de différentes manières, et non des informations différentes. Par exemple, si une même entreprise possède plusieurs adresses, il doit y avoir un enregistrement distinct pour chacune d’elles, même si tous les autres champs contiennent les mêmes informations. Pour plus d’informations, voir Préparation des bases de données de fournisseurs et d’unités commerciales.
1
Recherche d’identifiants uniques
Les champs suivants sont considérés comme des identifiants uniques d’entreprise :Le programme recherche dans l’image des correspondances exactes pour ces champs. Les expressions régulières étendues permettent également de prendre en compte d’éventuelles erreurs de reconnaissance. Pour plus d’informations, voir Expressions régulières étendues.Les valeurs détectées sont normalisées comme suit :
- VATID
- NationalVATID
- IBAN
Des mots-clés et des formats d’identifiant correctement renseignés améliorent considérablement la qualité de détection.
ABBYY FlexiCapture for Invoices propose des expressions régulières prédéfinies, mais vous pouvez créer les vôtres si nécessaire. Pour ce faire, accédez au groupe Pays et langues de l’onglet paramètre de la définition de document, sélectionnez le pays approprié, puis cliquez sur Edit….
- Les lettres sont converties en majuscules.
- Les espaces et les caractères suivants sont supprimés :
.,,,—,/,\.
DE12345 peut être reconnu comme OE12345 ; le préfixe détecté OE est alors remplacé par le préfixe correct DE.Les champs VATID, NationalVATID et IBAN détectés dans une image de document sont utilisés pour interroger le jeu de données. Les valeurs des colonnes VATID, NationalVATID et IBAN reçues du jeu de données sont normalisées de la même manière que les valeurs détectées dans l’image, puis mises en correspondance (au moyen d’une correspondance exacte) avec les valeurs normalisées détectées dans l’image.2
Recherche par nom d’entreprise et adresse
Une requête utilisant l’intégralité du texte du document pour rechercher les enregistrements qui y correspondent le plus précisément est envoyée au jeu de données.Les valeurs Name, Street, ZIP et City détectées dans l’image sont mises en correspondance avec les valeurs correspondantes des enregistrements du jeu de données.
Pour obtenir les meilleurs résultats possibles pour la recherche par nom d’entreprise, assurez-vous que les colonnes correspondantes du jeu de données sont renseignées. Les informations de nom d’entreprise et d’adresse sont particulièrement importantes lorsque l’entreprise ne peut pas être identifiée à l’aide de VATID, NationalVATID ou IBAN.
3
Formation des hypothèses
Les entreprises trouvées au cours des étapes précédentes servent à former un ensemble d’hypothèses. ABBYY FlexiCapture for Invoices évalue ces hypothèses et sélectionne les 5 enregistrements de fournisseur et les 5 enregistrements d’unité commerciale qui correspondent le plus fiablement aux valeurs des champs de l’image du document. Ces enregistrements forment 25 paires fournisseur–unité commerciale, chaque paire étant traitée comme une hypothèse distincte. Un algorithme de réseau neuronal évalue ensuite la fiabilité des hypothèses, et la paire fournisseur–BU la plus pertinente devient l’hypothèse finale ainsi que le résultat de la détection du fournisseur et de l’unité commerciale.
Si seule la base de données fournisseurs est connectée, la qualité de l’évaluation des paires fournisseur–BU peut s’en trouver réduite. Nous recommandons de connecter une base de données d’unités commerciales même si la détection d’unité commerciale n’est pas requise. Pour plus d’informations, voir Utilisation des bases de données fournisseurs et d’unités commerciales.
S’il existe très peu d’unités commerciales (par exemple, une seule), la connexion d’une telle base de données n’affecte pas significativement l’évaluation. Toutefois, elle peut améliorer la qualité de détection lorsqu’une unité commerciale est détectée à tort comme un fournisseur.
Filtrage des hypothèses
- Correspondance fiable avec l’image du document
- Correspondance peu fiable avec l’image du document
InvoiceReader/ShouldFilterUnsureCompanyHypotheses, qui peut être défini comme suit :
true— le filtrage est activé, et l’hypothèse finale est sélectionnée exclusivement parmi les hypothèses fiables (par défaut).false— le filtrage est désactivé, et l’hypothèse finale est sélectionnée parmi toutes les hypothèses, quelle que soit leur fiabilité.
- Lors de la détection des fournisseurs, les hypothèses peu fiables ne sont pas prises en compte. S’il n’y a aucune hypothèse fiable, aucun fournisseur n’est détecté.
- Lors de la détection des unités commerciales :
- Si au moins une hypothèse fiable a été trouvée, les hypothèses peu fiables ne sont pas prises en compte.
- Si le jeu d’hypothèses ne contient aucune hypothèse fiable, la valeur de l’indicateur est ignorée et l’hypothèse finale est sélectionnée parmi les hypothèses peu fiables.
- Il y a généralement beaucoup moins d’enregistrements d’unités commerciales que d’enregistrements de fournisseurs. Ils changent aussi beaucoup moins souvent, ce qui facilite leur mise à jour. Par conséquent, la détection d’une hypothèse fiable augmente la probabilité que l’hypothèse finale soit correcte. Cependant, la détection d’une unité commerciale reste importante même si aucune hypothèse fiable n’a été trouvée, car le facteur le plus important dans la fiabilité du résultat de détection est l’évaluation de la fiabilité des paires fournisseur–UC.
- Il y a généralement beaucoup plus d’enregistrements de fournisseurs, et le jeu de données contient davantage de colonnes, car les fournisseurs indiquent plus d’informations sur leur propre entreprise dans leurs factures qu’au sujet de l’unité commerciale. Les enregistrements peuvent aussi contenir des informations obsolètes ; le filtrage des hypothèses peu fiables dépend donc à la fois de la qualité du jeu de données et du type de scénario de vérification.
Pour augmenter la probabilité de détecter des hypothèses fiables, maintenez les Jeux de données à jour et incluez autant d’informations que possible sur les fournisseurs et les unités commerciales.
Résultats de la détection du fournisseur et de l’unité commerciale
- L’identifiant de l’enregistrement du fournisseur dans le jeu de données Vendors
- L’identifiant de l’enregistrement de l’enregistrement de l’unité commerciale dans le jeu de données BusinessUnits
Si le jeu de données Vendors indique que Id dépend de BusinessUnitId (voir jeu de données Vendors), le résultat de la détection du fournisseur contient l’Id correspondant à BusinessUnitId.
fc_Predefined:InvoiceIsVendorSuspicious (fc_Predefined:InvoiceIsBusinessUnitSuspicious) est défini sur true.
Les régions des champs suivants peuvent être trouvées à la suite de la détection du fournisseur et de l’unité commerciale :
- Pour le fournisseur : Name, VatID, NationalVatID, IBAN, Street, Zip, City.
- Pour l’unité commerciale : Name, VatID, Street, Zip, City.
Si les valeurs des champs IBAN et VATID sont absentes du jeu de données Vendors, des mots-clés et le format peuvent être utilisés pour détecter les valeurs appropriées, de la même manière que les coordonnées bancaires sont détectées (si le fournisseur correspondant a été trouvé).
La recherche de toute région de champ peut être modifiée par entraînement ou par l’application d’un FlexiLayout supplémentaire (voir Capturer des champs de facture supplémentaires). Cela n’a aucun effet sur la détection du fournisseur et de l’unité commerciale, mais peut affecter l’emplacement des régions de champ dans ces groupes de champs après la mise en correspondance de la Document Definition avec les factures.
Comment modifier la façon dont le programme détecte le fournisseur ou l’unité commerciale
- la normalisation des colonnes du jeu de données (voir Normalisation des valeurs dans les jeux de données)
- les colonnes à valeurs multiples du jeu de données (voir Colonnes à valeurs multiples dans un jeu de données)
Utilisation de valeurs prédéfinies de fournisseur et d’unité commerciale
fc_Predefined:InvoicePredefinedVendorId (fc_Predefined:InvoicePredefinedBusinessUnitId) sur l’identifiant (Id) d’une entrée dans le jeu de données Vendors ou BusinessUnits.
Cela n’empêche pas la détection automatique du fournisseur ou de l’unité commerciale. Par conséquent, en plus du fournisseur ou de l’unité commerciale prédéfini, vous obtenez un score de confiance (indiquant dans quelle mesure les valeurs prédéfinies correspondent aux valeurs extraites de l’image), ainsi que les régions des champs des groupes de champs Fournisseur et Unité commerciale.
Groupe de champs En-tête de facture
InvoiceNumber et InvoiceDate
Comment le programme détermine qu’un document est une facture
- Les champs InvoiceNumber et InvoiceDate ont été détectés.
- Des mots-clés de l’élément localisé InvoiceIdentifiers ont été détectés (voir Mots-clés).
- Un fournisseur ou une unité commerciale a été détecté sur le document.
Groupe de champs Montants
FlexiCapture for Invoices extrait les champs suivants d’une facture :
Les informations de la Document Definition sont utilisées pour identifier les montants et les taux d’imposition :
- Les taux des taxes applicables dans le pays du fournisseur (vous pouvez les spécifier dans l’onglet Taux d’imposition des propriétés du pays — voir Country and language settings).
- Les mots-clés des taux d’imposition (vous pouvez les spécifier dans l’onglet Mots-clés des propriétés de la langue — voir Keywords).
- AmountTotalHighConfidenceLabels : mots-clés qui n’apparaissent qu’à proximité du champ Total, comme « Pay this amount. »
- AmountTotalLowConfidenceLabels : mots-clés qui peuvent apparaître à proximité du champ Total, mais aussi près d’autres champs. Par exemple, le mot-clé « Total » peut apparaître près du champ Total, mais aussi près d’un champ contenant le poids total de tous les articles d’une facture.
- Des nombres qui apparaissent deux ou trois fois sur la même ligne ou dans la même colonne de l’image. De tels nombres peuvent correspondre au Total sur des factures où aucune taxe n’est indiquée.
- Des nombres qui sont la somme des nombres situés au-dessus d’eux dans la même colonne.
- Les plus grands nombres (en valeur absolue) situés à la fin du document.
Groupe de champs Commande d’achat
FlexiCapture for Invoices peut extraire tous les numéros de commande d’achat et les montants correspondants depuis la facture. Cette fonctionnalité est désactivée par défaut (voir Mise en correspondance des commandes d’achat). Pour extraire des numéros de commande d’achat, vous avez besoin d’un jeu de données contenant une liste de numéros de commande d’achat possibles et des montants correspondants (voir jeu de données PurchaseOrders). Le champ Commande d’achat peut être extrait à l’aide de :- Une expression régulière
- Un jeu de données contenant des numéros de commande d’achat possibles (voir jeu de données PurchaseOrders)
- Utiliser la colonne VendorId du jeu de données. Dans ce cas, le programme utilise uniquement les numéros de commande d’achat du fournisseur de la facture.
- Filtrer les commandes d’achat pour lesquelles une facture a déjà été reçue et ajouter uniquement les numéros des commandes d’achat pour lesquelles aucune facture n’a encore été reçue.
Le groupe de champs Lignes d’articles
FlexiCapture for Invoices peut extraire les lignes d’articles des factures à partir d’images. L’extraction des lignes d’articles des factures est désactivée par défaut (voir Champs supplémentaires). Pour obtenir la liste des champs que le programme extrait automatiquement, voir Champs capturés. FlexiCapture for Invoices recherche d’abord un tableau dans l’image. Lors de cette recherche, il utilise les mots-clés des en-têtes de colonnes spécifiés pour chaque langue dans les propriétés de la définition de document. Les mots-clés des colonnes des lignes d’articles des factures servent également à classifier les éléments, c’est-à-dire à déterminer le type de chaque colonne de ligne d’article. Le programme utilise ensuite les informations sur les colonnes détectées et les expressions mathématiques pour repérer les lignes d’articles dans le tableau de la facture. Enfin, il recherche dans ces lignes d’articles les champs correspondant aux colonnes. L’entraînement peut être utilisé pour améliorer la qualité de l’extraction automatique des lignes d’articles.Utilisation des réseaux neuronaux
L’un des principaux avantages des réseaux neuronaux est leur capacité d’autoapprentissage : ils peuvent détecter des dépendances complexes entre les données d’entrée et effectuer des généralisations utiles. Le programme comprend deux réseaux neuronaux qui peuvent être utilisés pour capturer les champs suivants :- InvoiceNumber
- InvoiceDate
- Total
Vendor\NameVendor\AddressBusiness Unit\NameBusiness Unit\AddressPurchase Orders\Order Number- LineItems:
- OrderNumber
- OrderDate
- Position
- ArticleNumber
- Description
- Quantity
- Unit of measurement
- Unit Price
- Total Price Netto
- VATPercentage
Désactivation des réseaux neuronaux
1
Ouvrez le Document Definition Editor
Ouvrez le Document Definition Editor.
2
Ouvrez les champs et fonctionnalités supplémentaires
Cliquez sur Propriétés de Document Definition… → paramètre de la définition de document → Champs et fonctionnalités supplémentaires.
3
Désactivez l’option
Désactivez l’option Extraction approfondie des lignes d’articles de la facture.
1
Ouvrez le Document Definition Editor
Ouvrez le Document Definition Editor.
2
Ouvrez les champs et fonctionnalités supplémentaires
Cliquez sur Propriétés de Document Definition… → paramètre de la définition de document → Champs et fonctionnalités supplémentaires.
3
Désactivez l’option
Désactivez l’option Extraction approfondie des champs de l’en-tête de facture.
Combinaison des résultats de détection des champs
La manière dont le programme combine les résultats de détection des champs ou sélectionne le meilleur résultat dépend du champ concerné. En règle générale, la priorité est donnée aux résultats obtenus par le réseau neuronal correspondant. Les exceptions sont les recherches basées sur des jeux de données et les recherches utilisant des expressions régulières créées pour des documents client spécifiques. Groupe de champs En-tête de facture Les résultats obtenus par le réseau neuronal ont toujours la priorité pour les champs suivants :- Numéro de facture
- Date de la facture
- Total
- Nom
- VATID (ABN)
- Adresse
