- Erkennungsmodus (Fast, Balanced, Normal oder Accurate) bestimmt die Erkennungsgeschwindigkeit und die Qualität der resultierenden Textebene. Um einen Erkennungsmodus festzulegen, klicken Sie im Document Definition Editor auf Document Definition → Eigenschaften der Dokumentdefinition… → Recognition.
- Erkennungssprachen sind die Sprachen, die für die Erkennung verwendet werden. Um sie festzulegen, klicken Sie im Document Definition Editor auf Document Definition → Eigenschaften der Dokumentdefinition… → Einstellung der Dokumentdefinition und dann in der Gruppe Länder und Sprachen auf Edit, um die gewünschten Sprachen auszuwählen.
In FlexiCapture for Invoices sind Erkennungssprachen an die Ländereinstellungen gebunden. Wenn Sie der Gruppe Länder und Sprachen ein Rechnungsland hinzufügen, werden die zugehörigen Sprachen automatisch in den Einstellungen der Dokumentdefinition angezeigt. Rechnungsfelder werden während der Erkennung extrahiert.
Arbeiten mit einem FlexiLayout
Geschäftsbereich und Vendor
- Einstellungen der Document Definition: IBAN-, VATID- und NationalVATID-Formate sowie die zugehörigen Schlüsselwörter.
- Datensatz-Felder: IBAN, VATID, NationalVATID, Name, Straße, Stadt, PLZ.
Automatischer Algorithmus zur Unternehmensidentifikation
- Die eindeutigen Unternehmenskennungen sind ausgefüllt. Das Ausfüllen von Spalten mit eindeutigen Werten (VATID, NationalVATID, IBAN) erhöht die Wahrscheinlichkeit einer korrekten Erkennung erheblich, da diese Werte für jedes Unternehmen eindeutig sind.
- Keine mehrfach vorkommenden Firmendatensätze. Wenn keine Datensätze mehrfach vorkommen, steigt die Wahrscheinlichkeit, dass das Unternehmen korrekt erkannt wird. Weitere Informationen finden Sie unter Doppelte Datensätze in der externen Datenbank entfernen.
- Es gibt keine irrelevanten Datensätze. Veraltete oder ungültige Datensätze im Datensatz können dazu führen, dass das Unternehmen aufgrund zufälliger Ähnlichkeiten zwischen verschiedenen Feldwerten falsch erkannt wird.
- Alle Felder sind in jedem Unternehmensdatensatz ausgefüllt. Geben Sie möglichst viele Informationen zu den Unternehmen an. Je mehr Felder ausgefüllt sind, desto höher ist die Wahrscheinlichkeit, dass das Unternehmen korrekt erkannt wird.
- Spalten mit mehreren Werten werden verwendet, um dieselben Informationen zu speichern, die unterschiedlich bezeichnet werden, und nicht völlig verschiedene Informationen. Wenn ein Unternehmen beispielsweise mehrere Adressen hat, muss für jede davon ein separater Datensatz vorhanden sein, auch wenn alle anderen Felder dieselben Informationen enthalten. Weitere Informationen finden Sie unter Vorbereiten von Vendor- und Geschäftsbereich-Datenbanken.
1
Suche nach eindeutigen Unternehmensbezeichnern
Die folgenden Felder gelten als eindeutige Unternehmensbezeichner:Das Programm sucht im Bild nach exakten Übereinstimmungen für solche Felder. Erweiterte reguläre Ausdrücke können dabei auch mögliche Erkennungsfehler berücksichtigen. Weitere Informationen finden Sie unter Erweiterte reguläre Ausdrücke.Erkannte Werte werden wie folgt normalisiert:
- VATID
- NationalVATID
- IBAN
Korrekt ausgefüllte Schlüsselwörter und Bezeichnerformate verbessern die Erkennungsqualität erheblich.
ABBYY FlexiCapture for Invoices bietet vordefinierte reguläre Ausdrücke, Sie können bei Bedarf jedoch eigene erstellen. Navigieren Sie dazu zur Gruppe Länder und Sprachen auf der Registerkarte Einstellung der Dokumentdefinition, wählen Sie das entsprechende Land aus und klicken Sie auf Bearbeiten….
- Buchstaben werden in Großbuchstaben umgewandelt.
- Leerzeichen und die folgenden Zeichen werden entfernt:
.,,,—,/,\.
DE12345 als OE12345 erkannt werden; das erkannte Präfix OE wird dann durch das korrekte Präfix DE ersetzt.Die in einem Dokumentbild erkannten Felder VATID, NationalVATID und IBAN werden verwendet, um den Datensatz abzufragen. Die aus dem Datensatz erhaltenen Spaltenwerte für VATID, NationalVATID und IBAN werden auf dieselbe Weise normalisiert wie die im Bild erkannten Werte und anschließend mit den im Bild erkannten normalisierten Werten abgeglichen (mithilfe exakter Übereinstimmung).2
Suche nach Firmenname und Adresse
Eine Abfrage, die den gesamten Dokumenttext verwendet, um nach den Datensätzen zu suchen, die am besten dazu passen, wird an den Datensatz gesendet.Die im Bild erkannten Werte Name, Street, ZIP und City werden mit den entsprechenden Werten im Datensatz abgeglichen.
Um die bestmöglichen Suchergebnisse für Namen und Unternehmen zu erhalten, stellen Sie sicher, dass die entsprechenden Spalten im Datensatz ausgefüllt sind. Firmenname und Adressinformationen sind besonders wichtig, wenn das Unternehmen nicht über VATID, NationalVATID oder IBAN identifiziert werden kann.
3
Hypothesenbildung
Die in den vorherigen Schritten gefundenen Unternehmen werden verwendet, um eine Menge von Hypothesen zu bilden. ABBYY FlexiCapture for Invoices wertet diese Hypothesen aus und wählt die 5 Vendor-Datensätze und 5 Geschäftsbereich-Datensätze aus, die am zuverlässigsten mit den Feldwerten im Dokumentbild übereinstimmen. Diese Datensätze bilden 25 Vendor-Geschäftsbereich-Paare, wobei jedes Paar als separate Hypothese behandelt wird. Anschließend bewertet ein neuronaler Netzwerkalgorithmus die Hypothesen nach Zuverlässigkeit, und das am besten passende Vendor-BU-Paar wird zur endgültigen Hypothese und zum Ergebnis der Vendor- und Geschäftsbereichserkennung.
Wenn nur die Vendor-Datenbank verbunden ist, kann die Qualität der Auswertung der Vendor-BU-Paare negativ beeinflusst werden. Wir empfehlen, eine Geschäftsbereichsdatenbank zu verbinden, auch wenn keine Geschäftsbereichserkennung erforderlich ist. Weitere Informationen finden Sie unter Verwenden von Vendor- und Geschäftsbereichsdatenbanken.
Wenn es nur sehr wenige Geschäftsbereiche gibt (zum Beispiel einen), wirkt sich das Verbinden einer solchen Datenbank nicht wesentlich auf die Auswertung aus. Es kann jedoch die Erkennungsqualität verbessern, wenn ein Geschäftsbereich fälschlicherweise als Vendor erkannt wird.
Hypothesenfilterung
- Zuverlässiges Matching mit dem Dokumentbild
- Unzuverlässiges Matching mit dem Dokumentbild
InvoiceReader/ShouldFilterUnsureCompanyHypotheses, das auf Folgendes gesetzt werden kann:
true— die Filterung ist aktiviert, und die endgültige Hypothese wird ausschließlich aus den zuverlässigen Hypothesen ausgewählt (Standard).false— die Filterung ist deaktiviert, und die endgültige Hypothese wird unabhängig von ihrer Zuverlässigkeit aus allen Hypothesen ausgewählt.
- Bei der Erkennung von Vendors werden keine unzuverlässigen Hypothesen berücksichtigt. Wenn keine zuverlässigen Hypothesen vorliegen, wird kein Vendor erkannt.
- Bei der Erkennung von Geschäftsbereichen:
- Wenn mindestens eine zuverlässige Hypothese gefunden wurde, werden keine unzuverlässigen Hypothesen berücksichtigt.
- Wenn die Hypothesenmenge keine einzige zuverlässige Hypothese enthält, wird der Flag-Wert ignoriert, und die endgültige Hypothese wird aus den unzuverlässigen Hypothesen ausgewählt.
- Es gibt normalerweise deutlich weniger Geschäftsbereich-Datensätze als Vendor-Datensätze. Außerdem ändern sie sich viel seltener und lassen sich daher leichter aktuell halten. Deshalb erhöht die Erkennung einer zuverlässigen Hypothese die Wahrscheinlichkeit, dass die endgültige Hypothese korrekt ist. Die Erkennung eines Geschäftsbereichs ist jedoch auch dann wichtig, wenn keine zuverlässigen Hypothesen gefunden wurden, da der wichtigste Faktor für die Zuverlässigkeit des Erkennungsergebnisses die Zuverlässigkeitsbewertung der Vendor-BU-Paare ist.
- Es gibt normalerweise deutlich mehr Vendor-Datensätze, und der Datensatz enthält mehr Spalten, weil Vendors auf ihren Rechnungen mehr Informationen über ihr eigenes Unternehmen angeben als über den Geschäftsbereich. Datensätze können außerdem veraltete Informationen enthalten, sodass die Filterung unzuverlässiger Hypothesen sowohl von der Qualität des Datensatzes als auch vom Typ des Verifizierungsszenarios abhängt.
Um die Wahrscheinlichkeit zu erhöhen, zuverlässige Hypothesen zu erkennen, halten Sie Datensätze aktuell und erfassen Sie möglichst viele Informationen über Vendors und Geschäftsbereiche.
Ergebnisse der Erkennung von Vendor und Geschäftsbereich
- Der Bezeichner des Vendor-Datensatzes im Vendors-Datensatz
- Der Bezeichner des Geschäftsbereich-Datensatzes im BusinessUnits-Datensatz
Wenn im Vendors-Datensatz festgelegt ist, dass
Id von BusinessUnitId abhängt (siehe Vendors data set), enthält das Ergebnis der Vendor-Erkennung die Id, die zu BusinessUnitId gehört.fc_Predefined:InvoiceIsVendorSuspicious (fc_Predefined:InvoiceIsBusinessUnitSuspicious) auf true gesetzt.
Die Regionen der folgenden Felder können als Ergebnis der Erkennung von Vendor und Geschäftsbereich gefunden werden:
- Für den Vendor: Name, VatID, NationalVatID, IBAN, Street, Zip, City.
- Für den Geschäftsbereich: Name, VatID, Street, Zip, City.
Wenn die Feldwerte für IBAN und VATID im Vendors-Datensatz fehlen, können Schlüsselwörter und das Format verwendet werden, um die entsprechenden Werte auf dieselbe Weise zu erkennen wie Bankdaten erkannt werden (sofern der entsprechende Vendor gefunden wurde).
Die Suche nach einer Feldregion kann durch Training oder durch Anwenden eines zusätzlichen FlexiLayout geändert werden (siehe Capturing additional invoice fields). Dies hat keinen Einfluss auf die Erkennung von Vendor und Geschäftsbereich, kann jedoch die Position der Feldregionen in diesen Feldgruppen nach dem Matching der Dokumentdefinition mit den Rechnungen beeinflussen.
So ändern Sie, wie das Programm den Vendor oder Geschäftsbereich ermittelt
- Normalisierung von Datensatzspalten (siehe Normalisierung von Werten in Datensätzen)
- Datensatzspalten mit mehreren Werten (siehe Spalten mit mehreren Werten in einem Datensatz)
Verwenden vordefinierter Vendor- und Geschäftsbereichswerte
fc_Predefined:InvoicePredefinedVendorId (fc_Predefined:InvoicePredefinedBusinessUnitId) auf den Bezeichner (Id) eines Eintrags im Vendors- oder BusinessUnits-Datensatz.
Dies verhindert die automatische Erkennung des Vendors oder Geschäftsbereichs nicht. Zusätzlich zum vordefinierten Vendor oder Geschäftsbereich erhalten Sie daher einen Konfidenzwert (der angibt, wie gut die vordefinierten Werte mit den aus dem Bild extrahierten Werten übereinstimmen) sowie die Regionen der Felder aus den Feldgruppen Vendor und Geschäftsbereich.
Feldgruppe Rechnungskopf
InvoiceNumber und InvoiceDate
Wie das Programm bestimmt, dass ein Dokument eine Rechnung ist
- Die Felder InvoiceNumber und InvoiceDate wurden erkannt.
- Schlüsselwörter aus dem Element InvoiceIdentifiers located wurden erkannt (siehe Schlüsselwort).
- Auf dem Dokument wurde ein Vendor oder ein Geschäftsbereich erkannt.
Feldgruppe „Beträge“
FlexiCapture for Invoices erfasst die folgenden Felder aus einer Rechnung:
Informationen aus der Document Definition werden verwendet, um Summen und Steuersätze zu finden:
- Im Land des Vendor geltende Steuersätze (Sie können diese auf der Registerkarte Steuersätze in den Ländereigenschaften angeben — siehe Länder- und Spracheinstellungen).
- Schlüsselwörter für Steuersätze (Sie können diese auf der Registerkarte Schlüsselwörter in den Spracheigenschaften angeben — siehe Schlüsselwörter).
- AmountTotalHighConfidenceLabels: Schlüsselwörter, die nur in der Nähe des Felds Total vorkommen, zum Beispiel „Diesen Betrag bezahlen.“
- AmountTotalLowConfidenceLabels: Schlüsselwörter, die in der Nähe des Felds Total vorkommen können, aber auch in der Nähe anderer Felder. So kann das Schlüsselwort „Total“ in der Nähe des Felds Total erscheinen, aber auch in der Nähe eines Felds, das das Gesamtgewicht aller Positionen auf einer Rechnung enthält.
- Zahlen, die in derselben Zeile oder Spalte im Bild zwei- oder dreimal vorkommen. Solche Zahlen können den Gesamtbetrag auf Rechnungen darstellen, auf denen keine Steuern angegeben sind.
- Zahlen, die die Summe der Zahlen oberhalb von ihnen in derselben Spalte sind.
- Die größten Zahlen (nach Absolutwert) am Ende des Dokuments.
Feldgruppe Bestellung
FlexiCapture for Invoices kann alle Bestellnummern und die zugehörigen Summen aus der Rechnung extrahieren. Diese Funktion ist standardmäßig deaktiviert (siehe Bestell-Matching). Um Bestellnummern zu extrahieren, benötigen Sie einen Datensatz mit einer Liste möglicher Bestellnummern und deren Summen (siehe PurchaseOrders Datensatz). Das Feld Bestellung kann wie folgt extrahiert werden:- mit einem regulären Ausdruck
- mit einem Datensatz, der mögliche Bestellnummern enthält (siehe PurchaseOrders Datensatz)
- die VendorId-Spalte des Datensatzes verwenden. In diesem Fall verwendet das Programm nur Bestellnummern des Vendors der Rechnung.
- Bestellungen herausfiltern, für die bereits eine Rechnung eingegangen ist, und nur die Nummern der Bestellungen hinzufügen, für die noch keine Rechnung eingegangen ist.
Die Feldgruppe „Positionen (wiederholte Gruppe)“
FlexiCapture for Invoices kann Rechnungspositionen aus Bildern extrahieren. Die Extraktion von Rechnungspositionen ist standardmäßig deaktiviert (siehe Zusätzliche Felder). Eine Liste der Felder, die das Programm automatisch extrahiert, finden Sie unter Erfasste Felder. FlexiCapture for Invoices sucht zunächst im Bild nach einer Tabelle. Dabei verwendet es die Schlüsselwörter für Spaltenüberschriften, die für jede Sprache in den Eigenschaften der Document Definition angegeben sind. Schlüsselwörter für Spalten von Rechnungspositionen werden auch zur Klassifizierung der Positionen verwendet, also zur Bestimmung des Typs jeder Spalte einer Rechnungsposition. Anschließend verwendet das Programm Informationen über erkannte Spalten und mathematische Ausdrücke, um Rechnungspositionen in der Rechnungstabelle zu finden. Abschließend sucht es in den Rechnungspositionen nach Feldern aus den Spalten. Mithilfe von Training kann die Qualität der automatischen Extraktion von Rechnungspositionen verbessert werden.Verwendung neuronaler Netze
Einer der Hauptvorteile neuronaler Netze ist ihre Fähigkeit, selbst zu lernen: Sie können komplexe Abhängigkeiten zwischen Eingabedaten erkennen und nützliche Verallgemeinerungen vornehmen. Das Programm enthält zwei neuronale Netze, die zum Erfassen der folgenden Felder verwendet werden können:- InvoiceNumber
- InvoiceDate
- Total
Vendor\NameVendor\AddressBusiness Unit\NameBusiness Unit\AddressPurchase Orders\Order Number- LineItems:
- OrderNumber
- OrderDate
- Position
- ArticleNumber
- Description
- Quantity
- Unit of measurement
- Unit Price
- Total Price Netto
- VATPercentage
Deaktivieren der neuronalen Netze
1
Öffnen Sie den Document Definition Editor
Öffnen Sie den Document Definition Editor.
2
Öffnen Sie die zusätzlichen Felder und Funktionen
Klicken Sie auf Eigenschaften der Dokumentdefinition… → Einstellung der Dokumentdefinition → Additional Fields and Features.
3
Deaktivieren Sie die Option
Deaktivieren Sie die Option Thorough extraction of invoice line items.
1
Öffnen Sie den Document Definition Editor
Öffnen Sie den Document Definition Editor.
2
Öffnen Sie die zusätzlichen Felder und Funktionen
Klicken Sie auf Eigenschaften der Dokumentdefinition… → Einstellung der Dokumentdefinition → Additional Fields and Features.
3
Deaktivieren Sie die Option
Deaktivieren Sie die Option Thorough extraction of invoice header fields.
Kombinieren der Ergebnisse der Felderkennung
Wie das Programm die Ergebnisse der Felderkennung kombiniert oder das beste Ergebnis auswählt, hängt vom jeweiligen Feld ab. In der Regel haben die Ergebnisse des jeweiligen neuronalen Netzwerks Vorrang. Ausnahmen sind Suchen auf Basis von Datensätzen und Suchen mit regulären Ausdrücken, die für bestimmte Kundendokumente erstellt wurden. Feldgruppe Rechnungskopf Bei den folgenden Feldern haben die vom neuronalen Netzwerk ermittelten Ergebnisse immer Vorrang:- Rechnungsnummer
- Rechnungsdatum
- Gesamtbetrag
- Name
- VATID (ABN)
- Adresse
