Skip to main content
Verifizierungsoperatoren können die Datenextraktion durch erneutes Training von NLP-Modellen verbessern. Wenn FlexiCapture ein Feld nicht erkennt oder ein Feld mit einem anderen verwechselt, gibt der Operator das richtige Feld an und trainiert das Modell erneut. FlexiCapture verwendet dann das neu trainierte Modell für eine präzisere Extraktion.
Zusätzliches Training ist für in Dokumentdefinitionen geladene NLP-Modelle nicht verfügbar.

Training während der Verifizierung starten

Starten Sie das Training auf eine von zwei Arten:
  • Fügen Sie eine Trainingsstufe nach der Verifizierungsstufe hinzu. Das Training startet, wenn die für den Trainings-Batch festgelegten Bedingungen erfüllt sind. Weitere Informationen finden Sie unter Workflow-Einrichtung.
  • Senden Sie Dokumente manuell an die Trainingsstufe: Klicken Sie im Arbeits-Batch mit der rechten Maustaste auf das Dokument und wählen Sie Train aus.

So funktioniert das Training

  • Beim Start des Trainings erstellt FlexiCapture einen allgemeinen Trainings-Batch (falls noch keiner vorhanden ist) und kopiert unabhängig von der Variante jedes Dokument der Dokumentdefinition hinein.
  • Jedem Dokument wird der Status For training oder For testing zugewiesen.
  • Dokumente mit dem Status For training werden zum Erstellen eines neuen NLP-Modells verwendet.
  • Das neue Modell wird anhand der Dokumente mit dem Status For testing getestet.
  • Wenn das neue Modell nicht schlechter abschneidet als das vorhandene, ersetzt es dieses. Andernfalls wird es abgelehnt.
Wenn einige Dokumente dieselben Felder enthalten, diese aber an sehr unterschiedlichen Stellen platzieren, erstellen Sie für jede Variante separate Trainings-Batches, um die Erkennung zu verbessern.

Einen Trainings-Batch für einen bestimmten Vendor oder eine bestimmte Variante erstellen

1

Projekt öffnen

Öffnen Sie auf der Project Setup Station das Projekt mit dem NLP-Modell. Weitere Informationen finden Sie unter NLP-Modelle erstellen.
2

Batches für Feldextraktionstraining öffnen

Wählen Sie Fields Training → Open Field Extraction Training Batches, drücken Sie Strg+Alt+B oder wählen Sie im Kontextmenü Field Extraction Training Batches.
3

Batch erstellen

Wählen Sie File → New Batch (oder drücken Sie Strg+N). Wählen Sie die Dokumentdefinition und die Variante aus und anschließend im Kontextmenü NLP Batch.
4

Dokumente hinzufügen und trainieren

Fügen Sie Ihre Dokumente hinzu, erkennen Sie sie, ändern Sie die Reihenfolge der Abschnitte und starten Sie das Training über Train im Kontextmenü, Strg+F7 oder die Schaltfläche Train Batch in der Symbolleiste.
Die Qualität eines trainierten NLP-Modells hängt von der Anzahl der Trainingsdokumente und der Qualität ihrer Markierungen ab:
  • Markieren Sie jedes in der Dokumentdefinition beschriebene Feld in den Trainingsdokumenten.
  • Nehmen Sie 100 bis 500 Dokumente in jeden Trainings-Batch auf. In diesem Bereich kann FlexiCapture die besten Parameter auswählen, ohne das Training zu verlangsamen.
Wenn Operator-Feedback für das Training verwendet wird, werden neue Dokumente sowohl dem Trainings-Batch als auch dem Varianten-Batch hinzugefügt:
  • Für eine Variante mit eigenem Trainings-Batch wird das für diesen Batch erstellte Modell verwendet.
  • Für alle anderen Varianten wird das für den allgemeinen Trainings-Batch erstellte Modell verwendet.
Wird aus derselben Quelle ein Dokument hinzugefügt, das mit einem bereits in einem Trainings-Batch enthaltenen Dokument identisch ist, ersetzt das neue Dokument das alte. Dies wird im Hintergrundaufgabenprotokoll protokolliert. FlexiCapture verwendet die Registrierungsparameter des Dokuments, um festzustellen, ob es sich bei einem Dokument um eine Kopie handelt.

Trainings-Batch-Einstellungen

Wählen Sie nach dem Erstellen des Batches NLP-Batch-Einstellungen anzeigen, um die folgenden Optionen festzulegen.

Trainingsstatistiken exportieren

Nach Abschluss des Trainings können Sie Statistiken für ein NLP-Modell exportieren, darunter:
  • Die Trainings-Batch-Einstellungen.
  • Informationen zu den neuen und alten NLP-Modellen.
  • Die Trainingszeit.
  • Die Version der verwendeten NLP-Komponente.
  • Statistiken zum Dokument- und Feldtraining.
  • Die Aktualität der exportierten Daten. Wenn der Parameter isActual auf false gesetzt ist, wurde der Batch nach dem Training geändert, beispielsweise durch das Hinzufügen oder Entfernen von Dokumenten oder durch Änderungen am Markup. Starten Sie das Training erneut, um aktuelle Statistiken zu erhalten.
Um das Protokoll zu exportieren, klicken Sie mit der rechten Maustaste auf den Batch, wählen Sie im Kontextmenü Statistik zur Feldextraktion exportieren aus und geben Sie an, wo die CSV-Datei gespeichert werden soll.