Skip to main content
Extraktionsskripte können die Ergebnisse verbessern, wenn sie zusammen mit einem NLP-Modell verwendet werden. Verwenden Sie sie, wenn:
  • Sie Entitäten aus einer Tabelle extrahieren müssen.
  • Sie nicht genügend Beispieldokumente haben, um Ihr NLP-Modell zu trainieren.
  • Sie mit der Extraktionsqualität einiger Felder nicht zufrieden sind.
Mit Extraktionsskripten können Sie:
  • Textspannen identifizieren, die mit einem regulären Ausdruck, Wörtern oder Ausdrücken aus einem Benutzerwörterbuch (in beliebiger flektierter Form) oder einem integrierten NER-Objekt übereinstimmen.
  • Abfragen für Text und Textspannen ausführen, in denen Suchwörter in beliebiger flektierter Form vorkommen können.
  • Identifizierte Textspannen in Dokumentfelder speichern.
  • Adressen und ihre Komponenten aus Dokumenten extrahieren.

Integrierte NER-Objekte

Adresskomponenten: NerZipCode (Postleitzahl), NerCountry (Land), NerState (Bundesstaat), NerCity (Stadt) und NerStreet (Straße).

Extraktionsskript erstellen

1

Eigenschaften des Abschnitts öffnen

Öffnen Sie den Document Definition Editor, klicken Sie mit der rechten Maustaste auf einen Dokumentabschnitt, wählen Sie Properties aus und klicken Sie auf die Registerkarte NLP.
2

Skript erstellen

Klicken Sie unter Extraktionsskript auf Create.
3

Wörterbuch laden oder Skript bearbeiten

Klicken Sie im Dialogfeld Extraction Script auf Load, um ein Benutzerwörterbuch zu laden, oder auf Edit, um den Skripteditor zu öffnen. Benutzerwörterbücher müssen in UTF-8 mit BOM oder ANSI codiert sein.

Adresskomponenten aus einem Dokument extrahieren

1

Adressbereich angeben

Geben Sie den Teil des Dokuments an, der die Adresse enthält. Begrenzen Sie den Suchbereich mit einem FlexiLayout-Feld und verwenden Sie diesen Bereich als Quelle für das Extraktionsskript. Weitere Informationen finden Sie unter Suchbedingungen.
2

Extraktionsskript anwenden

Wenden Sie das entsprechende Skript an. Sie können nach Adresskomponenten im gesamten Feld oder in einem Teil eines Felds suchen.
Eine Adresse enthält höchstens eine Instanz jeder Komponente (Postleitzahl, Land, Bundesstaat, Stadt und Straße), ein Skript kann jedoch mehrere Instanzen zurückgeben. Je genauer Sie den Suchbereich definieren, desto weniger Instanzen werden zurückgegeben. Wenn Sie die Methode ParseAddressInPosition( resultCollectionNamePrefix : string, startPos : int, endPos : int ) oder ParseAddressInSpan( resultCollectionNamePrefix : string, span : IInterval ) zum Analysieren einer Adresse verwenden, erhält jedes Wort in den erkannten Komponenten während der Indizierung die folgenden Attribute, die Sie anschließend in XML-Abfragen verwenden können:
  1. Den Sammlungsnamen im Format [resultCollectionNamePrefix]_[NerTypeOfComponent].
  2. Das Präfix resultCollectionNamePrefix.
  3. Den Typ des NER-Objekts.
Ein Beispiel für eine XML-Abfrage zur Adress-Extraktion finden Sie unter Abfragesprache.
Derzeit können Sie Komponenten nur aus deutschen und US-amerikanischen Adressen extrahieren.