- Sie Entitäten aus einer Tabelle extrahieren müssen.
- Sie nicht genügend Beispieldokumente haben, um Ihr NLP-Modell zu trainieren.
- Sie mit der Extraktionsqualität einiger Felder nicht zufrieden sind.
- Textspannen identifizieren, die mit einem regulären Ausdruck, Wörtern oder Ausdrücken aus einem Benutzerwörterbuch (in beliebiger flektierter Form) oder einem integrierten NER-Objekt übereinstimmen.
- Abfragen für Text und Textspannen ausführen, in denen Suchwörter in beliebiger flektierter Form vorkommen können.
- Identifizierte Textspannen in Dokumentfelder speichern.
- Adressen und ihre Komponenten aus Dokumenten extrahieren.
Integrierte NER-Objekte
Adresskomponenten:
NerZipCode (Postleitzahl), NerCountry (Land), NerState (Bundesstaat), NerCity (Stadt) und NerStreet (Straße).
Extraktionsskript erstellen
1
Eigenschaften des Abschnitts öffnen
Öffnen Sie den Document Definition Editor, klicken Sie mit der rechten Maustaste auf einen Dokumentabschnitt, wählen Sie Properties aus und klicken Sie auf die Registerkarte NLP.
2
Skript erstellen
Klicken Sie unter Extraktionsskript auf Create.
3
Wörterbuch laden oder Skript bearbeiten
Klicken Sie im Dialogfeld Extraction Script auf Load, um ein Benutzerwörterbuch zu laden, oder auf Edit, um den Skripteditor zu öffnen. Benutzerwörterbücher müssen in UTF-8 mit BOM oder ANSI codiert sein.
Adresskomponenten aus einem Dokument extrahieren
1
Adressbereich angeben
Geben Sie den Teil des Dokuments an, der die Adresse enthält. Begrenzen Sie den Suchbereich mit einem FlexiLayout-Feld und verwenden Sie diesen Bereich als Quelle für das Extraktionsskript. Weitere Informationen finden Sie unter Suchbedingungen.
2
Extraktionsskript anwenden
Wenden Sie das entsprechende Skript an. Sie können nach Adresskomponenten im gesamten Feld oder in einem Teil eines Felds suchen.
ParseAddressInPosition( resultCollectionNamePrefix : string, startPos : int, endPos : int ) oder ParseAddressInSpan( resultCollectionNamePrefix : string, span : IInterval ) zum Analysieren einer Adresse verwenden, erhält jedes Wort in den erkannten Komponenten während der Indizierung die folgenden Attribute, die Sie anschließend in XML-Abfragen verwenden können:
- Den Sammlungsnamen im Format
[resultCollectionNamePrefix]_[NerTypeOfComponent]. - Das Präfix
resultCollectionNamePrefix. - Den Typ des NER-Objekts.
Derzeit können Sie Komponenten nur aus deutschen und US-amerikanischen Adressen extrahieren.
