| Begriff | Definition |
|---|---|
| Document | Eine Zusammenstellung aus einem oder mehreren Seitenbildern und den daraus extrahierten Daten. |
| Document Definition | Definiert, wie ein bestimmter Dokumenttyp identifiziert und verarbeitet wird: die Dokumentstruktur (die zulässige Reihenfolge der Seiten, anhand derer Seiten zu Dokumenten zusammengefügt werden), Dokumentabschnitte, die Regeln, die Felddaten erfüllen müssen, die Positionen der Felder und ihrer Beschriftungen im Datenformular, Exporteinstellungen und Verarbeitungseinstellungen. |
| Dokumenttyp | Dokumente, die gemeinsame Merkmale aufweisen und innerhalb eines Geschäftsprozesses einheitlich verarbeitet werden. Beispiele: Rechnungen, Verträge und Reisepässe. |
| Entität | Ein Feld oder eine Gruppe von Feldern mit Informationen, die mithilfe von NLP extrahiert werden sollen. Beispiele: Personen, Unternehmen, Orte, Beträge und Daten. |
| Feld | Ein Dokumentelement zur Datenextraktion. Felder können einfach oder komplex sein. Ein Beispiel für ein komplexes Feld ist ein Tabellenfeld, bei dem jede Zelle ein separates untergeordnetes Feld ist. |
| NER (Named Entity Recognition) | Eine Aufgabe der Informationsgewinnung, die Erwähnungen benannter Entitäten in unstrukturiertem Text erkennt und klassifiziert. |
| NLP (Natural Language Processing) | Ein Teilgebiet der künstlichen Intelligenz und der Computerlinguistik, das sich mit der computerbasierten Analyse und Synthese natürlicher Sprachen befasst. Zu den Anwendungen gehören Informationsgewinnung, maschinelle Übersetzung, Chatbots, Dokumentklassifizierung und Sentimentanalyse. |
| NLP-Modell | Ein Mechanismus, der bestimmt, welche Entitäten und Segmente wie aus Text extrahiert werden. Fachgebiet und Extraktionsalgorithmus werden während des Trainings ausgewählt. |
| Segment | Ein Textfragment aus einem oder mehreren Absätzen, das zu extrahierende Daten enthält. Ein Segment kann auch ein zu extrahierendes Feld sein, beispielsweise die Bedingungen für die Kündigung eines Vertrags. |
| Segmentierung | Der Prozess der Identifizierung von Segmenten. Er geht der Informationsgewinnung voraus und erleichtert bei umfangreichen Dokumenten die Suche nach Entitäten, indem er sie auf bestimmte Fragmente eingrenzt. |
Using NLP to process unstructured documents
Glossar
Glossar der in ABBYY FlexiCapture verwendeten NLP-Begriffe mit Definitionen von Entität, Feld, NER, NLP-Modell, Segment, Segmentierung und Document Definition.
