- Necesita extraer entidades de una tabla.
- No tiene suficientes documentos de muestra para entrenar su modelo de NLP.
- No está satisfecho con la calidad de la extracción en algunos campos.
- Identificar fragmentos de texto que coincidan con una expresión regular, palabras o frases de un diccionario de usuario (en cualquier forma flexionada) o un objeto NER integrado.
- Ejecutar consultas en texto y fragmentos de texto, donde las palabras de búsqueda pueden aparecer en cualquiera de sus formas flexionadas.
- Guardar los fragmentos de texto identificados en los campos del documento.
- Extraer direcciones y sus componentes de los documentos.
Objetos NER predefinidos
Componentes de dirección:
NerZipCode (código ZIP), NerCountry (país), NerState (estado), NerCity (ciudad) y NerStreet (calle).
Crear un script de extracción
1
Abrir las propiedades de la sección
Abra el editor de Definición de Document, haga clic con el botón derecho en una sección del documento, seleccione Propiedades y haga clic en la pestaña NLP.
2
Crear el script
En Scripts de extracción, haga clic en Crear.
3
Cargar un diccionario o editar el script
En el cuadro de diálogo Script de extracción, haga clic en Cargar para cargar un diccionario de usuario o en Editar para abrir el editor de scripts. Los diccionarios de usuario deben estar codificados en UTF-8 con BOM o ANSI.
Extraer componentes de una dirección de un documento
1
Especifique el área de la dirección
Especifique la parte del documento que contiene la dirección. Restrinja el área de búsqueda con un campo de FlexiLayout y utilice esa área como origen para el script de extracción. Para obtener más información, consulte Restricciones de búsqueda.
2
Aplique el script de extracción
Aplique el script adecuado. Puede buscar componentes de dirección en todo el campo o en parte de un campo.
ParseAddressInPosition( resultCollectionNamePrefix : string, startPos : int, endPos : int ) o ParseAddressInSpan( resultCollectionNamePrefix : string, span : IInterval ) para analizar una dirección, cada palabra de los componentes detectados recibe los siguientes atributos durante la indexación, que después puede utilizar en consultas XML:
- El nombre de la colección, con el formato
[resultCollectionNamePrefix]_[NerTypeOfComponent]. - El prefijo
resultCollectionNamePrefix. - El tipo del objeto NER.
Actualmente, solo puede extraer componentes de direcciones alemanas y de US.
