Skip to main content
Los scripts de extracción pueden mejorar los resultados cuando se usan junto con un modelo de NLP. Úselos cuando:
  • Necesita extraer entidades de una tabla.
  • No tiene suficientes documentos de muestra para entrenar su modelo de NLP.
  • No está satisfecho con la calidad de la extracción en algunos campos.
Los scripts de extracción le permiten:
  • Identificar fragmentos de texto que coincidan con una expresión regular, palabras o frases de un diccionario de usuario (en cualquier forma flexionada) o un objeto NER integrado.
  • Ejecutar consultas en texto y fragmentos de texto, donde las palabras de búsqueda pueden aparecer en cualquiera de sus formas flexionadas.
  • Guardar los fragmentos de texto identificados en los campos del documento.
  • Extraer direcciones y sus componentes de los documentos.

Objetos NER predefinidos

Componentes de dirección: NerZipCode (código ZIP), NerCountry (país), NerState (estado), NerCity (ciudad) y NerStreet (calle).

Crear un script de extracción

1

Abrir las propiedades de la sección

Abra el editor de Definición de Document, haga clic con el botón derecho en una sección del documento, seleccione Propiedades y haga clic en la pestaña NLP.
2

Crear el script

En Scripts de extracción, haga clic en Crear.
3

Cargar un diccionario o editar el script

En el cuadro de diálogo Script de extracción, haga clic en Cargar para cargar un diccionario de usuario o en Editar para abrir el editor de scripts. Los diccionarios de usuario deben estar codificados en UTF-8 con BOM o ANSI.

Extraer componentes de una dirección de un documento

1

Especifique el área de la dirección

Especifique la parte del documento que contiene la dirección. Restrinja el área de búsqueda con un campo de FlexiLayout y utilice esa área como origen para el script de extracción. Para obtener más información, consulte Restricciones de búsqueda.
2

Aplique el script de extracción

Aplique el script adecuado. Puede buscar componentes de dirección en todo el campo o en parte de un campo.
Una dirección contiene como máximo una instancia de cada componente (código ZIP, país, estado, ciudad y calle), pero un script puede devolver varias. Cuanto más precisamente defina el área de búsqueda, menos instancias se devolverán. Al utilizar el método ParseAddressInPosition( resultCollectionNamePrefix : string, startPos : int, endPos : int ) o ParseAddressInSpan( resultCollectionNamePrefix : string, span : IInterval ) para analizar una dirección, cada palabra de los componentes detectados recibe los siguientes atributos durante la indexación, que después puede utilizar en consultas XML:
  1. El nombre de la colección, con el formato [resultCollectionNamePrefix]_[NerTypeOfComponent].
  2. El prefijo resultCollectionNamePrefix.
  3. El tipo del objeto NER.
Para ver un ejemplo de consulta XML para extraer direcciones, consulte Lenguaje de consulta.
Actualmente, solo puede extraer componentes de direcciones alemanas y de US.