Skip to main content
El procesamiento del lenguaje natural (NLP) es una subdisciplina de la inteligencia artificial y la lingüística computacional que se ocupa del análisis y la síntesis computacionales de los lenguajes naturales. Una aplicación práctica es la extracción de datos relevantes a partir de texto. La forma en que se procesa un documento depende de su estructura. Existen tres tipos: Para obtener más información, consulte Tipos de documentos procesados con ABBYY FlexiCapture. Utilice NLP para procesar documentos no estructurados. Por ejemplo, NLP puede extraer de un contrato números de referencia, nombres de las partes, fechas importantes (fechas de firma, entrada en vigor, plazo y terminación), precio del contrato, comisiones y condiciones de pago. Para extraer datos de tablas o de documentos estructurados y semiestructurados, utilice otros métodos, como FlexiLayouts.

Cómo NLP extrae información

Los productos de ABBYY utilizan modelos NLP para extraer información de textos no estructurados. Un modelo NLP define qué entidades se deben extraer. Al entrenar un modelo NLP con documentos de ejemplo, se determina el área temática y el algoritmo de extracción para extraer la información de forma más eficiente. El esfuerzo necesario para crear un modelo NLP depende de la variedad de los documentos, el contexto disponible y la complejidad y el volumen de la información que se debe extraer. La extracción de datos de textos no estructurados requiere una capacidad de procesamiento considerable, y los textos más extensos tardan más en analizarse. Sin embargo, a menudo la información necesaria se encuentra en una página o un párrafo específicos. La búsqueda de esas partes útiles se denomina segmentación y requiere mucho menos tiempo y recursos que la extracción de entidades, por lo que puede ser conveniente segmentar un documento antes de extraer información de él. Para obtener más información, consulte Crear un modelo de segmentación.

Procesar documentos no estructurados con NLP

  1. Instale el módulo NLP.
  2. Cree una Definición de Document.
  3. Cree y entrene un modelo NLP, o cargue un modelo NLP existente en su Definición de Document.