Un contenedor de filtrado de hipótesis combina varias actividades de Deep Learning y una actividad de Extraction Rules. Los resultados de las actividades de Deep Learning se envían a la actividad de Extraction Rules, que establece condiciones para seleccionar los valores que desea.
Aunque una actividad de Deep Learning puede lograr una calidad muy alta en la extracción de campos, en algunos casos quizá quiera controlar el resultado de la actividad de Deep Learning. Para ello, puede combinar una o varias actividades de Deep Learning con una actividad de Extraction Rules, que aplicará condiciones a los valores obtenidos por la(s) actividad(es) de Deep Learning.
El control del resultado es esencial cuando la red neuronal detecta palabras completas pero solo necesita partes específicas, o cuando debe filtrar ruido capturado accidentalmente. También puede ser útil para identificar partes de campos más grandes, como direcciones, que la red neuronal puede pasar por alto. Además, le permite elegir la mejor hipótesis entre múltiples instancias del mismo valor. Por ejemplo, cuando un nombre de Proveedor aparece varias veces en un documento, puede seleccionar el resultado de extracción más preciso entre las múltiples instancias.
Esta tecnología se proporciona como vista previa y se mejorará en versiones futuras.
Configurar un contenedor de filtrado de hipótesis
Crear el contenedor
Haga clic en el bloque con la actividad de Deep Learning y seleccione Filter Hypotheses. Esto creará un nuevo contenedor de filtrado de hipótesis y colocará la actividad de Deep Learning seleccionada dentro de él.
Agregar más actividades de Deep Learning (opcional)
Arrastre más actividades de Deep Learning al contenedor de filtrado de hipótesis. Esto le permitirá combinar y comparar la salida de dos o más actividades de Deep Learning. Por ejemplo, pueden necesitarse dos actividades cuando se trabaja con campos de texto y tablas al mismo tiempo.
Agregar una actividad de Extraction Rules
Agregue una actividad de Extraction Rules al contenedor. Puede crear una actividad nueva haciendo clic en el placeholder o arrastrar una actividad existente al contenedor.
Configurar la actividad de Extraction Rules
Para cada uno de los valores encontrados por las actividades de Deep Learning, agregue un elemento de búsqueda de Deep Learning y configure sus propiedades. Puede agregar al mismo tiempo todos los output fields de una actividad de Deep Learning. Un elemento de búsqueda de Deep Learning admite todas las propiedades que limitan el área de búsqueda y las condiciones para encontrar el elemento.
Conectar el contenedor al workflow
Conecte la entrada y la salida del contenedor de filtrado de hipótesis a otros bloques del workflow de procesamiento de documentos. Los output fields del contenedor de filtrado de hipótesis serán los mismos que los output fields de la actividad de Extraction Rules.
Si decide dejar de controlar la salida de la actividad de Deep Learning, haga clic en cualquier parte del contenedor y seleccione Don’t Filter Hypotheses. El contenedor se desensamblará, pero las actividades en sí no se eliminarán, y podrá seguir utilizándolas en el workflow de procesamiento de documentos modificado.
Estos son solo algunos ejemplos que muestran cómo puede usarse un contenedor de Hypothesis Filtering. No obstante, hay muchas otras situaciones en las que puede emplear esta funcionalidad para controlar la salida de las redes neuronales y afinar la extracción de campos. Solo usted puede determinar qué ajustes se necesitan para los documentos con los que trabaja, y le recomendamos probar esta tecnología siempre que los resultados de la actividad de Deep Learning puedan beneficiarse de algún ajuste.
Los ejemplos a continuación usan la misma Habilidad de muestra, donde las salidas de dos actividades de Deep Learning se envían a una actividad de Extraction Rules.
- La actividad de Deep Learning extrae campos de texto.
- La actividad de Deep Learning 2 extrae una tabla.
- El contenedor de filtrado de hipótesis selecciona y combina sus resultados.
Cada elemento de búsqueda se asigna a su campo correspondiente.
Ejemplo 1: Corregir un valor encontrado por una actividad de Deep Learning
En este ejemplo, una actividad de Deep Learning encuentra un valor para el número de documento que es demasiado largo, y se crea un nuevo elemento de búsqueda para corregirlo.
El valor del número de documento encontrado por la actividad de Deep Learning incluye la parte que aparece después del guion:
- Para corregir el valor Document_Number, se crea un nuevo elemento de búsqueda. Este elemento de búsqueda, llamado DocNumber_Corrected, debe ubicarse dentro de la región del elemento de búsqueda Document_Number y contener un número limitado de caracteres.
- El área de búsqueda del nuevo elemento se restringe para que coincida con la región de Document_Number agregando la siguiente línea al código del elemento:
RestrictSearchArea: Document_Number.Region;
- El elemento de búsqueda corregido se asigna al campo que extrae el número de documento:
Como resultado, el número de documento extraído no incluirá la parte situada después del guion:
Ejemplo 2: Seleccionar uno de varios valores repetidos
En este ejemplo, se entrena una actividad de Deep Learning para encontrar todas las instancias del número de documento, pero el resultado final de la skill necesita solo un campo de número de documento. Para lograrlo, la configuración Permitir varios elementos se deshabilita para el campo Document Number y se especifican condiciones para seleccionar la instancia correcta del número de documento.
Recomendamos que primero guarde el conjunto de documentos etiquetados en una carpeta. Cuando deshabilite la configuración Permitir varios elementos para un campo, todas las instancias adicionales de ese campo se eliminarán del etiquetado. El modelo entrenado en la actividad de Deep Learning seguirá funcionando, pero si desea modificarlo y volver a entrenarlo, deberá cargar el conjunto de documentos original.
- La configuración Permitir varios elementos está deshabilitada para el campo Document Number (se puede acceder a la configuración haciendo clic en Manage Fields).
- El elemento de búsqueda Document_Number con múltiples instancias no se puede asignar al campo Document Number. Por lo tanto, se crea un nuevo elemento de búsqueda de Deep Learning a partir de la salida del número de documento de la actividad de Deep Learning y se asigna al campo Document Number.
- Las múltiples instancias del número de documento encontradas por la actividad de Deep Learning se utilizan para construir un árbol de hipótesis, del cual solo una se seleccionará como el valor del elemento de búsqueda Document_Number.
- Para encontrar una instancia concreta, se agregan ciertas condiciones para el elemento de búsqueda Document_Number (en este caso queremos encontrar la instancia más superior del número de documento).
Ejemplo 3: Combine la salida de dos actividades de Deep Learning
Un contenedor de filtrado de hipótesis le permite combinar los resultados de dos o más actividades de Deep Learning para compararlos entre sí o simplemente afinarlos dentro de la misma actividad.
En este ejemplo, se necesitaron dos actividades de Deep Learning porque una sola actividad de Deep Learning no puede entrenarse para extraer tanto campos de texto como tablas.
Se agrega una condición que especifica que el elemento de búsqueda Company_Address siempre debe encontrarse por encima del elemento de búsqueda Goods_Table. Como resultado, se encontrará la dirección correcta incluso si otras direcciones están impresas en la parte inferior de la página.