Skip to main content
En este artículo se describen los tipos de normalización disponibles al agregar columnas de una base de datos externa a un conjunto de datos en una Definición de Document de FlexiCapture for Invoices, así como su configuración. La normalización cambia el formato de valores que se escriben de forma diferente, pero que esencialmente significan lo mismo, y garantiza un formato uniforme para que puedan compararse. Por ejemplo, el nombre y la dirección de una empresa pueden escribirse de varias maneras. Como estos valores se refieren a la misma empresa y dirección, deben normalizarse para que el programa pueda compararlos correctamente. El tipo de normalización puede especificarse para cada columna de un conjunto de datos al asignarla a una columna de una base de datos externa. La normalización solo se aplica a los valores almacenados en el conjunto de datos (la opción Cache data debe estar habilitada en las propiedades del conjunto de datos). Los valores de la base de datos externa no se modifican. FlexiCapture for Invoices ofrece dos tipos de normalización para los valores del conjunto de datos.

Normalización de texto

Este tipo de normalización es útil al comparar cadenas como nombres de empresa y direcciones.
  1. Los espacios en blanco (incluidos los caracteres de nueva línea y tabulación) y los símbolos de separación se sustituyen por espacios normales.
  2. Los puntos usados como separadores (puntos colocados entre palabras) se sustituyen por espacios, y los puntos de las abreviaturas se eliminan.
  3. Los símbolos de conjunción (&, +, -, /, ~) se normalizan:
    • Las secuencias de palabras que comienzan con una palabra de una sola letra y están separadas por el mismo símbolo de conjunción se unen en una sola palabra. Por ejemplo, R & D se convierte en R&D.
    • En todos los demás casos, los símbolos de conjunción se sustituyen por espacios. Por ejemplo, Procter&Gamble se convierte en Procter Gamble.
  4. Se eliminan los espacios dobles.
  5. Se utiliza una lista predefinida para separar palabras. Por ejemplo, CoKG se divide en Co KG.
  6. Los espacios del texto reconocido se usan para dividirlo en palabras independientes.
  7. Se utiliza una lista predefinida para sustituir los sufijos de cada palabra. Por ejemplo, puede reemplazar el sufijo strasse por el sufijo str.
  8. Las secuencias de palabras se sustituyen automáticamente según una lista predefinida. Por ejemplo, puede reemplazar la palabra Limited por la abreviatura Ltd.
Los parámetros de normalización se especifican en el archivo Normalization.xml, que se almacena en la carpeta del proyecto.
El algoritmo de normalización puede sufrir cambios importantes en futuras versiones del programa.

Modificar la configuración de normalización

Puede modificar el archivo Normalization.xml después de crear el conjunto de datos (por separado para cada conjunto de datos). Para modificar la configuración de normalización estándar:
1

Descargar el archivo de configuración

Descargue el archivo de configuración con el comando DownloadNormalizationSettings de FCAdminTools.
2

Editar la configuración

Realice los cambios necesarios.
3

Cargar el archivo de configuración

Cargue el archivo de configuración con el comando UpdateNormalizationSettings de FCAdminTools.
Después de actualizar el archivo de configuración, debe actualizar el conjunto de datos. Para obtener más información, consulte Updating data sets.

Normalización de códigos alfanuméricos

Este tipo de normalización resulta útil para comparar códigos alfanuméricos, como números de ID tributaria, cuentas bancarias y códigos postales. Se eliminan todos los símbolos excepto los números y las letras, lo que permite comparar valores ignorando espacios, guiones, barras y otros caracteres arbitrarios que puedan contener. Cuando se aplica la normalización, la opción Store normalized value pasa a estar disponible al asignar la columna del conjunto de datos a una columna de una base de datos externa.
  • Cuando esta opción está activada, los valores normalizados se almacenan en el conjunto de datos.
  • Cuando esta opción está desactivada, los valores originales de la base de datos externa se copian en el conjunto de datos.
Esta opción no afecta a la extracción de datos ni a las comprobaciones automáticas, pero sí determina qué valor se muestra cuando un usuario busca una entrada en un diccionario.