Static Text est un élément de FlexiLayout qui décrit un texte prédéfini. Ce texte peut se composer d’un mot ou d’une expression. Les expressions se distinguent des mots par le fait qu’elles contiennent au moins un espace. Une expression peut être écrite sur plusieurs lignes.
Les éléments Static Text sont marqués par
dans l’arborescence FlexiLayout.
Le programme utilise les éléments Static Text pour rechercher du texte statique, c’est-à-dire du texte connu à l’avance. Il considère comme candidats au texte statique les objets Recognized Words et Recognized Lines détectés lors de la préreconnaissance et situés dans la zone de recherche de l’élément.
En général, toutes les images du batch, ou du moins un grand nombre d’entre elles, contiennent du texte statique. Il peut s’agir de l’en-tête du document (par ex. Facture) ou du nom de champs (par ex. Date, À :, De :).
De tels objets, détectés comme Recognized Words lors de la préreconnaissance, servent généralement de « repères » lors de la recherche de tout texte pouvant être saisi dans les champs correspondants. Par exemple, il est naturel de s’attendre à trouver une date à côté du texte statique « Date ».”
Propriétés de l’élément Static Text
Les propriétés d’un élément Static Text sont définies dans l’onglet Static Text de la boîte de dialogue Propriétés de l’élément.
Pour ouvrir la boîte de dialogue Propriétés, cliquez avec le bouton droit sur l’élément dans l’arborescence FlexiLayout, puis sélectionnez Propriétés… dans le menu contextuel.
Le texte à rechercher dans l’image.
Si vous devez rechercher une expression ou plusieurs mots et que vous savez qu’ils se trouveront toujours sur la même ligne, ignorez les espaces (laissez l’option Take spaces into account décochée) pour accélérer la recherche.
Dans ce cas, vous pouvez saisir votre expression de recherche sans espaces. Le programme les supprime de toute façon lorsque l’option Take spaces into account n’est pas sélectionnée. Par exemple, pour trouver le nom « Purchase Agreement », qui est écrit sur une seule ligne dans tous les documents, saisissez PURCHASEAGREEMENT.
Utilisez une barre verticale (le symbole |) pour séparer les variantes. Par exemple, si des documents similaires peuvent porter des noms tels que Contrat ou Accord, saisissez CONTRACT|AGREEMENT.
Les variantes d’expressions sont placées entre accolades et séparées par une barre verticale, sous la forme { }|{ }. Vous pouvez répertorier des variantes de mots au sein d’expressions (l’option Take spaces into account doit être sélectionnée).
Par exemple, si vous saisissez {SALE|PURCHASE AGREEMENT|CONTRACT}|{CUSTOMER|CLIENT APPLICATION} dans le champ Texte de recherche, le programme recherche les expressions suivantes : sale agreement, purchase agreement, sale contract, purchase contract, customer application et client application.
Pour saisir de longues chaînes, cliquez sur
pour ouvrir une fenêtre de saisie distincte.
Recherche de texte à partir de la base de données
Recherchez dans votre image un fragment de texte provenant d’une base de données. Une requête SQL commençant par la commande SELECT recherche les champs appropriés dans la table. Le programme recherche ensuite dans l’image le texte contenu dans le champ trouvé.
Définir la chaîne de connexion
Dans le champ Connection string, saisissez la chaîne de connexion à la base de données, ou cliquez sur
pour ouvrir la boîte de dialogue standard de connexion à la base de données. Saisir la requête
Dans le champ Texte de requête, saisissez votre requête. Vous pouvez également cliquer sur
pour ouvrir une fenêtre de saisie distincte.
Recherche de texte à partir d’un fichier
Recherchez dans votre image un fragment de texte provenant d’un fichier. Cliquez sur le bouton Browse… pour sélectionner le fichier. Pour plus d’informations, consultez Bases de données et fichiers texte dans le langage FlexiLayout.
Le nombre maximal d’erreurs dans le mot. Le programme vérifie chaque mot de l’expression si les mots de l’expression sont séparés par des espaces. Sinon, l’expression est considérée comme un seul mot.
Si le nombre d’erreurs dans un mot est supérieur au nombre spécifié dans ce champ, le mot est considéré comme non détecté. Une erreur correspond à une opération de suppression, d’insertion ou de remplacement nécessaire pour faire correspondre le texte au texte saisi dans le champ Texte de recherche. Par défaut, cette propriété est illimitée.
Par exemple, supposons que le champ Texte de recherche contienne le mot « meet » et que le nombre maximal d’erreurs soit défini sur 1. Si le programme trouve le mot « moot » dans cette zone de recherche, il y a 2 erreurs dans le mot ; « meet » est donc considéré comme non trouvé.
Le pourcentage maximal d’erreurs dans le mot (calculé comme le rapport entre le nombre d’erreurs dans l’hypothèse et le nombre de lettres dans l’hypothèse). Si le pourcentage d’erreurs dans un mot est supérieur au pourcentage spécifié dans ce champ, le mot est considéré comme non détecté.
La valeur par défaut est de 30 %. Si vous spécifiez à la fois le nombre maximal d’erreurs et le pourcentage maximal d’erreurs, le programme utilise le critère le plus strict et ignore l’autre.
Définit la longueur maximale de l’espace à l’intérieur de l’objet détecté.
Recherche uniquement des mots entiers.
Active la recherche sensible à la casse (le programme distingue les lettres minuscules des majuscules).
Autorise les espaces dans la chaîne de recherche. Si cette option n’est pas sélectionnée, les espaces sont supprimés de la chaîne de recherche, ce qui accélère la recherche.
Toutefois, si votre expression de recherche peut se trouver sur plusieurs lignes, ou si certains mots de l’expression peuvent être absents, activez l’option Take spaces into account et saisissez votre expression de recherche en conservant les espaces.
Les options suivantes sont disponibles uniquement si Take spaces into account est sélectionnée :
Chaque pénalité est un nombre compris entre 0 et 1. Le programme multiplie la qualité de l’hypothèse par la pénalité pour chaque saut de ligne ou mot manquant dans l’expression. Pour autoriser les sauts de ligne ou les mots manquants sans réduire la qualité de l’hypothèse, définissez la pénalité sur 1, car multiplier la qualité par 1 ne la modifie pas.
Recommandations pour créer un élément Static Text
Comme le texte statique est connu à l’avance, un élément Static Text peut être utilisé comme élément de référence pour rechercher d’autres objets d’image.
Suivez les recommandations ci-dessous :
-
Pour vous assurer que le texte statique sélectionné peut être reconnu de façon fiable sur toutes les images, affichez les résultats de la préreconnaissance en cliquant sur
ou
pour les mots et les expressions, respectivement. Assurez-vous que les lettres sont correctement regroupées en mots et que les mots sont correctement regroupés en lignes.
-
Il est préférable de sélectionner un texte statique imprimé en gros caractères, qui reste identique même sur des numérisations de mauvaise qualité, ou dont le nombre d’erreurs d’OCR est prévisible.
-
Si les documents ne contiennent qu’un texte statique en petits caractères qui ne peut pas être reconnu de manière fiable lors de la préreconnaissance (c’est-à-dire si le nombre et les types d’erreurs varient fortement d’une image à l’autre), décrivez ces fragments de texte comme Object Collection, avec les options Text et Punctuation mark sélectionnées, plutôt que comme Static Text.
Vous devrez peut-être également sélectionner l’option Picture. Cliquez sur
(Raw Objects) dans la barre d’outils, puis sélectionnez l’objet correspondant sur l’image. Le type de l’objet apparaît sur la ligne DataType dans la fenêtre Propriétés.
-
Il est préférable de sélectionner des fragments de texte statique uniques afin d’éviter les fausses correspondances et de limiter au minimum les contraintes de recherche supplémentaires.
-
S’il existe à la fois des noms constitués d’un seul mot (que vous comptez trouver à l’aide d’éléments Static Text) et des noms composés de plusieurs mots contenant les mêmes mots que ces noms d’un seul mot, créez d’abord les éléments pour les expressions. Cela évite que le programme détecte à tort des noms d’un seul mot à l’intérieur de noms composés de plusieurs mots.
Recommandations pour les langues chinoise, japonaise et coréenne
Pour les chaînes de caractères en chinois, en japonais et en coréen, vous pouvez utiliser un paramètre de recherche. Ce paramètre influe sur la manière dont le programme compte le nombre d’erreurs dans l’hypothèse trouvée par rapport à la valeur spécifiée dans l’élément Texte de recherche.
Lorsque ce paramètre est activé, seuls des caractères de forme similaire peuvent être utilisés comme caractères de remplacement. Les opérations d’insertion, de suppression et de remplacement comptent chacune comme une erreur.
Le remplacement d’un caractère par un caractère similaire compte donc comme une erreur, tandis que son remplacement par un caractère de forme différente compte comme deux erreurs, car deux opérations sont effectuées : la suppression d’un caractère et l’insertion d’un nouveau.
Ce mode de recherche n’affecte que les chaînes de caractères en chinois, en japonais et en coréen.
Pour ces langues, la recherche par mot entier n’est pas disponible, car les textes ne sont souvent pas explicitement divisés en mots.
Pour activer ce mode de recherche, saisissez le code suivant dans le volet relations avancées de pré-recherche de l’onglet Avancé :
Par défaut, le paramètre SuggestOnlySimilarChars a pour valeur false.