Skip to main content
Les opérateurs de vérification peuvent améliorer l’extraction de données en réentraînant les modèles NLP. Lorsque FlexiCapture ne parvient pas à détecter un champ ou confond un champ avec un autre, l’opérateur indique le champ approprié et réentraîne le modèle. FlexiCapture utilise alors le modèle réentraîné pour une extraction plus précise.
L’entraînement supplémentaire n’est pas disponible pour les modèles NLP chargés dans les définitions de document.

Démarrer l’entraînement pendant la vérification

Lancez l’entraînement de l’une des deux manières suivantes :
  • Ajoutez une étape d’entraînement après l’étape de vérification. L’entraînement démarre lorsque les conditions définies pour le lot d’entraînement sont remplies. Pour plus d’informations, voir Configuration du workflow.
  • Envoyez manuellement des documents à l’étape d’entraînement : cliquez avec le bouton droit sur le document dans le lot de travail et sélectionnez Entraîner.

Fonctionnement de l’entraînement

  • Lorsque l’entraînement démarre, FlexiCapture crée un lot d’entraînement générique (s’il n’en existe pas déjà) et y copie tous les documents de la définition de document, quelle que soit leur variante.
  • Chaque document se voit attribuer le statut Pour l’entraînement ou Pour les tests.
  • Les documents marqués Pour l’entraînement sont utilisés pour créer un nouveau modèle NLP.
  • Le nouveau modèle est testé sur les documents marqués Pour les tests.
  • Si les performances du nouveau modèle ne sont pas inférieures à celles du modèle existant, il le remplace. Dans le cas contraire, il est rejeté.
Si certains documents présentent les mêmes champs, mais à des emplacements très différents, créez des lots d’entraînement distincts pour chaque variante afin d’améliorer la reconnaissance.

Créer un lot d’entraînement pour un fournisseur ou une variante spécifique

1

Ouvrir le projet

Dans Project Setup Station, ouvrez le projet avec le modèle NLP. Pour plus d’informations, consultez Créer des modèles NLP.
2

Ouvrir les lots d’entraînement à l’extraction des champs

Sélectionnez Entraînement des champs → Ouvrir les lots d’entraînement à l’extraction des champs, appuyez sur Ctrl+Alt+B ou sélectionnez Lots d’entraînement à l’extraction des champs dans le menu contextuel.
3

Créer le lot

Sélectionnez Fichier → Nouveau lot (ou appuyez sur Ctrl+N). Choisissez la définition de document et la variante, puis sélectionnez Lot NLP dans le menu contextuel.
4

Ajouter des documents et entraîner

Ajoutez vos documents, reconnaissez-les, modifiez l’ordre des sections et lancez l’entraînement à l’aide de Entraîner dans le menu contextuel, de Ctrl+F7 ou du bouton Entraîner le lot dans la barre d’outils.
La qualité d’un modèle NLP entraîné dépend du nombre de documents d’entraînement et de la qualité de leur balisage :
  • Marquez chaque champ décrit par la définition de document dans les documents d’entraînement.
  • Incluez entre 100 et 500 documents dans chaque lot d’entraînement. Cette plage permet à FlexiCapture de choisir les meilleurs paramètres sans ralentir l’entraînement.
Lorsque les retours des opérateurs sont utilisés pour l’entraînement, les nouveaux documents sont ajoutés à la fois au lot d’entraînement et au lot de variantes :
  • Pour une variante disposant de son propre lot d’entraînement, le modèle créé pour ce lot est utilisé.
  • Pour toutes les autres variantes, le modèle créé pour le lot d’entraînement générique est utilisé.
Si un document identique à un document déjà présent dans un lot d’entraînement est ajouté depuis la même source, il remplace l’ancien document, et ce remplacement est consigné dans le journal des tâches en arrière-plan. FlexiCapture utilise les paramètres d’enregistrement du document pour déterminer s’il s’agit d’une copie.

Paramètres du lot d’entraînement

Après avoir créé le lot, sélectionnez Afficher les paramètres du lot NLP pour définir les options suivantes.

Exporter les statistiques d’entraînement

Une fois l’entraînement terminé, vous pouvez exporter les statistiques d’un modèle NLP, notamment :
  • Les paramètres du lot d’entraînement.
  • Des informations sur les nouveaux et anciens modèles NLP.
  • La durée de l’entraînement.
  • La version du composant NLP utilisée.
  • Les statistiques d’entraînement des documents et d’extraction des champs.
  • Le degré d’actualité des données exportées. Si le paramètre isActual est défini sur false, le lot a été modifié après l’entraînement (ajout ou suppression de documents, modification du balisage, etc.). Relancez l’entraînement pour obtenir des statistiques à jour.
Pour exporter le journal, cliquez avec le bouton droit sur le lot, puis sélectionnez Exporter les statistiques d’extraction des champs dans le menu contextuel et indiquez l’emplacement où enregistrer le fichier CSV.