Skip to main content
FineParser repose sur ABBYY FineReader Engine, le SDK d’OCR et d’analyse de documents qu’ABBYY fournit aux éditeurs de logiciels et aux intégrateurs depuis plus de vingt ans. C’est ce même Engine qui reconnaît le texte, détecte les tableaux et détermine l’ordre de lecture dans chaque document que vous envoyez à /parse. Ce qu’apporte FineParser, c’est l’emballage : un conteneur Docker, un point de terminaison REST, un jeu figé de paramètres d’Engine éprouvés et des formats de sortie pensés pour les pipelines de traitement LLM. Cette page s’adresse aux lecteurs qui veulent savoir ce qu’il y a dessous, et dans quels cas il est pertinent de descendre d’un niveau pour travailler directement avec l’Engine.

Lien entre les deux produits

FineParser prend un petit nombre de décisions à votre place, de sorte que vous n’avez jamais à ouvrir un SDK. Il expose deux modes de reconnaissance, trois formats de sortie et un paramètre de langue, et maintient tout le reste constant. Ces valeurs par défaut proviennent des configurations recommandées par l’Engine lui-même pour l’extraction de données structurées et pour l’extraction rapide de texte : les résultats que vous obtenez avec FineParser sont donc ceux que produit FineReader Engine lorsqu’il est configuré comme ABBYY le recommande pour ces tâches. FineReader Engine, quant à lui, est une bibliothèque que vous liez à votre propre application. Il fonctionne sous Windows, Linux et macOS, et s’appelle depuis C++, C#, .NET, Java et les langages de script compatibles COM. Comme il s’agit d’une bibliothèque et non d’un service, rien n’est figé dans le pipeline de traitement. Chaque étape, du prétraitement de l’image à l’analyse de la structure, en passant par la reconnaissance et l’export, est exposée sous forme d’objets et de propriétés que votre code peut lire et modifier.

Quand FineParser suffit

La plupart des équipes qui développent des pipelines de traitement RAG, des outils d’agent ou des services d’ingestion documentaire n’ont besoin de rien d’autre que FineParser. Si votre objectif est de convertir des PDF et des images en DocLang, en JSON ou en texte brut avec une bonne restitution de la structure, et que vous souhaitez le faire à l’aide d’un conteneur et d’un appel HTTP plutôt que d’une dépendance compilée, alors FineParser est l’outil qu’il vous faut et vous pouvez arrêter votre lecture ici.

Quand envisager FineReader Engine

FineReader Engine s’impose lorsque la nature du problème ne se prête plus à un point de terminaison unique assorti de quelques paramètres. C’est généralement le cas dans les situations suivantes.
  • Vous intégrez la reconnaissance dans votre propre produit. FineReader Engine est concédé sous licence pour l’intégration dans des logiciels commerciaux et s’exécute in-process : aucun conteneur à déployer aux côtés de votre application, aucun aller-retour HTTP par document.
  • Vous avez besoin de formats de sortie que FineParser ne produit pas. L’Engine exporte vers les formats PDF avec recherche de texte et PDF/A, DOCX, XLSX, PPTX, HTML, ALTO, ABBYY XML, EPUB et bien d’autres, en plus de DocLang, JSON et texte brut. Voir Export Formats.
  • Vous avez besoin de fonctionnalités de reconnaissance qui dépassent le périmètre de FineParser. Il s’agit notamment de la reconnaissance de codes-barres 1D et 2D, de la capture de la zone lisible par machine des passeports et cartes d’identité, de la reconnaissance de champs manuscrits (ICR) dans les formulaires, de la reconnaissance de coches (OMR), de l’analyse de cartes de visite, de la classification de documents et de la comparaison de documents. Les scénarios d’utilisation de base de la documentation de l’Engine détaillent chacun de ces cas.
  • Vous devez adapter le pipeline de traitement à vos documents. Les modes de FineParser sont figés. Avec l’Engine, vous pouvez partir d’un profil prédéfini, puis ajuster individuellement les paramètres du prétraitement, de l’analyse, de la reconnaissance et de la synthèse — un point déterminant face à des mises en page inhabituelles, des numérisations dégradées ou un type de document très spécifique pour lequel les valeurs par défaut n’exploitent pas tout le potentiel d’exactitude.
  • Vous avez besoin de maîtriser le modèle de traitement. L’Engine met à votre disposition des primitives de traitement parallèle, l’itération page par page, la reconnaissance au niveau des régions, ainsi que la possibilité d’inspecter et de modifier la mise en page reconnue avant l’export. FineParser, lui, traite un document entier et en renvoie le résultat.
Si vous recherchez la simplicité de FineParser assortie d’un réglage au niveau de l’Engine, examinez FineParser Enterprise avant de vous engager dans une intégration de SDK. Enterprise conserve le conteneur et la REST API tout en ouvrant l’accès aux paramètres de traitement de l’Engine : vous pouvez ainsi ajuster la reconnaissance à vos documents sans développer avec l’API de l’Engine.

Licence

FineReader Engine fait l’objet d’une licence distincte de FineParser. Un forfait FineParser n’inclut pas de licence développeur ni de licence Runtime FineReader Engine, et les deux ne sont pas interchangeables. L’Engine est commercialisé par le service commercial d’ABBYY et ses partenaires, avec des options de licence reposant sur des modèles à la page, par cœur ou en ligne. Consultez Licence dans la documentation de l’Engine pour en comprendre le fonctionnement, ou contactez ABBYY pour échanger sur votre cas d’usage.

En savoir plus

Présentation de FineReader Engine 12

Le rôle de l’Engine, ses principales fonctionnalités et l’organisation de la documentation.

Scénarios d'utilisation de base

Mises en œuvre pas à pas de l’extraction de données, de l’extraction de texte, de la conversion, de l’archivage, et bien plus encore.

Utilisation des profils

Les profils prédéfinis et la marche à suivre pour créer votre propre configuration.

Référence de l'API

Tous les objets, interfaces, méthodes et énumérations de l’Engine.