Skip to main content
FineParser は、AI パイプライン向けのセルフホスト型ドキュメントパーサーです。CPU ハードウェア上で単一の Docker コンテナーとして動作し、シンプルな REST API を公開します。ドキュメントを送信すると、その構造とテキストを DocLang、JSON、またはプレーンテキストとしてダウンロードできます。クラウドアカウントも GPU も不要で、ドキュメントデータが自社インフラストラクチャの外に出ることはありません。 ABBYY FineReader Engine の認識コアを基盤としており、SDK を統合せずに本番品質の解析を利用したい開発者向けにパッケージ化されています。

クイックスタート

コンテナーを実行し、5 分以内に最初のドキュメントを解析します。

構成

認識モード、言語、ポートについて。

REST API

ドキュメントを送信し、ジョブをポーリングして、結果をダウンロードします。

出力形式

DocLang、JSON、プレーンテキスト。

機能概要

FineParser は、テキストだけでなく文書の構造そのものを復元します。テーブル (罫線のないものを含む) 、段組みレイアウト、見出し、読み取り順序、階層構造までを対象とします。手書き文字、チェックボックス、画像もテキストとあわせて認識されます。出力結果は、RAG への取り込み、エージェントによるワークフロー、LLM のプロンプトにそのまま利用できます。

導入する理由

  • テーブル、列、見出しをそのまま保持し、それぞれがページ上のどこにあるかも示します。
  • LLMへの入力用に設計されたコンパクトな形式DocLangを出力します (推奨形式) 。JSONやプレーンテキストも利用できます。
  • CPUハードウェア上で単一コンテナーとして動作し、自社のマシンでも自社のクラウドでも実行できます。
  • 認識モードは2種類。大量処理向けの高速モードと、精度を最優先する高忠実度モードです。
  • ラテン文字、キリル文字、CJK、アラビア文字など、200を超える言語を認識します。
  • まずは無料プランから始め、処理量の増加に応じて有料プランへ移行できます。高いスループットやオフライン展開が必要な場合はエンタープライズもご利用いただけます。