Zum Hauptinhalt springen
Zeichenkette ist ein Element eines FlexiLayouts, das eine Folge von Zeichen beschreibt, die in einer Zeile von links nach rechts geschrieben werden. Zeichenketten können aus Wörtern oder Wortteilen bestehen. Zeichenkette-Elemente sind im FlexiLayout-Baum mit Symbol für Character String-Element gekennzeichnet. Zeichenkette-Elemente werden verwendet, um nach nicht näher angegebenem Text zu suchen. Dabei berücksichtigt das Programm die Erkannte Wörter-Objekte, die während der Vorerkennung im Suchbereich des Elements erkannt wurden, als Kandidaten. Normalerweise befinden sich Zeichenketten neben statischem Text. Wenn das Programm beispielsweise nach der Ref.-Nr. eines Dokuments sucht, muss es zuerst den statischen Text „Ref. No.“ finden und dann daneben nach Ziffern suchen.

Den Suchtext beschreiben

Klicken Sie im Dialogfeld Eigenschaften auf die Registerkarte Zeichenkette, um das entsprechende Objekt zu beschreiben. Um das Dialogfeld Eigenschaften zu öffnen, klicken Sie im FlexiLayout-Baum mit der rechten Maustaste auf das Element und wählen im Kontextmenü Properties… aus.
Screenshot der Registerkarte „Zeichenkette“ im Dialogfeld „Eigenschaften“ des Elements in ABBYY FlexiLayout Studio.
Der zu findende Text kann auf zwei Arten beschrieben werden.

Suchtext mithilfe eines regulären Ausdrucks beschreiben

Ein regulärer Ausdruck definiert mögliche Kombinationen von Zeichen. Wenn Sie einen regulären Ausdruck verwenden, muss die Hypothese die darin festgelegten Bedingungen erfüllen. Diese Methode wird in der Regel bei Dokumenten guter Qualität verwendet, die fehlerfrei erkannt werden. Um einen regulären Ausdruck einzugeben, wählen Sie die Option Regulärer Ausdruck aus und geben Sie den Ausdruck in das danebenliegende Feld ein. Sie können auch auf die Schaltfläche Schaltfläche für Optionen für reguläre Ausdrücke klicken. Daraufhin wird eine Dropdown-Liste mit Optionen geöffnet (Beliebiger Buchstabe, Zeichen aus Menge usw.). Wählen Sie die Option aus, um den entsprechenden regulären Ausdruck in das Feld einzugeben.

Syntax für reguläre Ausdrücke

Name in der ListeSymbol im FeldBeispiel
Beliebiges Zeichen*“k”*“t” – erlaubt ‘kit’, ‘kat’ usw.
BuchstabeCC”at” – erlaubt cat, bat, Rat, mat usw.
GroßbuchstabeAA”at” – erlaubt Cat, Bat, Rat, Mat usw.
Kleinbuchstabeaa”at” – erlaubt cat, bat, rat, mat usw.
Buchstabe oder ZifferXX – erlaubt einen beliebigen einzelnen Buchstaben oder eine beliebige einzelne Ziffer.
ZifferNN”th” – erlaubt 5th, 4th, 6th usw.
string"""cat”
Oder”dr”(“i""u”)“nk” – erlaubt “drink” oder “drunk”.
Zeichen aus der Menge[][hm]“at” – erlaubt ‘hat’ oder ‘mat’.
Zeichen nicht aus der Menge[^][^b]“at” – erlaubt ‘cat’, ‘mat’, ‘rat’, aber nicht bat.
Beliebige Anzahl von Wiederholungen (gilt für den Ausdruck oder Teilausdruck links){-}[AB74]{-} – erlaubt jede beliebige Kombination aus A, B, 7 und 4 in beliebiger Länge.
Anzahl der Wiederholungen ist n{n}N{2}“th” – erlaubt 25th, 84th, 11th usw.
n bis m Wiederholungen{n-m}N{1-3}“th” – erlaubt 5th, 84th, 111th usw.
0 bis n Wiederholungen{-n}N{-2}“th” – erlaubt th, 84th, 4th usw.
n oder mehr Wiederholungen{n-}N{2-}“th” – erlaubt 25th, 834th, 311th, 34576th usw.
Teilausdruck()

Suchtext mit einem Alphabet beschreiben

Ein Alphabet listet Zeichen auf, die im Suchtext vorkommen können. Diese Methode wird verwendet, wenn sich die Zeichenkette nicht mit einem regulären Ausdruck beschreiben lässt oder wenn der erkannte Text aufgrund schlechter Bildqualität zu viele Fehler enthält. Sie können für ein Element vom Typ Zeichenkette mehrere Alphabete angeben. Wenn das Format des Textes unbekannt ist, werden keine Alphabete angegeben. In diesem Fall berücksichtigt das Programm bei der Suche nach dem dem Element entsprechenden Objekt alle möglichen Zeichen. So beschreiben Sie Suchtext mit einem Alphabet:
  1. Wählen Sie einen Modus für die Hypothesengenerierung aus. Um mithilfe der Zeichen im Suchbereich alle möglichen Hypothesen zu generieren, einschließlich sich überschneidender und eingebetteter Hypothesen, wählen Sie Eingebettete Hypothesen zulassen. Um Hypothesen maximaler Länge zu generieren, deaktivieren Sie Eingebettete Hypothesen zulassen.
  2. Erstellen Sie ein oder mehrere Alphabete.
So erstellen Sie ein Alphabet:
  1. Klicken Sie auf Add….
  2. Wählen Sie im Dialogfeld Add New Alphabet die gewünschte Codepage aus der Liste Code page aus.
  3. Wählen Sie in der Character map die Zeichen aus, die im Suchtext vorkommen. Die ausgewählten Zeichen und ihre Anzahl werden im Feld Selected on screen/selected in all angezeigt.
  4. Geben Sie im Feld Percentage of alphabet characters den erforderlichen Prozentsatz an Alphabetzeichen im Suchtext an.
Sie können mehrere Alphabete angeben, sie dürfen sich jedoch nicht überschneiden, also nicht dieselben Zeichen enthalten.
Um ein Alphabet zu löschen, wählen Sie es in der Liste Alphabets aus und klicken Sie auf Delete. Um Alphabetzeichen hinzuzufügen oder zu löschen, wählen Sie das gewünschte Alphabet in der Liste Alphabets aus und klicken Sie dann auf Edit…. Geben Sie im Feld Percentage of non-alphabet characters den zulässigen Prozentsatz an Zeichen an, die zu keinem der Alphabete gehören. Je nach der Methode, mit der der Suchtext beschrieben wird, müssen Sie möglicherweise die folgenden Eigenschaften angeben:
  1. Wählen Sie Whole words only, um nur ganze Wörter zu finden.
  2. Verwenden Sie die Option Detect words by interword space, um festzulegen, wie Zeilen in Wörter unterteilt werden. Deaktivieren Sie diese Option, um Wörter automatisch zu erkennen. Wenn diese Option aktiviert ist, wird eine Zeile immer dann in Wörter unterteilt, wenn der Abstand zwischen benachbarten Zeichen größer oder gleich dem in Min interword space eingegebenen Wert ist.
    Bei der automatischen Worterkennung werden Wortenden anhand von Leerzeichen oder anderen Symbolen erkannt, die Wörter voneinander trennen (z. B. ,, ;, /, ? – die genaue Symbolmenge hängt von der ausgewählten Vorerkennungssprache ab), oder anhand anderer Attribute. Um sicherzustellen, dass das Programm Zeilen korrekt in Wörter unterteilt, prüfen Sie die Textobjekte in den Testbildern (View → Images → Objects → erkanntes Wort).
  3. Geben Sie in den Feldern Word count die Anzahl der Wörter in der Zeichenkette an. Die Anzahl der Wörter wird mit einem Fuzzy-Intervall angegeben. Das Standardintervall ist {-1,-1,INF,INF} (das heißt, das Programm sucht nach Hypothesen mit einer beliebigen Anzahl von Wörtern).
  4. Geben Sie im Feld Max. Leerraumlänge die maximale Länge des Leerzeichens innerhalb des Objekts an. Sie wird in benutzerdefinierten Maßeinheiten gemessen. Sie können die Länge des Leerzeichens abschätzen, indem Sie sich die Koordinaten der benachbarten Objekte ansehen. Bewegen Sie den Mauszeiger auf ein benachbartes Objekt, um dessen Koordinaten in der Statusleiste anzuzeigen. Bei der Textsuche werden der Zeichenkette so lange Zeichen hinzugefügt, bis die Distanz zwischen benachbarten Elementen Max. Leerraumlänge überschreitet.
  5. Geben Sie im Feld Character count die Länge der Zeichenkette an (also die Anzahl der Zeichen in der Zeichenkette). Die Anzahl der Zeichen wird mithilfe eines Fuzzy-Intervalls angegeben, und die Qualität der Hypothese wird anhand ihrer Länge bewertet. Verwenden Sie die Schaltfläche Schaltfläche Durchsuchen, um Fuzzy-Intervalle in einem separaten Fenster anzugeben, in dem sie visualisiert werden.