Skip to main content
Reguläre Ausdrücke werden in Wörterbüchern auf Basis regulärer Ausdrücke verwendet, um festzulegen, welche Wörter in einer Sprache zulässig sind und welche nicht.

Regeln für reguläre Ausdrücke

Das Alphabet der regulären Ausdrücke in ABBYY FineReader Engine ist in der folgenden Tabelle beschrieben:
  • Einige der in regulären Ausdrücken verwendeten Zeichen sind „Hilfszeichen“, d. h., sie werden für Systemzwecke verwendet. Wie Sie der obigen Liste entnehmen können, gehören dazu eckige Klammern, Punkte usw. Wenn Sie ein Hilfszeichen als normales Zeichen eingeben möchten, setzen Sie einen Backslash () davor. Beispiel: [t-v]x+ steht für Wörter wie „tx“, „txx“, „txxx“ usw., „ux“, „uxx“ usw., aber [t-v]x+ steht für Wörter wie „[t-v]x“, „[t-v]xx“, „[t-v]xxx“ usw. - Wenn Sie bestimmte Elemente eines regulären Ausdrucks gruppieren müssen, verwenden Sie Klammern. Zum Beispiel steht (a|b)+|c für „c“ und beliebige Kombinationen wie „abbbaaabbb“, „ababab“ usw. (ein Wort beliebiger Länge größer null, in dem beliebig viele a und b in beliebiger Reihenfolge vorkommen können), während a|b+|c für „a“, „c“ und „b“, „bb“, „bbb“ usw. steht.

Beispiele für reguläre Ausdrücke

Regulärer Ausdruck für Datumsangaben Die Zahl für den Tag kann aus einer Ziffer (z. B. 1, 2 usw.) oder aus zwei Ziffern (z. B. 02, 12) bestehen, sie darf jedoch nicht null sein (00 oder 0). Der reguläre Ausdruck für den Tag sieht dann so aus: ((|0)[1-9])|([12][0-9])|(30)|(31). Der reguläre Ausdruck für den Monat sieht wie folgt aus: ((|0)[1-9])|(10)|(11)|(12). Der reguläre Ausdruck für das Jahr sieht wie folgt aus: (((19)|(20))[0-9][0-9])|([0-9][0-9]). Nun bleibt nur noch, dies alles zusammenzuführen und die Zahlen durch einen Punkt zu trennen (z. B. 1.03.1999). Der Punkt ist ein Hilfszeichen, daher müssen wir ihm einen Backslash () voranstellen. Der reguläre Ausdruck für das vollständige Datum sieht dann so aus: (((|0)[1-9])|([12][0-9])|(30)|(31)).(((|0)[1-9])|(10)|(11)|(12)).((((19)|(20))[0-9][0-9])|([0-9][0-9])) Regulärer Ausdruck für E-Mail-Adressen Sie können ganz einfach ein Muster zum Erfassen von E-Mail-Adressen erstellen. Der reguläre Ausdruck für eine E-Mail-Adresse kann wie folgt aussehen: [a-zA-Z0-9_-.]+@[a-zA-Z0-9.-]+.[a-zA-Z]+

Für die Datenerfassung

Wenn Sie bei der Erkennung auf Feldebene reguläre Ausdrücke verwenden, müssen in der Regel nur die Wörter erkannt werden, die genau dem regulären Ausdruck entsprechen. In diesem Fall empfehlen wir, eine separate Sprache für die Felderkennung zu erstellen und dafür die folgenden Eigenschaften festzulegen:
  1. Als Erkennungsergebnisse dürfen nur Wörter aus dem Wörterbuch zugelassen werden: Setzen Sie die Eigenschaft IBaseLanguage::AllowWordsFromDictionaryOnly auf TRUE. Dies ist für die exakte Übereinstimmung erforderlich.
  2. Die Zeichenmenge der Erkennungssprache darf nur die Zeichen enthalten, die im regulären Ausdruck vorkommen: Geben Sie die Eigenschaft IBaseLanguage::LetterSet an. Dies ist erforderlich, da Zeichen aus dem Sprachalphabet auch dann erkannt werden können, wenn sie nicht dem regulären Ausdruck entsprechen.
  3. Setzen Sie die Eigenschaft IBaseLanguage::IsNaturalLanguage auf FALSE.

Windows-Beispiele

Siehe auch

Arbeiten mit Wörterbüchern RegExpDictionaryDescription