OCR und Entity Linking verändern die Familiengeschichtsforschung, indem sie Dokumentbilder in durchsuchbare Hinweise verwandeln und wiederkehrende Personen, Orte, Daten und Beziehungen miteinander verknüpfen.
Ein Familienarchiv kann Urkunden, Verzeichnisse, Zeitungsausschnitte, Briefe, Fotografien und handschriftliche Notizen enthalten, deren Dateinamen kaum etwas verraten. OCR erzeugt durchsuchbaren Text; Entity Linking schlägt vor, dass „Juan Alvarez“ und „José Alvarez“ sich möglicherweise auf dieselbe Person beziehen. Wenn beides lokal ausgeführt wird, bleiben private Familienunterlagen unter Kontrolle, während der Weg zurück zu jedem Scan erhalten bleibt.
OCR macht aus Scans durchsuchbare Hinweise statt bloßer Behälter
Eine gescannte Seite ist zunächst ein Raster aus Pixeln. OCR segmentiert Zeilen und Zeichen, erkennt Text und speichert Positionen, über die sich ein Treffer auf einen Bereich im Bild zurückführen lässt. Dadurch werden ein Nachname, ein Beruf, eine Straße oder ein Zeuge durchsuchbar, selbst wenn zuvor niemand sie katalogisiert hat.
Ein praxisnaher Bericht zur Familienforschung zeigt, wie OCR digitalisierter Zeitungen Zeitungsreferenzen sichtbar machen kann, die bei herkömmlichen Suchmethoden unentdeckt blieben. Der Vorteil entsteht dadurch, dass Bildinhalte in möglichen Text umgewandelt werden, nicht dadurch, dass jedes erkannte Zeichen nachweislich korrekt ist.
Durchsuchbarer Text erweitert die Recherche, weil eine Suchanfrage viele Dokumenttypen durchsuchen kann. Das Bild bleibt jedoch der Beleg: OCR ist eine abgeleitete Ebene, deren Fehler sichtbar und korrigierbar sein sollten und die mit der genauen Seite oder dem Ausschnitt verknüpft sein muss, aus dem sie hervorgegangen ist.
Entity Linking schafft Verbindungen zwischen getrennten Aufzeichnungen
Entity Linking normalisiert Erwähnungen und bewertet, ob sie sich auf dieselbe Person, denselben Ort, dieselbe Organisation oder dasselbe Ereignis beziehen. Eine Geburtsurkunde, eine Zeile aus einer Volkszählung, eine Todesanzeige und ein Brief können unterschiedliche Schreibweisen verwenden, doch übereinstimmende Daten, Verwandte, Adressen und Berufe bilden ein Netz bestätigender Merkmale.
Forschungen zu Praktiken der Familienforschung zeigen, wie Genealoginnen und Genealogen Belege organisieren, zusammenarbeiten und mit nicht belegten Verbindungen in Online-Stammbäumen umgehen. Verknüpfungen funktionieren am besten, wenn sie Namen als eines von mehreren Signalen behandeln, statt eine naheliegende Identität in alle Aufzeichnungen zu übertragen.
Das Ergebnis ist ein navigierbarer Graph: Durch die Auswahl einer Person können zugehörige Dokumente, Orte und unsichere Aliasnamen angezeigt werden. Die Recherche wird schneller, weil das System mögliche Pfade vorschlägt, während die Forschenden weiterhin dafür verantwortlich sind, jede Identität zu akzeptieren, abzulehnen oder aufzuteilen.
Wo historische Texte und die Auflösung von Identitäten scheitern
Alte Schriften, Durchscheinen der Rückseite, beschädigte Seiten, Abkürzungen, wechselnde Grenzen, mehrfach vergebene Namen und uneinheitliche Altersangaben erzeugen Mehrdeutigkeiten. OCR-Fehler können einen wichtigen Nachnamen verfälschen; Entity Linking kann diesen Fehler anschließend verstärken, indem mehrere nicht verwandte Aufzeichnungen einem Profil zugeordnet werden. Mehr Verknüpfungen bedeuten nicht automatisch bessere Belege.
Eine OCR- und Verknüpfungsstudie zu der Verknüpfung historischer Aufzeichnungen stellte erhebliche Genauigkeitsunterschiede zwischen Textextraktion und der abschließenden Datensatzverknüpfung fest. Dies zeigt, dass einzelne Pipeline-Phasen unabhängig voneinander fehlschlagen. Auch ein hoher Übereinstimmungswert kann eine fehlerhafte Transkription oder eine unvollständige Referenzdatenbank übernehmen.
Die Aussage gilt nicht mehr, wenn dem Archiv unterscheidungskräftige Merkmale fehlen oder das Modell Alternativen verbirgt. In diesem Grenzbereich sollten mehrere Kandidaten beibehalten, die beitragenden Felder angezeigt und eine probabilistische Übereinstimmung nicht in eine Tatsache des Stammbaums umgewandelt werden.
Eine vorgeschlagene Familienverbindung überprüfen
Wählen Sie eine mögliche Verbindung aus und erstellen Sie ein kleines Belegpaket: die Originalbilder, den OCR-Text, normalisierte Namen, Daten, Orte, Beziehungen und den Übereinstimmungswert des Modells. Kennzeichnen Sie, welche Felder übereinstimmen, widersprüchlich oder nicht vorhanden sind, und unterscheiden Sie zwischen Informationen, die aus einem anderen Stammbaum übernommen wurden, und Informationen, die in einem Dokument sichtbar sind.
Wenden Sie die für die Herkunftskette von Familienarchiven beschriebene Provenienzdisziplin an: Jede Aussage sollte ihr Dokument, ihre Version und ihren Transformationspfad bewahren. Prüfen Sie entscheidende Textstellen erneut anhand des Scans und suchen Sie nach mindestens einem unabhängigen Dokument, das nicht zur Erstellung der ursprünglichen Übereinstimmung verwendet wurde.
Akzeptieren Sie die Verbindung nur, wenn die Identität durch mehrere übereinstimmende Merkmale gestützt wird und kein ungelöster Widerspruch die Schlussfolgerung verändert. Andernfalls kennzeichnen Sie sie als Recherchehinweis. So bleibt die Recherche schnell, ohne dass eine OCR-Vermutung zur übernommenen Gewissheit wird.
Tech- & KI-Zentrum
Mehr zum Lesen

Kalibrierung des Scores für die private Suche: Wie aus roher Ähnlichkeit ein brauchbares Vertrauenssignal wird
Erfahre, warum die Kosinusähnlichkeit keine Konfidenz darstellt, wie beschriftete Abfragen Punktzahlen kalibrieren und wie du Schwellenwerte überwachst, wenn sich ein privates Korpus verändert.

Lokale KI-NUMA-Lokalität: Warum die Speicherplatzierung die Datenzufuhrrate des Beschleunigers verändert
Erfahren Sie, wie CPU-, RAM- und PCIe-Topologien die Versorgung von Beschleunigern beeinflussen, warum die automatische Platzierung variieren kann und wie Sie die NUMA-Bindung sicher...

Speicherzuordnung von Modelldateien: Wie gemeinsam genutzte Seiten den doppelten RAM-Verbrauch reduzieren
Verstehen Sie, wie zugeordnete Modellseiten ausgelagert und gemeinsam genutzt werden, warum RSS irreführend sein kann und welche Caches und Puffer weiterhin RAM pro Prozess...

