Was es noch nie gesehen hat? Talkie-1930 und der Einstein-Test

Eva Wong ist die Technische Redakteurin und und leidenschaftliche Tüftlerin bei ZimaSpace. Eine lebenslange Geek mit einer Leidenschaft für Homelabs und Open-Source-Software, sie spezialisiert sich darauf, komplexe technische Konzepte in zugängliche, praktische Anleitungenzu übersetzen. Eva ist der Meinung, dass Self-Hosting Spaß machen und nicht einschüchternd sein sollte. Durch ihre Tutorials befähigt sie die Community, Hardware-Setups zu entmystifizieren, vom Bau ihres ersten NAS bis hin zur Beherrschung von Docker-Containern.

Talkie-1930 ist ein Sprachmodell mit 13 Milliarden Parametern, das gezielt mit Informationen aus der Zeit vor 1931 trainiert wurde. Sein Zweck ist kein historisches Rollenspiel. Die Forscher wollen mit dem Modell eine deutlich schwierigere Frage untersuchen: Wenn eine KI die bekannte Antwort während des Vortrainings nie gesehen hat, kann sie sich dann dennoch zu etwas hin vorarbeiten, das Menschen erst später entdeckt haben?

Das macht Talkie für die Debatte über Schlussfolgern versus Auswendiglernen besonders relevant. Moderne Modelle könnten während des Trainings auf Benchmark-Fragen, Lösungen, Fachartikel, GitHub-Repositories oder Erklärungen gestoßen sein. Ein historisches Modell ermöglicht ein saubereres Experiment, indem die Antwort auf die andere Seite einer zeitlichen Grenze verlegt wird.

Was ist Talkie-1930?

Talkie ist eine Familie „vintage“-Sprachmodelle, die von Nick Levine, David Duvenaud und Alec Radford entwickelt wurden. Das Team stellte Talkie-1930 2026 vor und verwendete dafür einen Korpus, der ausschließlich Informationen enthalten sollte, die vor 1931 veröffentlicht wurden.

Spezifikation Talkie-1930
Parameter 13B
Vortrainingsdaten 260 Mrd. Token
Beabsichtigter Stichtag 31. Dezember 1930
Quellen Bücher, Zeitungen, Zeitschriften, Patente, Gerichtsentscheidungen und Periodika
Basismodell Verfügbar
Instruktionsmodell Verfügbar
Lizenz Apache 2.0
Lokale Inferenz Unterstützt

Die Forscher trainierten außerdem ein modernes Gegenstück mit derselben Architektur und vergleichbarem Trainingsaufwand, jedoch mit modernen FineWeb-Daten. Dadurch eignet sich Talkie dazu, nicht nur zu untersuchen, was ein Modell weiß, sondern auch, wie stark seine Fähigkeiten durch seine Informationsumgebung geprägt werden.

Dies ergänzt die umfassendere Frage nach offenen Modellen im Vergleich zu Frontier-KI: Die Modellfähigkeit hängt nicht allein von der Anzahl der Parameter ab.

Warum eine KI trainieren, die nichts nach 1930 weiß?

Der Hauptgrund ist eine kontaminationsresistente Evaluierung.

Wenn ein modernes Modell ein berühmtes Problem löst, können Forscher nicht immer feststellen, ob es:

  • die Antwort hergeleitet hat;
  • verwandte Konzepte kombiniert hat;
  • sich an ein ähnliches Beispiel erinnert hat;
  • den Benchmark während des Trainings gesehen hat;
  • online eine Erklärung oder Implementierung gefunden hat.

Der Stichtag von Talkie ermöglicht es Forschern, Aufgaben auszuwählen, deren Antworten tatsächlich in der Zukunft des Modells liegen.

Python beispielsweise wurde Jahrzehnte nach 1930 entwickelt. Turings wegweisende Arbeit zur Berechenbarkeit erschien 1936. Auch die Xerografie und viele spätere technische Erfindungen liegen nach dem Stichtag.

Das Talkie-Team erörtert solche Erfindungen nach dem Wissensstichtag als mögliche zukünftige Experimente. Das ist wichtig: Sie sind Testziele, keine Entdeckungen, die Talkie bereits reproduziert hat.

Hat Talkie Python wirklich gelernt, ohne Python im Pretraining gesehen zu haben?

Um die Generalisierung zu testen, zeigten die Forschenden historischen Modellen mehrere Python-Programme im Kontext und baten sie anschließend, neue Aufgaben im Stil von HumanEval zu lösen.

Die Ergebnisse liefern einige Hinweise auf In-Context-Lernen über eine echte Wissensgrenze hinweg, bleiben jedoch bescheiden.

Die Forschenden berichten, dass erfolgreiche Programme im Allgemeinen aus einfachen einzeiligen Lösungen oder kleinen Änderungen an bereits im Kontext vorhandenen Beispielen bestanden. ([Talkie](https://talkie-lm.com/introducing-talkie))

Das meistgeteilte Beispiel betrifft eine Rotationschiffre. Nachdem das Modell eine Kodierungsfunktion gesehen hatte, erzeugte es die inverse Dekodierungsoperation, indem es die relevante arithmetische Beziehung umkehrte.

Was das Experiment belegt Was dies nicht belegt
Talkie lernte anhand von Beispielen einfache Python-Muster Talkie erfand Python
Es passte sich korrekt an eine unbekannte Operation an Es entdeckte die Informatik wieder
Es zeigte eine begrenzte strukturelle Generalisierung Es zeigte abstraktes Schlussfolgern auf menschlichem Niveau

Das ist gerade deshalb interessanter, als es klingt, weil die Behauptung eng gefasst ist.

Das Modell nutzte Beispiele, um eine kleine, korrekte Transformation in einer Sprache durchzuführen, die in den vorgesehenen Pretraining-Daten nicht enthalten war.

Was ist der Einstein-Test für KI?

Dieselbe Idee lässt sich noch viel weiterführen.

DeepMind-CEO Demis Hassabis hat über einen „Einstein-Test“ gesprochen, bei dem eine KI nur Wissen erhält, das vor einer bedeutenden wissenschaftlichen Entdeckung verfügbar war, und gefragt wird, ob sie unabhängig den späteren Durchbruch erreichen kann.

Die bekannteste Version fragt, ob ein Modell, das ausschließlich mit dem vor Einsteins allgemeiner Relativitätstheorie verfügbaren Wissen trainiert wurde, die Theorie herleiten könnte, ohne sie jemals gesehen zu haben.

Ein Nature-Artikel vom September 2026 beschreibt, wie mehrere Forschende inzwischen mit historischen Sprachmodellen und ähnlichen Methoden mit zeitlicher Wissensbegrenzung experimentieren.

Das ist weitaus schwieriger, als ein modernes Modell einer Prüfung zur Relativitätstheorie zu unterziehen.

Ein bekanntes Problem lösen Eine wissenschaftliche Entdeckung machen
Die Frage existiert bereits Die richtige Frage ist möglicherweise nicht offensichtlich
Relevante Konzepte werden häufig vorgegeben Möglicherweise muss ein neues Konzept erfunden werden
Der Lösungsraum ist eingeschränkt Viele konkurrierende Theorien können mit den Belegen vereinbar sein
Die Richtigkeit kann oft direkt überprüft werden Neue Experimente könnten erforderlich sein

Wissenschaftliche Entdeckungen erfordern mehr als das Lösen von Gleichungen. Es kann erforderlich sein, zu erkennen, dass eine anerkannte Annahme falsch ist, und einen besseren konzeptionellen Rahmen zu entwickeln.

Hat eine KI den Einstein-Test bestanden?

Nein.

Aktuelle Experimente haben interessante Fragmente von Verallgemeinerungsfähigkeit und wissenschaftlicher Intuition hervorgebracht, aber keine überzeugende Wiederentdeckung auf Einstein-Niveau.

Die Besprechung von Nature beschreibt die frühen Ergebnisse als ebenso sehr als Aufzeigen wichtiger Einschränkungen heutiger KI wie ihrer Stärken. Modelle können oft effektiv arbeiten, sobald ein Problem formuliert wurde, aber die Bildung der richtigen neuen Hypothese bleibt deutlich schwieriger. ([Nature](https://www.nature.com/articles/d41586-026-02804-x))

Diese Unterscheidung ist wesentlich, weil eine KI Tausende plausibler Hypothesen generieren kann, ohne zu wissen, welche davon weitere Untersuchungen verdient.

Der strengere Test besteht nicht darin, ob ein Modell nach genügend Hinweisen eine bekannte Theorie hervorbringen kann. Entscheidend ist, ob es einen Widerspruch erkennen, eine wirklich nützliche neue Erklärung vorschlagen und dies tun kann, ohne dass die spätere Antwort in seine Trainingsdaten gelangt ist.

Ist Talkie-1930 wirklich frei von modernem Wissen?

Nicht vollkommen.

Das Talkie-Team berichtet offen über zeitliche Datenlecks. Trotz des beabsichtigten Stichtags 1930 scheint das 13B-Modell einige Informationen über spätere Ereignisse zu kennen, darunter Roosevelts Präsidentschaft, den New Deal, den Zweiten Weltkrieg, die Vereinten Nationen und das Deutschland der Nachkriegszeit.

Die Forscher nennen mehrere Wege, auf denen zukünftige Informationen in scheinbar historische Korpora gelangen können:

  • falsche Veröffentlichungsdaten;
  • moderne Einleitungen, die alten Büchern hinzugefügt wurden;
  • spätere Fußnoten und Anmerkungen;
  • falsch klassifizierte Dokumente;
  • Digitalisierungs- und OCR-Artefakte.

Diese Einschränkung ist grundlegend.

Wenn ein Experiment behauptet, ein Modell habe etwas unabhängig entdeckt, das es nie gesehen hat, benötigen die Forscher zunächst stichhaltige Belege dafür, dass die Antwort tatsächlich nicht vorhanden war.

Bei historischer KI ist die Herkunft der Daten Teil des Benchmarks.

Das Wissen von Talkie ist historisch, aber sein Training nach dem Basistraining nicht vollständig

Es gibt eine weitere subtile Einschränkung.

Das Basismodell wird mit historischen Daten trainiert, aber für die Entwicklung eines nützlichen Assistenten zur Befolgung von Anweisungen sind Trainingsdaten nach dem Basistraining erforderlich, die es 1930 noch nicht gab.

Die Forscher erstellten Anweisungsbeispiele aus historischen Referenzmaterialien, berichten aber auch über den Einsatz moderner Claude-Modelle in späteren Phasen, darunter Claude Sonnet 4.6 als Bewerter und Claude Opus 4.6 zur Generierung synthetischer Gespräche. ([Talkie](https://talkie-lm.com/introducing-talkie))

Dadurch entstehen zwei unterschiedliche Formen der Verunreinigung, die nicht miteinander verwechselt werden sollten:

Wissensverlust Verhaltenseinfluss
Moderne Fakten gelangen in das Modell Moderne Modelle beeinflussen die Antworten des Modells
Durchbricht die historische Wissensgrenze Kann Stil, Befolgung von Anweisungen oder Denkgewohnheiten verändern

Talkie kann daher überwiegend über Wissen aus früheren Zeiten verfügen, ohne sich exakt wie ein hypothetisches intelligentes System zu verhalten, das 1930 entwickelt wurde.

Warum historische KI auch ein Experiment zur Datenqualität ist

Historische Sprachmodelle stehen vor einem Problem, das moderne Webmodelle weitgehend vermeiden: Der Großteil ihres Trainingsmaterials wurde nie digital erstellt.

Bücher, Zeitungen, Patente und Zeitschriften müssen zunächst von gescannten Seiten in Text umgewandelt werden.

Das Talkie-Team berichtet, dass historischer Text aus herkömmlicher OCR in einem kontrollierten Experiment nur etwa 30 % der Lerneffizienz menschlich transkribierter Versionen erreichte. Durch eine einfache Bereinigung stieg dieser Wert auf ungefähr 70 %. ([Talkie](https://talkie-lm.com/introducing-talkie))

Textquelle Gemeldete relative Lerneffizienz
Menschliche Transkription 100%
Herkömmliche OCR ~30 %
Bereinigte OCR ~70 %

Daraus ergibt sich eine weiterführende Erkenntnis: Mehr Tokens bedeuten nicht automatisch nützlichere Trainingsdaten.

Das ist auch ein Grund, warum lokale KI-Verarbeitung für private Datensätze bei Archivarbeiten wichtig sein kann. OCR, Indizierung, Embeddings und experimentelle Korpora können in der Nähe des gespeicherten Ausgangsmaterials verarbeitet werden, anstatt jedes Dokument über einen Remote-Dienst zu schicken.

Kannst du Talkie-1930 lokal ausführen?

Ja.

Das offizielle Talkie-Repository stellt öffentliche Gewichte und Inferenzcode unter Apache 2.0 bereit.

Die Referenzkonfiguration für BF16 führt derzeit Folgendes auf:

Anforderung Referenzanforderung
Python 3.11+
PyTorch 2.1+
GPU CUDA-fähig
VRAM Mindestens 28 GB für BF16
Speicher Etwa 26-50 GB pro Modell

Dies ist kein kleines CPU-Modell, sondern ein realistischer Forschungs-Workload für eine Workstation oder einen KI-Server zu Hause.

Für die lokale Bereitstellung ist die Größe des Checkpoints nur der Ausgangspunkt. Auch Laufzeitspeicher, Kontext, Cache und andere Modellkomponenten verbrauchen Ressourcen. Deshalb ist der Speicherbedarf des Modells wichtiger als ein einfacher Vergleich der Dateigrößen.

Nach dem Herunterladen kann [Talkie] auch ohne eine proprietäre Inferenz-API verwendet werden. Dadurch lassen sich exakte Modellversionen leichter bewahren und Experimente einfacher reproduzieren.

Eine vollständig reproduzierbare Einrichtung sollte außerdem Modelldateien, Tokenizer, Datensätze und erforderliche Abhängigkeiten lokal verfügbar halten, anstatt dauerhaften Zugriff auf externe Dienste vorauszusetzen. Das ist dasselbe Prinzip wie bei einem offline-fähigen lokalen KI-Workflow.

Wofür sind historische Sprachmodelle tatsächlich nützlich?

Der langfristige Wert von [Talkie] besteht nicht darin, vorzugeben, mit jemandem aus dem Jahr 1930 zu chatten.

Forschungszweck Frage
Kontaminationsresistente Evaluierung Kann das Modell etwas lösen, das seine Epoche nicht enthalten konnte?
Wissenschaftliche Entdeckung Kann es eine wirklich nach dem Wissensstichtag entstandene Idee ableiten?
Prognoseforschung Wie vorhersehbar sind spätere Ereignisse anhand früherer Informationen?
Forschung zur Datenverteilung Wie viele Fähigkeiten stammen aus modernen Webdaten?
Computergestützte Geschichtsforschung Welche Erwartungen sind in den Dokumenten einer Epoche kodiert?
Forschung zur Generalisierung Kann das Modell unbekannte Konzepte aus Beispielen erlernen?

Die Forschenden haben bereits ungefähr 5.000 historische Ereignisbeschreibungen aus der New York Times verwendet, um zu messen, wie „überraschend“ zukünftige Ereignisse für ein Modell wirken, das mit früheren Informationen trainiert wurde. Das ist keine Vorhersage im Science-Fiction-Sinn, bietet aber eine neue Möglichkeit, Prognosehorizonte zu untersuchen. ([Talkie](https://talkie-lm.com/introducing-talkie))

Was [Talkie] über die Intelligenz moderner KI offenlegt

[Talkie]s modernes Gegenstück ermöglicht einen ungewöhnlich nützlichen Vergleich.

Die Architektur und die Trainingsleistung können ähnlich bleiben, während sich die Informationsumgebung dramatisch verändert.

Das Modell mit modernen Daten erzielt bei vielen herkömmlichen Aufgaben bessere Ergebnisse. Ein Teil davon könnte auf sauberere Daten zurückzuführen sein. Ein anderer Teil könnte daher stammen, dass das moderne Web Programmierinhalte, technische Dokumentation, Fragen und Antworten, wissenschaftliche Erklärungen und viele Formen strukturierter Problemlösung enthält, die in einem historischen Korpus fehlen.

Das wirft eine tiefere Frage auf:

Wie viel der modernen KI-Fähigkeiten stammt aus der Modellarchitektur, und wie viel aus der Komprimierung der angesammelten Struktur des modernen Internets?

Diese Frage ist auch bei der Bewertung von offenen Modellen im Vergleich mit Frontier-KI relevant. Benchmark-Werte allein zeigen nicht, ob Unterschiede auf die Architektur, die Daten, das Post-Training, Tools oder schlicht auf die enorme Trainingsskalierung zurückzuführen sind.

Der bessere Test lautet nicht: „Kann KI denken?“

Argumente darüber, ob KI „wirklich denkt“, werden schnell philosophisch.

Historische Modelle bieten eine besser überprüfbare Frage:

Können wir ein Experiment entwickeln, bei dem das Erinnern der bekannten Antwort unmöglich oder zumindest deutlich unwahrscheinlicher ist?

Talkie-1930 ist keine perfekte Lösung. Sein Korpus enthält einige zeitliche Datenlecks. Historische OCR ist fehleranfällig. Modernes Post-Training führt Verhaltensbeeinflussung ein. Und das 13B-Modell ist weiterhin deutlich schwächer als aktuelle Frontier-Systeme.

Doch diese Einschränkungen lassen sich messen und verbessern.

Die entscheidende Leistung besteht daher nicht darin, dass Talkie die moderne Wissenschaft wiederentdeckt hat. Das hat es nicht.

Sein Wert liegt darin, dass es Forschenden eine sauberere Möglichkeit bietet, die Frage zu stellen, ob ein zukünftiges Modell auf alte Belege stoßen, etwas Fehlendes erkennen, eine neue Hypothese aufstellen und zu einer Schlussfolgerung gelangen kann, die in seiner Trainingswelt tatsächlich nicht existierte.

Das wäre ein deutlich stärkerer Beleg für Generalisierung als ein weiterer hoher Wert bei einem Benchmark, über den im Internet bereits tausendfach diskutiert wurde.

Häufig gestellte Fragen zu Talkie-1930

Weiß Talkie-1930 vom Zweiten Weltkrieg?

Unter dem vorgesehenen Cutoff von 1930 sollte es das nicht können, doch die Forschenden räumen eine gewisse zeitliche Datenlecks ein. Das Modell scheint begrenzte Informationen über spätere Ereignisse zu kennen, was zeigt, wie schwierig die Erstellung eines vollständig abgeschotteten historischen Korpus ist.

Kann Talkie-1930 Python schreiben?

In begrenztem Umfang. Wenn Talkie Python-Beispiele im Kontext erhielt, erzeugte es einige einfache korrekte Programme und Änderungen, obwohl Python in seiner vorgesehenen Vortrainingszeit nicht existierte. Dies belegt eine begrenzte Generalisierung im Kontext, nicht die unabhängige Erfindung des Programmierens.

Hat eine KI den Einstein-Test bestanden?

Nein. Aktuelle Experimente mit historischen Modellen haben unabhängig voneinander noch keinen wissenschaftlichen Durchbruch auf Einstein-Niveau allein auf Grundlage von Wissen aus der Zeit vor der Entdeckung reproduziert.

Kann Talkie-1930 lokal ausgeführt werden?

Ja. Die Gewichte und der Inferenzcode sind unter Apache 2.0 öffentlich verfügbar. Die offizielle BF16-Referenzkonfiguration erfordert mindestens 28 GB CUDA-VRAM und etwa 26-50 GB Speicherplatz pro Modell.

Warum sind historische Sprachmodelle nützlich?

Sie helfen Forschenden, Generalisierung bei geringerer Benchmark-Kontamination zu testen, wissenschaftliche Entdeckungen und Prognosen zu untersuchen, verschiedene Epochen von Trainingsdaten zu vergleichen und zu erforschen, wie viel der modernen Modellfähigkeiten auf der Nutzung des modernen Webs beruht.

Tech- & KI-Zentrum

Mehr zum Lesen

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.