Vad har den aldrig sett? Talkie-1930 och Einstein-testet

Eva Wong är Teknisk skribent och den boende fixaren på ZimaSpace. En livslång nörd med en passion för hemma-labb och öppen källkod, hon specialiserar sig på att översätta komplexa tekniska koncept till tillgängliga, praktiska guider. Eva tror att självhosting ska vara roligt, inte skrämmande. Genom sina handledningar ger hon gemenskapen verktyg att avmystifiera hårdvaruinstallationer, från att bygga sin första NAS till att bemästra Docker-containrar.

Talkie-1930 är en språkmodell med 13 miljarder parametrar som avsiktligt tränats på information från före 1931. Syftet är inte historiskt rollspel. Forskarna vill använda modellen för att testa en mycket svårare fråga: om en AI aldrig såg det kända svaret under förträningen, kan den ändå resonera sig fram till något som människor upptäckte senare?

Det gör Talkie ovanligt relevant för debatten om resonemang kontra memorering. Moderna modeller kan ha stött på benchmarkfrågor, lösningar, artiklar, GitHub-arkiv eller förklaringar under träningen. En historisk modell skapar ett renare experiment genom att placera svaret på andra sidan av en tidsgräns.

Vad är Talkie-1930?

Talkie är en familj av ”vintage”-språkmodeller som utvecklats av Nick Levine, David Duvenaud och Alec Radford. Teamet introducerade Talkie-1930 år 2026 med hjälp av en korpus som var avsedd att endast innehålla information publicerad före 1931.

Specifikation Talkie-1930
Parametrar 13B
Förträningsdata 260 miljarder token
Avsedd gräns 31 december 1930
Källor Böcker, tidningar, tidskrifter, patent, rättsfall och periodika
Basmodell Tillgänglig
Instruktionsmodell Tillgänglig
Licens Apache 2.0
Lokal inferens Stöds

Forskarna tränade också en modern tvilling med samma arkitektur och jämförbar träningsberäkningskraft, men med modern FineWeb-data. Det gör Talkie användbar för att studera inte bara vad en modell känner till, utan också hur starkt dess kapacitet formas av informationsmiljön.

Detta kompletterar den bredare frågan om öppna modeller kontra frontier-AI: modellens kapacitet beror på mer än enbart antalet parametrar.

Varför träna en AI som inte känner till något efter 1930?

Den främsta orsaken är kontamineringsresistent utvärdering.

När en modern modell löser ett berömt problem kan forskare inte alltid avgöra om den:

  • härlett svaret;
  • kombinerat närliggande koncept;
  • minnts ett liknande exempel;
  • sett benchmarktestet under träningen;
  • stött på en förklaring eller implementering online.

Talkies gräns gör det möjligt för forskare att välja uppgifter vars svar verkligen tillhör modellens framtid.

Python skapades till exempel årtionden efter 1930. Turings banbrytande arbete om beräkningsbarhet publicerades 1936. Xerografi och många senare tekniska uppfinningar ligger också efter gränsen.

Talkie-teamet diskuterar sådana uppfinningar efter kunskapsgränsen som möjliga framtida experiment. Det är viktigt: de är testmål, inte upptäckter som Talkie redan har återskapat.

Lärde sig Talkie verkligen Python utan att se Python i förträningen?

För att testa generalisering visade forskarna flera Python-program för historiska modeller i kontext och bad dem sedan lösa nya uppgifter av HumanEval-typ.

Resultaten ger vissa belägg för inlärning i kontext över en verklig kunskapsgräns, men de är fortfarande blygsamma.

Forskarna rapporterar att framgångsrika program i allmänhet var enkla lösningar på en rad eller små modifieringar av exempel som redan fanns i kontexten. ([Talkie](https://talkie-lm.com/introducing-talkie))

Det mest spridda exemplet gäller ett rotationschiffer. Efter att ha sett en kodningsfunktion producerade modellen den omvända avkodningsoperationen genom att vända på den relevanta aritmetiska relationen.

Vad experimentet stöder Vad det inte stöder
Talkie lärde sig enkla Python-mönster från exempel Talkie uppfann Python
Det anpassade en obekant operation korrekt Det återupptäckte datavetenskapen
Det visade begränsad strukturell generalisering Det visade abstrakt resonemang på mänsklig nivå

Detta är mer intressant än det låter, just eftersom påståendet är snävt.

Modellen använde exempel för att utföra en liten, korrekt omvandling på ett språk som saknades i den avsedda förträningsdatan.

Vad är Einstein-testet för AI?

Samma idé kan drivas mycket längre.

DeepMinds vd Demis Hassabis har diskuterat ett ”Einstein-test” där en AI endast får tillgång till kunskap som var tillgänglig före en större vetenskaplig upptäckt och får frågan om den självständigt kan nå det senare genombrottet.

Den mest kända versionen frågar om en modell som tränats enbart på kunskap som var tillgänglig före Einsteins allmänna relativitetsteori skulle kunna härleda teorin utan att någonsin ha sett den.

En Nature-artikel från september 2026 beskriver hur flera forskare nu experimenterar med historiska språkmodeller och liknande metoder med tidsmässiga kunskapsgränser.

Detta är mycket svårare än att ge en modern modell ett relativitetsteoriprov.

Att lösa ett känt problem Att göra en vetenskaplig upptäckt
Frågan finns redan Den korrekta frågan kanske inte är uppenbar
Relevanta koncept tillhandahålls ofta Ett nytt koncept kan behöva uppfinnas
Svarsrummet är begränsat Många konkurrerande teorier kan stämma med evidensen
Korrekthet kan ofta kontrolleras direkt Nya experiment kan krävas

Vetenskaplig upptäckt kräver mer än att lösa ekvationer. Det kan kräva att man inser att ett accepterat antagande är fel och konstruerar ett bättre begreppsligt ramverk.

Har någon AI klarat Einstein-testet?

Nej.

Aktuella experiment har gett intressanta fragment av generalisering och vetenskaplig intuition, men ingen övertygande återupptäckt på Einstein-nivå.

Natures granskning beskriver de tidiga resultaten som lika mycket avslöjande av viktiga begränsningar hos dagens AI som av dess styrkor. Modeller kan ofta arbeta effektivt när ett problem väl har formulerats, men att forma rätt nya hypotes är fortfarande mycket svårare. ([Nature](https://www.nature.com/articles/d41586-026-02804-x))

Denna skillnad är avgörande eftersom en AI kan generera tusentals plausibla hypoteser utan att veta vilken som förtjänar vidare undersökning.

Det starkare testet är inte huruvida en modell kan frambringa en känd teori efter tillräckligt många ledtrådar. Det är huruvida den kan identifiera en motsägelse, föreslå en genuint användbar ny förklaring och göra det utan att det senare svaret har läckt in i träningsdata.

Är Talkie-1930 verkligen fri från modern kunskap?

Inte helt perfekt.

Talkie-teamet rapporterar öppet om tidsmässigt läckage. Trots den avsedda gränsen vid 1930 verkar 13B-modellen känna till viss information om senare händelser, däribland Roosevelts presidentskap, New Deal, andra världskriget, Förenta nationerna och efterkrigstidens Tyskland.

Forskarna identifierar flera sätt på vilka framtida information kan läcka in i till synes historiska korpusar:

  • felaktiga publiceringsdatum;
  • moderna introduktioner som lagts till i gamla böcker;
  • senare fotnoter och anteckningar;
  • felklassificerade dokument;
  • digitalisering och OCR-artefakter.

Denna begränsning är grundläggande.

Om ett experiment hävdar att en modell självständigt upptäckte något den aldrig hade sett, behöver forskarna först starka belägg för att svaret verkligen saknades.

För historisk AI är uppgifternas ursprung en del av riktmärket.

Talkies kunskap är historisk, men dess efterträning är inte helt historisk

Det finns ytterligare en subtil begränsning.

Grundmodellen tränas på historiska data, men att skapa en användbar assistent som följer instruktioner kräver data för efterträning som inte fanns år 1930.

Forskarna genererade instruktions-exempel från historiskt referensmaterial, men rapporterar också att de använde moderna Claude-modeller under senare skeden, däribland Claude Sonnet 4.6 som bedömare och Claude Opus 4.6 för generering av syntetiska konversationer. ([Talkie](https://talkie-lm.com/introducing-talkie))

Detta skapar två olika former av kontaminering som inte bör blandas ihop:

Kunskapsläckage Beteendepåverkan
Moderna fakta kommer in i modellen Moderna modeller påverkar hur modellen svarar
Bryter mot den historiska kunskapsgränsen Kan förändra stil, instruktionsföljande eller vanor för slutledning

Talkie kan därför ha övervägande kunskap från äldre tider utan att bete sig exakt som ett hypotetiskt intelligent system byggt år 1930.

Varför historisk AI också är ett experiment i datakvalitet

Historiska språkmodeller möter ett problem som moderna webbmodeller i stor utsträckning undviker: det mesta av deras träningsmaterial var aldrig digitalt från början.

Böcker, tidningar, patent och tidskrifter måste först omvandlas från skannade sidor till text.

Talkie-teamet rapporterar att historisk text som OCR-behandlats konventionellt endast gav cirka 30 % av inlärningseffektiviteten hos mänskligt transkriberade versioner i ett kontrollerat experiment. Enkel rensning höjde detta till ungefär 70 %. ([Talkie](https://talkie-lm.com/introducing-talkie))

Textkälla Rapporterad relativ inlärningseffektivitet
Mänsklig transkribering 100%
Konventionell OCR ~30 %
Rensad OCR ~70 %

Detta visar en bredare lärdom: fler token innebär inte automatiskt mer användbara träningsdata.

Det är också en anledning till att lokal AI-bearbetning av privata dataset kan vara viktig i arkivarbete. OCR, indexering, embeddingar och experimentella korpusar kan bearbetas nära det lagrade källmaterialet i stället för att varje dokument måste passera genom en fjärrtjänst.

Kan du köra Talkie-1930 lokalt?

Ja.

Det officiella Talkie-arkivet tillhandahåller offentliga vikter och inferenskod under Apache 2.0.

Den aktuella BF16-referenskonfigurationen anger:

Krav Referenskrav
Python 3.11+
PyTorch 2.1+
GPU CUDA-kompatibelt
VRAM Minst 28 GB för BF16
Lagring Cirka 26–50 GB per modell

Det här är inte en liten CPU-modell, men det är en realistisk forskningsarbetsbelastning för en arbetsstation eller AI-server i hemmet.

För lokal driftsättning är kontrollpunktens storlek bara utgångspunkten. Körminne, kontext, cache och andra modellkomponenter förbrukar också resurser, vilket är anledningen till att modellens minnesfotavtryck är viktigare än att bara jämföra filstorlekar.

När Talkie väl har laddats ned kan det också användas utan ett proprietärt inferens-API. Det gör det enklare att bevara exakta modellversioner och att reproducera experiment.

En fullt reproducerbar installation bör också ha modellfiler, tokeniserare, datamängder och nödvändiga beroenden tillgängliga lokalt, i stället för att förutsätta permanent åtkomst till externa tjänster. Det är samma princip som ligger bakom ett offlinekompatibelt lokalt AI-arbetsflöde.

Vad kan historiska språkmodeller faktiskt användas till?

Talkies långsiktiga värde ligger inte i att låtsas chatta med någon från 1930.

Forskningsanvändning Fråga
Utvärdering som motstår datakontaminering Kan modellen lösa något som dess era inte kunde innehålla?
Vetenskaplig upptäckt Kan den härleda en genuint idé som uppstod efter kunskapsstoppet?
Prognosforskning Hur förutsägbara är senare händelser utifrån tidigare information?
Forskning om datadistribution Hur mycket av förmågan kommer från moderna webbdata?
Beräkningshistoria Vilka förväntningar kodas i en eras dokument?
Forskning om generalisering Kan modellen lära sig obekanta begrepp från exempel?

Forskarna har redan använt ungefär 5 000 historiska händelsebeskrivningar från New York Times för att mäta hur ”överraskande” framtida händelser verkar för en modell som tränats på tidigare information. Det är inte förutsägelse i science fiction-bemärkelse, men det ger ett nytt sätt att studera prognoshorisonter. ([Talkie](https://talkie-lm.com/introducing-talkie))

Vad Talkie avslöjar om modern AI-intelligens

Talkies moderna tvilling skapar en ovanligt användbar jämförelse.

Arkitekturen och träningsberäkningarna kan förbli likartade medan informationsmiljön förändras dramatiskt.

Modellen som tränats på moderna data presterar bättre på många konventionella uppgifter. En del av det kan bero på renare data. En del kan bero på att den moderna webben innehåller programmering, teknisk dokumentation, frågor och svar, vetenskapliga förklaringar och många former av strukturerad problemlösning som saknas i en historisk korpus.

Detta väcker en djupare fråga:

hur mycket av den moderna AI-förmågan som kommer från modellarkitekturen, och hur mycket som kommer från att komprimera den ackumulerade strukturen hos det moderna internet?

Den frågan är också relevant när man utvärderar öppna modeller jämfört med banbrytande AI. Enbart benchmarkresultat visar inte om skillnaderna beror på arkitektur, data, efterträning, verktyg eller ren träningsskala.

Det bättre testet är inte ”Kan AI tänka?”

Argument om huruvida AI verkligen ”tänker” blir snabbt filosofiska.

Historiska modeller erbjuder en mer testbar fråga:

Kan vi bygga ett experiment där det är omöjligt - eller åtminstone betydligt mindre sannolikt - att minnas det kända svaret?

Talkie-1930 är inte en perfekt lösning. Dess korpus innehåller viss tidsmässig läckage. Historisk OCR är brusig. Modern efterträning medför beteendemässig påverkan. Och 13B-modellen är fortfarande mycket svagare än dagens ledande system.

Men dessa begränsningar kan mätas och förbättras.

Den viktiga bedriften är därför inte att Talkie har återupptäckt modern vetenskap. Det har den inte.

Värdet ligger i att det ger forskare ett renare sätt att fråga om en framtida modell kan möta gamla belägg, identifiera något som saknas, formulera en ny hypotes och nå en slutsats som verkligen inte fanns i dess träningsvärld.

Det skulle vara mycket starkare bevis på generalisering än ännu ett högt resultat på ett benchmark som internet redan har diskuterat tusentals gånger.

Vanliga frågor om Talkie-1930

Känner Talkie-1930 till andra världskriget?

Den borde inte kunna det inom den avsedda brytpunkten 1930, men forskarna medger viss tidsmässig läckage. Modellen verkar känna till begränsad information om senare händelser, vilket visar hur svårt det är att skapa en helt förseglad historisk korpus.

Kan Talkie-1930 skriva Python?

I begränsad utsträckning. När Talkie fick Python-exempel i kontexten skapade och modifierade modellen några enkla korrekta program, trots att Python saknades under den avsedda förträningsperioden. Detta stöder begränsad generalisering i kontexten, inte ett oberoende uppfinnande av programmering.

Har någon AI klarat Einstein-testet?

Nej. Nuvarande experiment med historiska modeller har inte oberoende återskapat något vetenskapligt genombrott på Einstein-nivå enbart utifrån kunskap före upptäckten.

Kan Talkie-1930 köras lokalt?

Ja. Vikterna och inferenskoden är offentliga under Apache 2.0. Den officiella BF16-referenskonfigurationen anger minst 28 GB CUDA-VRAM och cirka 26–50 GB lagringsutrymme per modell.

Varför är historiska språkmodeller användbara?

De hjälper forskare att testa generalisering med mindre benchmark-kontaminering, studera vetenskaplig upptäckt och prognostisering, jämföra olika epoker av träningsdata och undersöka hur mycket av moderna modellers förmåga som kommer från exponering för den moderna webben.

Teknik- och AI-hubb

Mer att läsa

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.