Czego nigdy nie widział? Talkie-1930 i test Einsteina

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Talkie-1930 to model językowy z 13 miliardami parametrów, celowo wytrenowany na informacjach sprzed 1931 roku. Jego celem nie jest odgrywanie roli historycznej. Badacze chcą wykorzystać model do sprawdzenia znacznie trudniejszej kwestii: jeśli AI nigdy nie widziała znanej odpowiedzi podczas wstępnego treningu, czy mimo to potrafi rozumować i dojść do czegoś, co ludzie odkryli później?

Dzięki temu Talkie jest wyjątkowo istotny w debacie na temat rozumowania a zapamiętywania. Współczesne modele mogły napotkać podczas treningu pytania z benchmarków, rozwiązania, artykuły naukowe, repozytoria GitHub lub wyjaśnienia. Model historyczny pozwala przeprowadzić czystszy eksperyment, umieszczając odpowiedź po drugiej stronie granicy czasowej.

Czym jest Talkie-1930?

Talkie to rodzina „zabytkowych” modeli językowych opracowanych przez Nicka Levine’a, Davida Duvenauda i Aleca Radforda. Zespół przedstawił Talkie-1930 w 2026 roku, wykorzystując korpus, który miał zawierać wyłącznie informacje opublikowane przed 1931 rokiem.

Specyfikacja Talkie-1930
Parametry 13B
Dane do wstępnego treningu 260 mld tokenów
Zakładana granica czasowa 31 grudnia 1930 roku
Źródła Książki, gazety, czasopisma naukowe, patenty, orzecznictwo i periodyki
Model bazowy Dostępny
Model instruktażowy Dostępny
Licencja Apache 2.0
Lokalne wnioskowanie Obsługiwany

Badacze wytrenowali również nowoczesny odpowiednik, wykorzystując tę samą architekturę i porównywalną moc obliczeniową treningu, ale współczesne dane FineWeb. Dzięki temu Talkie przydaje się do badania nie tylko tego, co model wie, lecz także tego, w jakim stopniu jego możliwości kształtuje środowisko informacyjne.

Stanowi to uzupełnienie szerszego pytania o modele otwarte a przełomowe modele AI: możliwości modelu zależą od czegoś więcej niż tylko liczby parametrów.

Po co trenować AI, które nic nie wie o wydarzeniach po 1930 roku?

Głównym powodem jest ewaluacja odporna na skażenie danymi treningowymi.

Gdy nowoczesny model rozwiązuje słynny problem, badacze nie zawsze mogą stwierdzić, czy:

  • wyprowadził odpowiedź;
  • połączył powiązane koncepcje;
  • zapamiętał podobny przykład;
  • widział benchmark podczas treningu;
  • napotkał w Internecie wyjaśnienie lub implementację.

Granica czasowa Talkie pozwala badaczom wybierać zadania, których odpowiedzi rzeczywiście należą do przyszłości modelu.

Na przykład Python powstał dziesięciolecia po 1930 roku. Przełomowa praca Turinga na temat obliczalności ukazała się w 1936 roku. Kserografia i wiele późniejszych wynalazków inżynieryjnych również wykraczają poza tę granicę.

Zespół [Talkie] omawia takie wynalazki powstałe po dacie odcięcia jako potencjalne przyszłe eksperymenty. To ważne: są to cele testów, a nie odkrycia, które [Talkie] już odtworzył.

Czy [Talkie] naprawdę nauczył się Pythona, nie widząc Pythona w danych treningowych?

Aby przetestować generalizację, badacze pokazali historycznym modelom kilka programów w Pythonie w kontekście, a następnie poprosili je o rozwiązanie nowych zadań w stylu HumanEval.

Wyniki dostarczają pewnych dowodów na uczenie się w kontekście ponad rzeczywistą granicą wiedzy, ale pozostają skromne.

Badacze informują, że udane programy były zazwyczaj prostymi rozwiązaniami w jednej linii lub niewielkimi modyfikacjami przykładów już obecnych w kontekście. ([Talkie](https://talkie-lm.com/introducing-talkie))

Najczęściej udostępniany przykład dotyczy szyfru rotacyjnego. Po zobaczeniu funkcji kodującej model wygenerował odwrotną operację dekodowania, odwracając odpowiednią zależność arytmetyczną.

Co potwierdza eksperyment Czego to nie potwierdza
[Talkie] nauczył się prostych wzorców Pythona na podstawie przykładów [Talkie] wynalazł Pythona
Poprawnie dostosował nieznaną operację Na nowo odkrył informatykę
Wykazał ograniczoną generalizację strukturalną Wykazał abstrakcyjne rozumowanie na poziomie człowieka

Jest to ciekawsze, niż mogłoby się wydawać, właśnie dlatego, że teza jest wąska.

Model wykorzystał przykłady, aby wykonać niewielką, poprawną transformację w języku nieobecnym w danych użytych do jego zamierzonego wstępnego treningu.

Czym jest test Einsteina dla AI?

Tę samą ideę można posunąć znacznie dalej.

Dyrektor generalny DeepMind, Demis Hassabis, opisywał „test Einsteina”, w którym AI otrzymuje wyłącznie wiedzę dostępną przed wielkim odkryciem naukowym, a następnie sprawdza się, czy potrafi samodzielnie dojść do późniejszego przełomu.

Najsłynniejsza wersja sprawdza, czy model wytrenowany wyłącznie na wiedzy dostępnej przed sformułowaniem przez Einsteina ogólnej teorii względności mógłby wyprowadzić tę teorię, nigdy się z nią nie zetknąwszy.

Artykuł Nature z września 2026 roku opisuje, jak wielu badaczy eksperymentuje obecnie z historycznymi modelami językowymi i podobnymi metodami opartymi na ograniczeniu czasowym wiedzy.

Jest to znacznie trudniejsze niż przeprowadzenie współczesnego modelu przez egzamin z teorii względności.

Rozwiązywanie znanego problemu Dokonywanie odkrycia naukowego
Pytanie już istnieje Nie zawsze oczywiste jest, jakie jest właściwe pytanie
Istotne pojęcia są często podane Może być konieczne wynalezienie nowego pojęcia
Przestrzeń odpowiedzi jest ograniczona Wiele konkurencyjnych teorii może pasować do dowodów
Poprawność często można sprawdzić bezpośrednio Mogą być wymagane nowe eksperymenty

Odkrycia naukowe wymagają czegoś więcej niż rozwiązywania równań. Mogą wymagać rozpoznania, że przyjęte założenie jest błędne, oraz skonstruowania lepszych ram pojęciowych.

Czy jakakolwiek AI przeszła test Einsteina?

Nie.

Obecne eksperymenty przyniosły interesujące fragmenty uogólniania i intuicji naukowej, ale nie dostarczyły przekonującego ponownego odkrycia na poziomie Einsteina.

Recenzja w Nature opisuje wczesne wyniki jako ujawniające zarówno mocne strony, jak i istotne ograniczenia współczesnej AI. Modele często potrafią skutecznie pracować, gdy problem został już sformułowany, ale opracowanie właściwej nowej hipotezy pozostaje znacznie trudniejsze. ([Nature](https://www.nature.com/articles/d41586-026-02804-x))

To rozróżnienie jest kluczowe, ponieważ AI może wygenerować tysiące wiarygodnych hipotez, nie wiedząc, która z nich zasługuje na dalsze badania.

Silniejszy test nie polega na sprawdzeniu, czy model potrafi odtworzyć znaną teorię po otrzymaniu wystarczającej liczby wskazówek. Chodzi o to, czy potrafi zidentyfikować sprzeczność, zaproponować naprawdę użyteczne nowe wyjaśnienie i zrobić to bez przedostania się późniejszej odpowiedzi do jego danych treningowych.

Czy Talkie-1930 rzeczywiście jest wolny od współczesnej wiedzy?

Nie w pełni.

Zespół Talkie otwarcie informuje o wycieku informacji w czasie. Mimo zamierzonej granicy roku 1930 model 13B wydaje się znać pewne informacje o późniejszych wydarzeniach, w tym o prezydenturze Roosevelta, Nowym Ładzie, II wojnie światowej, Organizacji Narodów Zjednoczonych i powojennych Niemczech.

Naukowcy wskazują kilka sposobów, na które informacje z przyszłości mogą przedostać się do pozornie historycznych korpusów:

  • nieprawidłowe daty publikacji;
  • współczesne wstępy dodane do starych książek;
  • późniejsze przypisy i adnotacje;
  • błędnie sklasyfikowane dokumenty;
  • artefakty digitalizacji i OCR.

To ograniczenie ma fundamentalny charakter.

Jeśli eksperyment twierdzi, że model niezależnie odkrył coś, czego nigdy nie widział, naukowcy muszą najpierw przedstawić mocne dowody, że odpowiedź rzeczywiście była nieobecna.

W przypadku historycznej AI pochodzenie danych jest częścią testu porównawczego.

Wiedza Talkie jest historyczna, ale jego potrening nie jest w pełni historyczny

Istnieje jeszcze jedno subtelne ograniczenie.

Model bazowy jest trenowany na danych historycznych, ale stworzenie użytecznego asystenta wykonującego instrukcje wymaga danych potreningowych, które nie istniały w 1930 roku.

Naukowcy wygenerowali przykłady instrukcji na podstawie historycznych materiałów referencyjnych, ale informują również o wykorzystaniu nowoczesnych modeli Claude na późniejszych etapach, w tym Claude Sonnet 4.6 jako sędziego oraz Claude Opus 4.6 do generowania syntetycznych rozmów. ([Talkie](https://talkie-lm.com/introducing-talkie))

Tworzy to dwie różne formy skażenia, których nie należy ze sobą mylić:

Wyciekanie wiedzy Wpływ behawioralny
Współczesne fakty trafiają do modelu Współczesne modele wpływają na sposób, w jaki model odpowiada
Przekracza historyczną granicę wiedzy Może zmieniać styl, wykonywanie instrukcji lub sposoby rozumowania

Talkie może więc zawierać głównie wiedzę z epoki, nie zachowując się przy tym dokładnie jak hipotetyczny inteligentny system zbudowany w 1930 roku.

Dlaczego historyczna AI jest także eksperymentem dotyczącym jakości danych

Historyczne modele językowe napotykają problem, którego współczesne modele internetowe w dużej mierze unikają: większość ich materiałów treningowych nigdy nie powstała w formie cyfrowej.

Książki, gazety, patenty i czasopisma trzeba najpierw przekształcić ze skanowanych stron w tekst.

Zespół Talkie podaje, że teksty historyczne poddane konwencjonalnemu OCR zapewniały w kontrolowanym eksperymencie jedynie około 30% efektywności uczenia wersji przepisanych przez człowieka. Proste oczyszczenie zwiększyło ten wynik do około 70%. ([Talkie](https://talkie-lm.com/introducing-talkie))

Źródło tekstu Zgłoszona względna efektywność uczenia
Transkrypcja wykonana przez człowieka 100%
Konwencjonalny OCR ~30%
Oczyszczony OCR ~70%

To prowadzi do szerszego wniosku: większa liczba tokenów nie oznacza automatycznie większej ilości użytecznych danych treningowych.

To również jeden z powodów, dla których lokalne przetwarzanie AI dla prywatnych zbiorów danych może mieć znaczenie w pracach archiwalnych. OCR, indeksowanie, osadzania i eksperymentalne korpusy można przetwarzać blisko przechowywanych materiałów źródłowych, zamiast wymagać, by każdy dokument przechodził przez zdalną usługę.

Czy możesz uruchomić Talkie-1930 lokalnie?

Tak.

Oficjalne repozytorium Talkie udostępnia publiczne wagi i kod wnioskowania na licencji Apache 2.0.

Referencyjna konfiguracja BF16 obejmuje obecnie:

Wymaganie Wymagania referencyjne
Python 3.11+
PyTorch 2.1+
GPU Obsługa CUDA
Pamięć VRAM Co najmniej 28 GB dla BF16
Pamięć masowa Około 26–50 GB na model

Nie jest to mały model procesora, ale stanowi realistyczne obciążenie badawcze dla stacji roboczej lub domowego serwera AI.

W przypadku wdrożenia lokalnego rozmiar checkpointu to dopiero punkt wyjścia. Pamięć używana w czasie działania, kontekst, pamięć podręczna i inne komponenty modelu również zużywają zasoby, dlatego zapotrzebowanie modelu na pamięć ma większe znaczenie niż samo porównywanie rozmiarów plików.

Po pobraniu Talkie może być również używany bez zastrzeżonego API do inferencji. Ułatwia to zachowanie dokładnych wersji modeli i odtwarzanie eksperymentów.

W pełni odtwarzalna konfiguracja powinna również przechowywać lokalnie pliki modeli, tokenizery, zbiory danych i wymagane zależności, zamiast zakładać stały dostęp do usług zewnętrznych. Ta sama zasada leży u podstaw lokalnego workflow AI działającego bez połączenia.

Do czego właściwie przydają się historyczne modele językowe?

Długoterminowa wartość Talkie nie polega na udawaniu rozmowy z kimś z 1930 roku.

Zastosowanie badawcze Pytanie
Ocena odporna na zanieczyszczenie danych Czy model może rozwiązać problem, którego jego epoka nie mogła zawierać?
Odkrycia naukowe Czy model może wyprowadzić autentycznie nową ideę, która powstała po dacie odcięcia danych?
Badania nad prognozowaniem Na ile późniejsze wydarzenia można przewidzieć na podstawie wcześniejszych informacji?
Badania nad rozkładem danych Ile możliwości wynika ze współczesnych danych internetowych?
Historia obliczeniowa Jakie oczekiwania są zakodowane w dokumentach danej epoki?
Badania nad generalizacją Czy model może nauczyć się nieznanych pojęć na podstawie przykładów?

Naukowcy wykorzystali już około 5000 historycznych opisów wydarzeń z „New York Times”, aby zmierzyć, jak „zaskakujące” dla modelu wytrenowanego na wcześniejszych informacjach wydają się przyszłe wydarzenia. Nie jest to przewidywanie w sensie science fiction, ale zapewnia nowy sposób badania horyzontów prognozowania. ([Talkie](https://talkie-lm.com/introducing-talkie))

Co Talkie ujawnia na temat współczesnej inteligencji AI

Współczesny odpowiednik Talkie tworzy niezwykle użyteczne porównanie.

Architektura i moc obliczeniowa wykorzystana podczas treningu mogą pozostać podobne, podczas gdy środowisko informacyjne zmienia się diametralnie.

Model oparty na współczesnych danych osiąga lepsze wyniki w wielu konwencjonalnych zadaniach. Część tej przewagi może wynikać z czystszych danych. Część może wynikać z tego, że współczesny internet zawiera programowanie, dokumentację techniczną, pytania i odpowiedzi, wyjaśnienia naukowe oraz wiele form ustrukturyzowanego rozwiązywania problemów, których brakuje w korpusie historycznym.

To rodzi głębsze pytanie:

ile współczesnych możliwości AI wynika z architektury modelu, a ile z kompresowania nagromadzonej struktury współczesnego internetu?

To pytanie jest również istotne przy ocenie modeli otwartych w porównaniu z przełomową sztuczną inteligencją. Same wyniki benchmarków nie pokazują, czy różnice wynikają z architektury, danych, dostrajania po treningu, narzędzi czy po prostu ogromnej skali treningu.

Lepszy test nie brzmi: „Czy AI potrafi myśleć?”

Argumenty dotyczące tego, czy AI „naprawdę myśli”, szybko stają się filozoficzne.

Modele historyczne stawiają pytanie, które łatwiej przetestować:

Czy możemy zbudować eksperyment, w którym zapamiętanie znanej odpowiedzi będzie niemożliwe - lub przynajmniej znacznie mniej prawdopodobne?

Talkie-1930 nie jest idealnym rozwiązaniem. Jego korpus zawiera pewien przeciek czasowy. Historyczny OCR jest zaszumiony. Współczesne dostrajanie po treningu wprowadza wpływ behawioralny. A model 13B pozostaje znacznie słabszy od obecnych systemów z czołówki.

Te ograniczenia można jednak mierzyć i ulepszać.

Najważniejszym osiągnięciem nie jest więc to, że Talkie na nowo odkrył współczesną naukę. Tak się nie stało.

Jego wartość polega na tym, że daje badaczom bardziej przejrzysty sposób sprawdzenia, czy przyszły model może natrafić na stare dowody, rozpoznać brakujący element, sformułować nową hipotezę i dojść do wniosku, który rzeczywiście nie istniał w jego świecie treningowym.

Byłby to znacznie silniejszy dowód generalizacji niż kolejny wysoki wynik na benchmarku, o którym internet omawiał już tysiące razy.

Najczęściej zadawane pytania dotyczące Talkie-1930

Czy Talkie-1930 wie o II wojnie światowej?

Zgodnie z zamierzonym punktem odcięcia w 1930 roku nie powinien, jednak badacze przyznają, że doszło do pewnego przecieku czasowego. Model wydaje się znać ograniczone informacje o późniejszych wydarzeniach, co pokazuje, jak trudno stworzyć całkowicie odizolowany korpus historyczny.

Czy Talkie-1930 potrafi pisać w Pythonie?

W ograniczonym zakresie. Po otrzymaniu w kontekście przykładów w języku Python Talkie tworzył kilka prostych, poprawnych programów i modyfikacji, mimo że Python nie istniał w zamierzonej epoce jego wstępnego treningu. Świadczy to o ograniczonej generalizacji w kontekście, a nie o niezależnym wynalezieniu programowania.

Czy jakakolwiek AI przeszła test Einsteina?

Nie. Dotychczasowe eksperymenty z modelami historycznymi nie doprowadziły niezależnie do odtworzenia przełomu naukowego na miarę Einsteina wyłącznie na podstawie wiedzy sprzed odkrycia.

Czy Talkie-1930 może działać lokalnie?

Tak. Wagi modelu i kod do wnioskowania są publicznie dostępne na licencji Apache 2.0. Oficjalna konfiguracja referencyjna BF16 wymaga co najmniej 28 GB pamięci VRAM CUDA oraz około 26–50 GB przestrzeni na każdy model.

Dlaczego historyczne modele językowe są przydatne?

Pomagają badaczom testować generalizację przy mniejszym skażeniu benchmarków, badać odkrycia naukowe i prognozowanie, porównywać różne epoki danych treningowych oraz analizować, w jakim stopniu współczesne możliwości modeli wynikają z dostępu do współczesnego internetu.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.