한 번도 보지 못한 것은? Talkie-1930과 아인슈타인 테스트

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

Talkie-1930은 1931년 이전의 정보만을 사용해 의도적으로 학습한 130억 매개변수 언어 모델입니다. 이 모델의 목적은 역사적 역할극이 아닙니다. 연구자들은 훨씬 더 어려운 질문을 검증하는 데 이 모델을 사용하려 합니다. AI가 사전 학습 중 알려진 답을 전혀 보지 못했다면, 인간이 나중에 발견한 답을 향해 추론할 수 있을까요?

이 때문에 Talkie는 추론과 암기에 관한 논쟁과 특히 밀접한 관련이 있습니다. 최신 모델은 학습 중에 벤치마크 질문, 해답, 논문, GitHub 저장소 또는 설명을 접했을 수 있습니다. 역사적 모델은 답을 시간 경계 너머에 배치함으로써 더 깔끔한 실험을 가능하게 합니다.

Talkie-1930이란 무엇인가요?

Talkie는 Nick Levine, David Duvenaud, Alec Radford가 개발한 “빈티지” 언어 모델 제품군입니다. 이 팀은 1931년 이전에 발표된 정보만 포함하도록 만든 말뭉치를 사용해 2026년에 Talkie-1930을 소개했습니다.

사양 Talkie-1930
매개변수 13B
사전 학습 데이터 260B 토큰
의도한 기준 시점 1930년 12월 31일
출처 서적, 신문, 학술지, 특허, 판례 및 정기 간행물
기본 모델 사용 가능
지시 모델 사용 가능
라이선스 Apache 2.0
로컬 추론 지원됨

연구자들은 동일한 아키텍처와 비슷한 학습 연산량을 사용하되 최신 FineWeb 데이터로 학습한 현대적인 쌍둥이 모델도 만들었습니다. 따라서 Talkie는 모델이 무엇을 아는지뿐 아니라 정보 환경이 모델의 능력을 얼마나 강하게 형성하는지도 연구하는 데 유용합니다.

이는 오픈 모델과 프런티어 AI 중 무엇인가라는 더 광범위한 질문을 보완합니다. 모델의 성능은 단순히 매개변수 수만으로 결정되지 않습니다.

1930년 이후를 전혀 알지 못하는 AI를 학습시키는 이유는 무엇인가?

주된 이유는 오염에 강한 평가입니다.

최신 모델이 유명한 문제를 풀었을 때, 연구자들은 그것이 다음 중 어느 경우인지 항상 알 수 있는 것은 아닙니다.

  • 답을 도출했다;
  • 관련 개념을 결합했다;
  • 비슷한 예시를 기억했다;
  • 학습 중에 벤치마크를 봤다;
  • 온라인에서 설명이나 구현을 접했다;

Talkie의 기준 시점 덕분에 연구자들은 그 답이 실제로 모델의 미래에 속하는 과제를 선택할 수 있습니다.

예를 들어 Python은 1930년보다 수십 년 뒤에 만들어졌습니다. 튜링의 기념비적인 계산 가능성 논문은 1936년에 발표되었습니다. Xerography와 이후의 수많은 공학 발명도 이 기준 시점 이후에 등장했습니다.

Talkie 팀은 이러한 지식 차단 시점 이후의 발명을 향후 실험으로 검토할 가능성이 있다고 말합니다. 이는 중요합니다. 이것들은 테스트 대상이지, Talkie가 이미 재현한 발견이 아닙니다.

Talkie는 사전 학습에서 Python을 보지 않고도 정말 Python을 학습했을까요?

일반화 능력을 시험하기 위해 연구진은 여러 개의 Python 프로그램을 문맥에 제시한 빈티지 모델에 새로운 HumanEval 스타일 과제를 해결하도록 요청했습니다.

이 결과는 진정한 지식 경계를 넘어 문맥 내 학습이 이루어진다는 일부 증거를 제공하지만, 그 수준은 제한적입니다.

연구진은 성공한 프로그램이 대체로 한 줄짜리 간단한 해법이거나 문맥에 이미 제시된 예시를 약간 수정한 것이라고 보고합니다. ([Talkie](https://talkie-lm.com/introducing-talkie))

가장 많이 공유된 예시는 회전 암호와 관련이 있습니다. 인코딩 함수를 본 후, 모델은 관련 산술 관계를 반대로 적용해 역 디코딩 연산을 생성했습니다.

실험이 뒷받침하는 것 이를 뒷받침하지 않는 것
Talkie는 예시를 통해 간단한 Python 패턴을 학습했습니다 Talkie가 Python을 발명했습니다
익숙하지 않은 연산에 올바르게 적응했습니다 컴퓨터 과학을 재발견했습니다
제한적인 구조적 일반화를 보여주었습니다 인간 수준의 추상적 추론을 입증했습니다

이 주장이 좁은 범위에 한정되어 있기 때문에 오히려 들리는 것보다 흥미롭습니다.

이 모델은 의도된 사전 학습 데이터에 없던 언어에서 작은 규모의 올바른 변환을 수행하기 위해 예시를 사용했습니다.

AI를 위한 아인슈타인 테스트란 무엇인가?

같은 아이디어를 훨씬 더 확장할 수 있습니다.

DeepMind CEO 데미스 허사비스는 AI에 주요 과학적 발견 이전에 이용 가능했던 지식만 제공하고, 이후의 획기적 성과에 독립적으로 도달할 수 있는지 묻는 “아인슈타인 테스트”에 대해 논의한 바 있습니다.

가장 유명한 형태의 질문은 아인슈타인의 일반 상대성이론이 등장하기 전에 이용 가능했던 지식만으로 학습된 모델이, 그 이론을 본 적이 전혀 없는 상태에서 이론을 도출할 수 있는지 묻는 것입니다.

2026년 9월의 Nature 특집 기사는 여러 연구자가 현재 역사적 언어 모델 및 이와 유사한 지식 차단 시점 방법을 실험하고 있다고 설명합니다.

이는 현대 모델에게 상대성이론 시험을 치르게 하는 것보다 훨씬 어렵습니다.

알려진 문제 해결하기 과학적 발견하기
질문은 이미 존재합니다 올바른 질문이 무엇인지 명확하지 않을 수 있습니다
관련 개념이 제공되는 경우가 많습니다 새로운 개념을 발명해야 할 수도 있습니다
답의 범위는 제한되어 있습니다 서로 경쟁하는 여러 이론이 증거에 부합할 수 있습니다
Correctness can often be checked directly 정확성은 대개 직접 확인할 수 있습니다

새로운 실험이 필요할 수 있습니다

과학적 발견에는 방정식을 푸는 것 이상의 능력이 필요합니다. 받아들여진 가정이 틀렸다는 사실을 인식하고 더 나은 개념적 틀을 구성해야 할 수도 있습니다.

AI가 아인슈타인 테스트를 통과한 적이 있나요?

아니요.

현재의 실험은 일반화와 과학적 직관의 흥미로운 단편들을 보여 주었지만, 설득력 있는 아인슈타인 수준의 재발견은 아직 이루어지지 않았습니다.

Nature의 검토에서는 초기 결과가 오늘날 AI의 강점만큼이나 중요한 한계를 드러낸다고 설명합니다. 모델은 문제가 일단 정식화되면 효과적으로 해결하는 경우가 많지만, 올바른 새로운 가설을 세우는 일은 여전히 훨씬 어렵습니다. ([Nature](https://www.nature.com/articles/d41586-026-02804-x))

이 구분은 매우 중요합니다. AI는 그럴듯한 가설을 수천 개 생성할 수 있지만, 그중 어떤 가설이 추가 연구를 받을 가치가 있는지는 알지 못할 수 있기 때문입니다.

더 엄격한 검증은 모델이 충분한 힌트를 받은 후 알려진 이론을 제시할 수 있는지가 아닙니다. 진정으로 유용한 새로운 설명을 제안하고, 그 과정에서 이후의 답이 학습 데이터에 유출되지 않았다는 조건에서 모순을 식별할 수 있는지가 핵심입니다.

Talkie-1930은 정말 현대 지식에서 자유로운가?

완벽하지는 않습니다.

Talkie 팀은 시간적 누출을 공개적으로 보고합니다. 의도한 1930년 기준일에도 불구하고 13B 모델은 루스벨트의 대통령직, 뉴딜, 제2차 세계 대전, 유엔, 전후 독일 등 이후 사건에 관한 일부 정보를 알고 있는 것으로 보입니다.

  • 연구진은 미래의 정보가 겉보기에는 역사적인 말뭉치에 유입될 수 있는 몇 가지 경로를 규명합니다.
  • 잘못된 출판 날짜;
  • 오래된 책에 추가된 후대의 각주와 주석;
  • 잘못 분류된 문서;
  • 디지털화 및 OCR 오류.

이 한계는 근본적입니다.

실험에서 모델이 한 번도 보지 못한 것을 독자적으로 발견했다고 주장하려면, 연구진은 먼저 해당 답이 실제로 없었다는 강력한 증거를 제시해야 합니다.

역사적 AI에서는 데이터 출처도 벤치마크의 일부입니다.

Talkie의 지식은 역사적이지만, 사후 학습까지 전부 역사적인 것은 아닙니다

또 다른 미묘한 한계가 있습니다.

기반 모델은 역사적 데이터로 학습되지만, 유용한 지시 따르기 어시스턴트를 만들려면 1930년에는 존재하지 않았던 사후 학습 데이터가 필요합니다.

연구진은 역사적 참고 자료에서 지시 예시를 생성했지만, 이후 단계에서는 현대의 Claude 모델도 사용했다고 보고합니다. 여기에는 평가자로 사용된 Claude Sonnet 4.6과 합성 대화 생성에 사용된 Claude Opus 4.6이 포함됩니다. ([Talkie](https://talkie-lm.com/introducing-talkie))

이로 인해 서로 혼동해서는 안 되는 두 가지 형태의 오염이 발생합니다.

지식 유출 행동에 미치는 영향
현대적 사실이 모델에 유입됨 현대 모델이 모델의 응답 방식에 영향을 줌
역사적 지식의 경계를 깨뜨림 문체, 지시 따르기 또는 추론 습관을 바꿀 수 있음

따라서 Talkie는 주로 과거의 지식을 담고 있으면서도, 1930년에 구축된 가상의 지능형 시스템처럼 정확히 작동하지는 않을 수 있습니다.

역사 AI가 데이터 품질 실험이기도 한 이유

역사 언어 모델은 현대 웹 모델이 대부분 피하는 문제에 직면합니다. 학습 자료의 대부분이 처음부터 디지털 형식으로 생성되지 않았기 때문입니다.

책, 신문, 특허 및 학술지는 먼저 스캔한 페이지에서 텍스트로 변환해야 합니다.

Talkie 팀은 통제된 실험에서 기존 방식으로 OCR 처리한 역사적 텍스트가 사람이 전사한 버전의 학습 효율의 약 30%만 제공했다고 보고합니다. 간단한 정제를 거치자 그 수치는 약 70%로 상승했습니다. ([Talkie](https://talkie-lm.com/introducing-talkie))

텍스트 출처 보고된 상대적 학습 효율
사람이 전사한 텍스트 100%
기존 OCR ~30%
정제된 OCR ~70%

이는 더 넓은 교훈을 보여 줍니다. 토큰이 많다고 해서 더 유용한 학습 데이터가 되는 것은 아닙니다.

이는 비공개 데이터 세트를 위한 로컬 AI 처리가 아카이빙 작업에서 중요한 또 다른 이유이기도 합니다. OCR, 색인, 임베딩 및 실험용 코퍼스를 저장된 원본 자료 가까이에서 처리할 수 있으므로, 모든 문서를 원격 서비스를 거칠 필요가 없습니다.

Talkie-1930을 로컬에서 실행할 수 있나요?

예.

공식 Talkie 저장소는 Apache 2.0 라이선스에 따라 공개 가중치와 추론 코드를 제공합니다.

현재 참조 BF16 설정에는 다음이 명시되어 있습니다.

요구 사항 참조 요구 사항
Python 3.11+
PyTorch 2.1+
GPU CUDA 지원
VRAM BF16에 최소 28GB
스토리지 모델당 약 26–50GB

아주 작은 CPU 모델은 아니지만, 현실적인 워크스테이션 또는 홈 AI 서버 연구 워크로드입니다.

로컬 배포에서 체크포인트 크기는 시작점일 뿐입니다. 런타임 메모리, 컨텍스트, 캐시 및 기타 모델 구성 요소도 리소스를 사용하므로, 단순히 파일 크기를 비교하는 것보다 모델 메모리 사용량이 더 중요합니다.

다운로드한 후에는 독점 추론 API 없이도 Talkie를 사용할 수 있습니다. 덕분에 정확한 모델 버전을 더 쉽게 보존하고 실험을 더 쉽게 재현할 수 있습니다.

완전히 재현 가능한 설정을 위해서는 외부 서비스에 영구적으로 접근할 수 있다고 가정하는 대신 모델 파일, 토크나이저, 데이터 세트 및 필요한 종속 항목도 로컬에서 사용할 수 있도록 유지해야 합니다. 이는 오프라인 사용이 가능한 로컬 AI 워크플로의 기본 원칙과 같습니다.

역사적 언어 모델은 실제로 무엇에 유용할까요?

Talkie의 장기적인 가치는 1930년의 누군가와 대화하는 척하는 데 있지 않습니다.

연구 용도 질문
오염 내성 평가 모델은 자신의 시대에 담길 수 없었던 문제를 해결할 수 있을까요?
과학적 발견 진정으로 지식 기준일 이후의 아이디어를 도출할 수 있을까요?
예측 연구 이전 정보만으로 이후 사건을 얼마나 예측할 수 있을까요?
데이터 분포 연구 능력 중 현대 웹 데이터에서 비롯되는 부분은 얼마나 될까요?
계산 역사학 한 시대의 문서에는 어떤 기대가 담겨 있을까요?
일반화 연구 모델은 예시를 통해 익숙하지 않은 개념을 학습할 수 있을까요?

연구진은 이미 뉴욕 타임스의 역사적 사건 설명 약 5,000개를 사용해, 이전 정보로 학습한 모델에게 미래의 사건이 얼마나 “놀랍게” 보이는지 측정했습니다. 이는 공상과학적인 의미의 예측은 아니지만, 예측 가능 범위를 연구하는 새로운 방법을 제공합니다. ([Talkie](https://talkie-lm.com/introducing-talkie))

Talkie가 현대 AI 지능에 대해 보여주는 것

Talkie의 현대판 쌍둥이는 이례적으로 유용한 비교를 가능하게 합니다.

정보 환경이 크게 변해도 아키텍처와 학습 컴퓨팅 자원은 유사하게 유지될 수 있습니다.

현대 데이터 모델은 많은 기존 작업에서 더 뛰어난 성능을 보입니다. 그중 일부는 더 정제된 데이터에서 비롯될 수 있습니다. 일부는 현대 웹에 역사적 코퍼스에는 없는 프로그래밍, 기술 문서, Q&A, 과학적 설명, 다양한 형태의 구조화된 문제 해결이 포함되어 있기 때문일 수 있습니다.

이는 더 근본적인 질문을 제기합니다:

오늘날 AI의 능력 중 모델 아키텍처에서 비롯되는 부분과, 현대 인터넷에 축적된 구조를 압축한 데서 비롯되는 부분은 각각 얼마나 될까?

오픈 모델과 프런티어 AI 비교를 평가할 때도 이 질문은 관련이 있습니다. 벤치마크 점수만으로는 차이가 아키텍처, 데이터, 사후 학습, 도구 또는 순수한 학습 규모에서 비롯된 것인지 알 수 없습니다.

더 나은 질문은 “AI가 생각할 수 있는가?”가 아닙니다.

AI가 “정말로 생각하는가”에 대한 논쟁은 빠르게 철학적인 문제로 변합니다.

역사적 모델은 더 검증하기 쉬운 질문을 제시합니다.

알려진 답을 기억하는 것이 불가능하거나, 적어도 그럴 가능성을 크게 낮출 수 있는 실험을 설계할 수 있을까요?

Talkie-1930은 완벽한 해결책이 아닙니다. 코퍼스에는 일부 시간적 누수가 포함되어 있습니다. 역사적 OCR은 잡음이 많습니다. 현대적인 사후 학습은 행동에 영향을 줍니다. 그리고 13B 모델은 여전히 현재의 최첨단 시스템보다 훨씬 약합니다.

하지만 이러한 한계는 측정하고 개선할 수 있습니다.

따라서 중요한 성과는 Talkie가 현대 과학을 재발견했다는 것이 아닙니다. 실제로 그런 일은 일어나지 않았습니다.

이 모델의 가치는 연구자들이 미래의 모델이 오래된 증거를 접하고, 누락된 무언가를 식별하고, 새로운 가설을 세우고, 학습 세계에는 실제로 존재하지 않았던 결론에 도달할 수 있는지를 더 깔끔하게 질문할 수 있게 해준다는 데 있습니다.

이는 인터넷에서 이미 수천 번 논의된 벤치마크에서 또다시 높은 점수를 얻는 것보다 일반화의 훨씬 강력한 증거가 될 것입니다.

Talkie-1930에 관해 자주 묻는 질문

Talkie-1930은 제2차 세계 대전에 대해 알고 있나요?

의도된 1930년 컷오프를 기준으로 하면 그럴 수 없어야 하지만, 연구자들은 일부 시간적 누수가 있었다고 인정합니다. 이 모델은 이후 사건에 대한 제한적인 정보를 알고 있는 것으로 보이며, 완전히 차단된 역사적 코퍼스를 만드는 일이 얼마나 어려운지 보여줍니다.

Talkie-1930은 Python을 작성할 수 있나요?

제한적인 범위에서는 그렇습니다. 문맥에 Python 예시가 제공되었을 때 Talkie는 Python이 의도된 사전 학습 시대에 존재하지 않았음에도 간단하고 올바른 프로그램과 수정본을 일부 생성했습니다. 이는 제한적인 문맥 내 일반화를 뒷받침하지만, 프로그래밍을 독립적으로 발명했다는 뜻은 아닙니다.

어떤 AI가 아인슈타인 테스트를 통과한 적이 있나요?

아니요. 현재까지의 역사적 모델 실험에서는 발견 이전의 지식만으로 아인슈타인급 과학적 돌파구를 독립적으로 재현하지 못했습니다.

Talkie-1930을 로컬에서 실행할 수 있나요?

예. 가중치와 추론 코드는 Apache 2.0 라이선스로 공개되어 있습니다. 공식 BF16 참조 설정에는 모델당 최소 28GB의 CUDA VRAM과 약 26-50GB의 저장 공간이 필요하다고 나와 있습니다.

역사적 언어 모델은 왜 유용한가요?

연구자들이 벤치마크 오염을 줄인 상태에서 일반화를 테스트하고, 과학적 발견과 예측을 연구하며, 서로 다른 학습 데이터 시대를 비교하고, 현대 모델의 역량 중 얼마나 많은 부분이 현대 웹에 노출된 데서 비롯되는지 조사하는 데 도움이 됩니다.

기술 및 AI 허브

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.