Un dump del prompt di Claude da 269 KB è il tipo di numero che attira rapidamente l'attenzione. Sembra che Fable 5.1 abbia bisogno di un piccolo libro di istruzioni nascoste prima di poter rispondere a una domanda.
Questa non è la parte interessante. La cattura diffusa è meglio intesa come un'istantanea del runtime attorno al modello: istruzioni, strumenti, ricerca, comportamento della memoria, Skill, autorizzazioni e logica del prodotto. La storia più ampia è quasi l'opposto del titolo. I framework per agenti stanno diventando più grandi, mentre gli agenti validi cercano sempre più di caricare meno componenti alla volta.
Qual è il prompt di sistema di Claude Fable 5.1?
Un prompt di sistema è il livello di istruzioni ad alta priorità che determina il comportamento di un modello all'interno di un prodotto. Anthropic fornisce pubblicamente i prompt di sistema fondamentali di Claude utilizzati in Claude.ai e nelle sue app mobili, incluso Fable 5.1.
Quel prompt non è il modello in sé. Non contiene i pesi di Claude né i dati di addestramento e non rappresenta l'intero runtime di Claude. Quando un agente inizia a cercare, leggere file, individuare strumenti, caricare Skill o recuperare lo stato, molto più contesto può circondare le istruzioni fondamentali.
Il prompt di sistema di Fable 5.1 è davvero di 270.000 caratteri?
Una cattura di Fable 5.1 diffusa pubblicamente è stata stimata in circa 269 KB e 2.195 righe. Definirla tutta “il prompt di sistema” è comodo, ma tecnicamente fuorviante.
La cattura del runtime di Fable include materiale relativo a strumenti, memoria, ricerca, file, comportamento del prodotto e altri componenti del runtime. Un modello mentale migliore è un pacchetto di prompt del runtime: le istruzioni del modello più parti dell'ambiente che gli vengono esposte.
Esiste anche un'importante distinzione in materia di sicurezza. L'estrazione delle istruzioni del runtime non dimostra di per sé che i pesi del modello di Anthropic, le conversazioni degli utenti, le credenziali o i database di produzione siano stati compromessi.
Cosa contiene un moderno runtime per agenti AI?
Un chatbot può lavorare con istruzioni, una domanda e la cronologia della conversazione. Un agente può aver bisogno anche di strumenti, accesso ai file, ricerca, memoria, stato delle attività, autorizzazioni, servizi esterni e logica di ripristino. Sono questi livelli a trasformare un modello da qualcosa che risponde a qualcosa che può agire ripetutamente.
| Livello di runtime | Cosa aggiunge | Perché esiste |
|---|---|---|
| Istruzioni di sistema | Regole e comportamento | Definisce i limiti operativi |
| Strumenti | Azioni esterne | Consente al modello di influire su altri sistemi |
| Skill | Procedure riutilizzabili | Carica conoscenze operative specifiche dell'attività |
| Memoria | Stato persistente | Trasporta informazioni utili tra le attività |
| Ricerca e RAG | Conoscenza esterna | Recupera informazioni esterne ai pesi del modello |
| MCP e API | Connessioni ai servizi | Espone strumenti e dati |
| Stato di esecuzione | Avanzamento e artefatti | Consente di riprendere le attività lunghe |
Anthropic definisce sempre più questo approccio come ingegneria del contesto. Il problema non è più soltanto come formulare un prompt, ma decidere cosa merita di entrare in una finestra di contesto finita in quel preciso passaggio.
Che cos'è un harness per agenti IA?
Un harness per agenti è il software che circonda il modello e decide quale contesto riceve, quali strumenti può usare, come vengono eseguite le azioni e quale stato persiste in seguito. Il modello fornisce il ragionamento; l'harness trasforma quel ragionamento in un flusso di lavoro.
Ecco perché lo stesso modello di base può sembrare radicalmente diverso tra prodotti. Un harness per la programmazione può esporre repository, test, shell e stato dell'attività. Un harness per la ricerca può esporre ricerca, recupero, citazioni e agenti paralleli. Aggiungi le skill degli agenti IA e le procedure riutilizzabili diventano un altro livello che l'harness può individuare quando necessario.
La qualità del modello conta ancora. Ma quando i modelli diventano abbastanza capaci da usare gli strumenti in modo affidabile, l'orchestrazione inizia a contribuire molto di più al comportamento del prodotto.
Perché gli harness degli agenti IA stanno diventando così grandi?
Ogni nuova funzionalità comporta un sovraccarico di contesto. Uno strumento può richiedere un nome, uno schema, argomenti, regole d'uso, autorizzazioni ed esempi. Una Skill aggiunge procedure e risorse. Le attività lunghe accumulano cronologia, risultati degli strumenti, artefatti e stato incompleto.
Anthropic offre un utile riferimento di scala: collegare GitHub, Slack, Sentry, Grafana e Splunk può esporre 58 strumenti, le cui definizioni occupano circa 55.000 token di contesto prima ancora che inizi il lavoro utile. Il vincolo non è più la memoria del modello, ma quante informazioni operative competono per l'attenzione a ogni passaggio di inferenza.
Gli agenti a esecuzione prolungata amplificano il problema. L’infrastruttura deve preservare uno stato sufficiente per continuare il lavoro senza trascinare ogni osservazione precedente, tentativo fallito, risultato degli strumenti e istruzione in ogni chiamata futura.
Un’infrastruttura più ampia per gli agenti rende l’IA migliore?
No. Un ambiente disponibile più ampio può rendere un agente più capace; un contesto attivo più ampio può renderlo più lento, costoso e meno concentrato.
Gli strumenti irrilevanti competono con quelli rilevanti. Le vecchie memorie competono con le prove attuali. Le istruzioni ripetute consumano token senza aggiungere nuove informazioni. Ecco perché il contesto ripetuto degli agenti è importante anche dal punto di vista economico: un agente può riesaminare le stesse istruzioni e gli stessi schemi stabili in molte chiamate al modello.
L’obiettivo migliore, quindi, non è il contesto massimo. È il contesto minimo sufficiente: il più piccolo insieme ad alto valore informativo di istruzioni, strumenti, memorie ed elementi probativi in grado di completare il passaggio corrente.
In che modo le competenze degli agenti riducono le dimensioni del contesto?
Anthropic Agent Skills utilizza la divulgazione progressiva. Inizialmente l’agente può vedere metadati essenziali che descrivono una competenza, quindi caricare il relativo SKILL.md solo quando l’attività rende pertinente quella competenza. Gli script di supporto e i riferimenti possono rimanere fuori dal contesto finché non servono.
Questo cambia l’equazione della scalabilità. Un agente può avere accesso a un’ampia libreria di procedure senza pagare il costo di contesto derivante dalla lettura dell’intera libreria a ogni richiesta. La stessa idea è utile per i flussi di lavoro di IA locale, in cui procedure, script e risorse private possono rimanere riutilizzabili invece di diventare un unico prompt permanente e gigantesco.
In che modo la ricerca degli strumenti riduce l’uso dei token degli agenti?
Gli strumenti si stanno muovendo nella stessa direzione. Invece di caricare nello stato iniziale tutto lo schema di ogni strumento connesso, Claude Tool Search consente all’agente di individuare prima le funzionalità rilevanti e di caricarne le definizioni complete solo quando necessario.
Anthropic riferisce che il suo set di strumenti di esempio passa da circa 55K token a circa 8,7K token con Tool Search, con una riduzione dell'85%. Ancora più importante, un numero inferiore di strumenti irrilevanti facilita il problema della selezione.
La regola architetturale è semplice: disponibile non deve significare caricato. Un agente capace può avere accesso a centinaia di servizi, esponendone però solo una manciata al modello per l'attività corrente.
Perché gli agenti di lunga durata hanno bisogno di uno stato persistente?
Fable 5.1 supporta una finestra di contesto da 1 milione di token, ma una finestra più ampia non risolve ogni attività di lunga durata. Il contesto diventa comunque rumoroso, costoso e obsoleto.
Il lavoro di Anthropic sugli harness per agenti di lunga durata indica invece la necessità di uno stato esterno. Gli agenti possono lasciare file di avanzamento, elenchi di attività, codice, test e altri artefatti per le sessioni successive, invece di trasferire l'intera cronologia del lavoro sotto forma di token.
Questa distinzione è importante. La capacità della memoria e la memoria utile non sono la stessa cosa. Lo stato persistente dovrebbe essere archiviato al di fuori del prompt attivo, per poi essere recuperato quando diventa pertinente.
Dove dovrebbero risiedere la memoria, le competenze e i dati RAG dell'agente?
Quando il contesto diventa modulare, il modello non deve più possedere l'intero ambiente dell'agente. Le competenze possono risiedere in file. La memoria può risiedere nei database. Le fonti RAG possono rimanere in uno spazio di archiviazione privato. I server MCP e le API possono esporre i servizi solo quando l'harness ne ha bisogno.
Un flusso di lavoro RAG privato rende facile osservare questa separazione: i documenti sorgente e gli indici possono rimanere locali, mentre solo il contesto selezionato viene inviato a un modello frontier per il ragionamento più complesso.
| Livello di ragionamento | Livello agente persistente |
|---|---|
| Modello frontier | Competenze e procedure |
| Contesto dell'attività corrente | File sorgente RAG |
| Strumenti selezionati | Database e memoria |
| Ragionamento attivo | Servizi MCP e API |
| Risposta attuale | Artefatti, registri e backup |
Il vantaggio pratico è la portabilità. Il modello di ragionamento può cambiare, mentre i file, i flussi di lavoro, le Skill, la memoria e i dati di riferimento dell’utente rimangono intatti.
Un server domestico può diventare un livello runtime per gli agenti?
Sì, ma non perché 269 KB di testo richiedano un server. Il requisito di archiviazione del prompt in sé è trascurabile. Il caso d’uso del server domestico inizia quando l’agente dipende da file, indici, database, strumenti, registri, artefatti e servizi persistenti che dovrebbero sopravvivere indipendentemente da una singola sessione del modello.
Un server IA domestico può ospitare quel livello persistente, mentre i modelli cloud o locali si occupano del ragionamento. Se gli strumenti possono modificare tali risorse, anche la progettazione delle autorizzazioni è importante; iniziare con strumenti per agenti in sola lettura limita i danni che un’istruzione errata o un risultato di recupero possono causare.
Per gli utenti che desiderano un unico sistema sempre attivo per l’archiviazione e i servizi self-hosted, ZimaCube 2 si adatta più naturalmente a quel livello persistente, invece di fingere che sostituisca Fable 5.1. Il modello all’avanguardia può rimanere remoto; i file, i servizi, i dati RAG e gli artefatti non devono esserlo.
I prompt di sistema stanno diventando un sistema operativo per gli agenti?
L’analogia è utile solo fino a un certo punto. Un prompt di sistema è testo. Non può applicare autorizzazioni di archiviazione, isolare processi o controllare l’accesso alla rete come può fare un sistema operativo.
L’harness più ampio è più simile a un sistema operativo. Decide cosa il modello può vedere, quali funzionalità diventano disponibili, quale autorità ricevono gli strumenti, come persiste lo stato e come il lavoro prosegue tra una chiamata al modello e l’altra. Ecco anche perché l’automazione con agenti IA è in definitiva un problema di autorizzazioni e infrastruttura, non solo di qualità del modello.
La storia di Fable 5.1 punta quindi in una direzione diversa da «i prompt continueranno a diventare più lunghi». L’ambiente complessivo dell’agente continuerà ad ampliarsi, ma gli harness migliori recupereranno sempre più la Skill, lo strumento, la memoria e le evidenze giusti solo quando il passaggio corrente ne avrà bisogno.
Domande frequenti
Il prompt di sistema di Claude Fable 5.1 è pubblico?
Anthropic pubblica il prompt di sistema principale utilizzato da Fable 5.1 su Claude.ai e nei suoi prodotti mobili. Quel prompt ufficiale va distinto dalle acquisizioni di runtime di terze parti più ampie, che contengono il contesto degli strumenti e del prodotto.
Claude Fable 5.1 è stato hackerato?
L'estrazione di un prompt di runtime non dimostra di per sé una violazione dell'infrastruttura di Anthropic. Non ci sono prove pubbliche collegate a questa acquisizione del prompt che dimostrino la compromissione dei pesi del modello, delle conversazioni private, dei database dei clienti o delle credenziali.
Quanto è lungo il prompt di sistema di Fable 5.1?
Non esiste un unico numero utile senza definire cosa si sta misurando. È stato riferito che un'acquisizione del runtime di terze parti fosse di circa 269 kB e 2.195 righe, ma contiene più delle istruzioni di sistema principali di Anthropic.
Il prompt di Fable 5.1 ha esposto le memorie degli utenti?
Il materiale di runtime include istruzioni che descrivono il funzionamento della memoria. Le istruzioni relative a un sistema di memoria non equivalgono alle singole memorie archiviate degli utenti e non ci sono prove pubbliche, in questa acquisizione, che memorie private degli utenti siano state divulgate.
Qual è la differenza tra un prompt di sistema e un harness per agenti?
Un prompt di sistema fornisce al modello istruzioni ad alta priorità. Un harness per agenti è il livello software più ampio che gestisce istruzioni, strumenti, recupero, memoria, autorizzazioni, esecuzione e stato persistente attorno al modello.
Un prompt di sistema più lungo utilizza più token?
Sì, se quel testo viene effettivamente inserito nel contesto attivo del modello. Per questo Skill, recupero, Ricerca strumenti, memorizzazione nella cache e compattazione del contesto sono importanti: mantengono disponibili le funzionalità senza caricare tutto ogni volta.
Gli strumenti MCP consumano token di contesto?
Sì. Le descrizioni e gli schemi degli strumenti devono essere rappresentati per il modello quando deve selezionarli e chiamarli. La scoperta dinamica e il caricamento posticipato riducono il costo di esporre cataloghi di strumenti di grandi dimensioni.
La memoria dell'agente IA può essere archiviata localmente?
Sì. La memoria può essere archiviata in file locali, database, archivi vettoriali o altri servizi persistenti e recuperata selettivamente per attività successive. Il problema più complesso è decidere cosa archiviare, cosa considerare attendibile, cosa far scadere e cosa recuperare.
Claude Fable 5.1 può funzionare localmente?
Fable 5.1 non è disponibile come pesi di modello pubblici per la distribuzione locale ordinaria. Una configurazione ibrida può comunque utilizzare Fable 5.1 per il ragionamento all'avanguardia, mantenendo al contempo i dati privati, le fonti RAG, le Skill, la memoria e i servizi self-hosted sull'infrastruttura locale.
Hub Tecnologico e AI
Altro da leggere

In che modo il downsampling delle serie temporali influisce sul rilevamento delle anomalie nelle smart home?
Scopri come la larghezza dei bucket, l'aggregazione, l'anti-aliasing, i dati mancanti, la durata degli eventi e la conservazione multiscala modificano il tasso di rilevamento...

In che modo una griglia di occupazione combina segnali deboli della casa intelligente?
Scopri come le celle spaziali, i modelli dei sensori, gli aggiornamenti log-odds, il decadimento, le evidenze correlate e le soglie trasformano i deboli segnali...

In che modo la normalizzazione fotometrica influisce sul clustering privato dei volti?
Scopri come la correzione dell’illuminazione modifica i ritagli dei volti, gli embedding, le distanze tra i cluster, le soglie, l’eccessiva normalizzazione e la valutazione...

