Explicação do prompt de sistema do Claude Fable 5.1: Porque é que os ambientes de agentes estão a ficar tão grandes

Lauren Pan é o fundador da ZimaSpace e o arquiteto por trás da aclamada série ZimaBoard. Combinando design industrial com engenharia embutida, Lauren lançou a ZimaSpace com uma missão clara: democratizar a computação pessoal na nuvem. Ele acredita que o hardware deve ser tanto "hackeável" quanto bonito—fechando a divisão entre servidores de nível industrial e gadgets de consumo. Hoje, ele lidera a equipa de engenharia na criação de ferramentas que dão aos criadores controlo total sobre as suas vidas digitais.

Um despejo de 269 KB do prompt do Claude é o tipo de número que chama rapidamente a atenção. Parece que o Fable 5.1 precisa de um pequeno livro de instruções ocultas antes de conseguir responder a uma pergunta.

Essa não é a parte interessante. A captura divulgada é melhor entendida como um instantâneo da camada de execução em torno do modelo: instruções, ferramentas, pesquisa, comportamento da memória, Skills, permissões e lógica do produto. A história mais ampla é quase o oposto do título. As estruturas de agentes estão a ficar maiores, enquanto os bons agentes tentam cada vez mais carregar menos dessa maquinaria de cada vez.

O que é o prompt do sistema Claude Fable 5.1?

Um prompt do sistema é a camada de instruções de alta prioridade que molda o comportamento de um modelo dentro de um produto. A Anthropic disponibiliza publicamente os prompts do sistema principais do Claude utilizados no Claude.ai e nas respetivas aplicações móveis, incluindo o Fable 5.1.

Esse prompt não é o próprio modelo. Não contém os pesos do Claude nem os dados de treino e não corresponde à totalidade da camada de execução do Claude. Quando um agente começa a pesquisar, a ler ficheiros, a descobrir ferramentas, a carregar Skills ou a recuperar estado, muito mais contexto pode envolver as instruções essenciais.

O prompt do sistema do Fable 5.1 tem mesmo 270 mil caracteres?

Foi divulgado que uma captura do Fable 5.1 tinha aproximadamente 269 KB e 2 195 linhas. Chamar a tudo isso “o prompt do sistema” é conveniente, mas tecnicamente impreciso.

A captura da execução do Fable inclui material relacionado com ferramentas, memória, pesquisa, ficheiros, comportamento do produto e outros componentes de execução. Um modelo mental mais adequado é um conjunto de prompts de execução: as instruções do modelo, juntamente com partes do ambiente que lhe são expostas.

Existe também uma distinção importante em termos de segurança. A extração de instruções de execução não demonstra, por si só, que os pesos do modelo da Anthropic, as conversas dos utilizadores, as credenciais ou as bases de dados de produção tenham sido comprometidos.

O que existe numa camada de execução de um agente de IA moderno?

Um chatbot pode trabalhar com instruções, uma pergunta e o histórico da conversa. Um agente pode também precisar de ferramentas, acesso a ficheiros, pesquisa, memória, estado das tarefas, permissões, serviços externos e lógica de recuperação. São essas camadas que transformam um modelo de algo que responde em algo que pode agir repetidamente.

Camada de execução O que acrescenta Porque existe
Instruções do sistema Regras e comportamento Define limites operacionais
Ferramentas Ações externas Permite ao modelo afetar outros sistemas
Skills Procedimentos reutilizáveis Carrega conhecimento operacional específico da tarefa
Memória Estado persistente Transporta informação útil entre tarefas
Pesquisa e RAG Conhecimento externo Obtém informação fora dos pesos do modelo
MCP e APIs Ligações a serviços Expõe ferramentas e dados
Estado de execução Progresso e artefactos Permite retomar tarefas longas

A Anthropic enquadra cada vez mais isto como engenharia de contexto. O problema já não é apenas saber como formular um prompt. É decidir o que merece entrar numa janela de contexto finita neste passo específico.

O que é um sistema de suporte de agentes de IA?

Um sistema de suporte de agentes é o software em torno do modelo que decide que contexto recebe, que ferramentas pode utilizar, como as ações são executadas e que estado permanece depois. O modelo fornece o raciocínio; o sistema de suporte transforma esse raciocínio num fluxo de trabalho.

É por isso que o mesmo modelo subjacente pode parecer radicalmente diferente entre produtos. Um sistema de suporte para programação pode expor repositórios, testes, shells e o estado da tarefa. Um sistema de suporte para investigação pode expor pesquisa, recuperação de informação, citações e agentes em paralelo. Acrescente skills de agentes de IA, e os procedimentos reutilizáveis tornam-se outra camada que o sistema de suporte pode descobrir quando necessário.

A qualidade do modelo continua a ser importante. Mas, assim que os modelos se tornam suficientemente capazes de utilizar ferramentas de forma fiável, a orquestração começa a contribuir muito mais para o comportamento do produto.

Porque estão os sistemas de suporte de agentes de IA a ficar tão grandes?

Cada nova capacidade acarreta custos de contexto. Uma ferramenta pode precisar de um nome, um esquema, argumentos, regras de utilização, permissões e exemplos. Uma Skill acrescenta procedimentos e recursos. As tarefas longas acumulam histórico, resultados de ferramentas, artefactos e estado por concluir.

A Anthropic fornece uma referência de escala útil: ligar o GitHub, o Slack, o Sentry, o Grafana e o Splunk pode expor 58 ferramentas cujas definições ocupam cerca de 55 mil tokens de contexto antes de começar qualquer trabalho útil. A limitação já não é o armazenamento do modelo. É a quantidade de informação operacional que compete pela atenção em cada passo da inferência.

Os agentes de longa duração amplificam esse problema. O sistema de suporte tem de preservar estado suficiente para continuar o trabalho sem arrastar todas as observações anteriores, tentativas falhadas, resultados de ferramentas e instruções para cada chamada futura.

Um sistema de suporte maior torna a IA melhor?

Não. Um ambiente disponível maior pode tornar um agente mais capaz; um contexto ativo maior pode torná-lo mais lento, dispendioso e menos concentrado.

As ferramentas irrelevantes competem com as relevantes. As memórias antigas competem com as evidências atuais. As instruções repetidas consomem tokens sem acrescentar informação nova. É por isso que o contexto repetido dos agentes também é importante do ponto de vista económico: um agente pode voltar a consultar as mesmas instruções estáveis e os mesmos esquemas em muitas chamadas ao modelo.

Por conseguinte, o objetivo mais adequado não é o contexto máximo, mas sim o contexto mínimo suficiente: o conjunto mais pequeno de instruções, ferramentas, memórias e evidências com sinal elevado que pode concluir o passo atual.

Como é que as competências dos agentes reduzem o tamanho do contexto?

As competências de agentes da Anthropic utilizam divulgação progressiva. Inicialmente, o agente pode ver metadados leves que descrevem uma competência e, depois, carregar o respetivo SKILL.md apenas quando a tarefa torna essa competência relevante. Os scripts e as referências de apoio podem permanecer fora do contexto até serem necessários.

Isso altera a equação de escalabilidade. Um agente pode ter acesso a uma grande biblioteca de procedimentos sem suportar o custo contextual de ler toda a biblioteca em cada pedido. A mesma ideia é útil para fluxos de trabalho de IA local, onde os procedimentos, scripts e recursos privados podem continuar reutilizáveis, em vez de se tornarem num único prompt permanente gigantesco.

Como é que a pesquisa de ferramentas reduz a utilização de tokens dos agentes?

As ferramentas estão a seguir a mesma direção. Em vez de carregar o esquema de todas as ferramentas ligadas no contexto inicial, o Claude Tool Search permite ao agente descobrir primeiro as capacidades relevantes e carregar as respetivas definições completas apenas quando necessário.

A Anthropic relata que o seu conjunto de ferramentas de exemplo passa de cerca de 55 mil tokens para aproximadamente 8,7 mil tokens com a Pesquisa de Ferramentas, uma redução de 85%. Mais importante ainda, menos ferramentas irrelevantes tornam o problema de seleção mais fácil.

A regra arquitetónica é simples: estar disponível não significa ter de estar carregado. Um agente capaz pode ter acesso a centenas de serviços, disponibilizando apenas alguns ao modelo para a tarefa atual.

Porque é que os agentes de longa duração precisam de um estado persistente?

O Fable 5.1 suporta uma janela de contexto de 1 milhão de tokens, mas uma janela maior não resolve todas as tarefas de longa duração. O contexto continua a tornar-se ruidoso, dispendioso e desatualizado.

O trabalho da Anthropic sobre sistemas de suporte de agentes de longa duração aponta, em vez disso, para um estado externo. Os agentes podem deixar ficheiros de progresso, listas de tarefas, código, testes e outros artefactos para sessões posteriores, em vez de transportarem todo o histórico de trabalho como tokens.

Essa distinção é importante. A capacidade de memória e a memória útil não são a mesma coisa. O estado duradouro deve ser armazenado fora do prompt ativo e recuperado quando se tornar relevante.

Onde devem estar a memória, as competências e os dados RAG do agente?

Quando o contexto se torna modular, o modelo já não precisa de controlar todo o ambiente do agente. As competências podem existir como ficheiros. A memória pode existir em bases de dados. As fontes RAG podem permanecer num armazenamento privado. Os servidores MCP e as APIs podem expor serviços apenas quando o sistema de suporte precisa deles.

Um fluxo de trabalho RAG privado torna esta separação fácil de compreender: os documentos de origem e os índices podem permanecer locais, enquanto apenas o contexto selecionado é enviado para um modelo de fronteira para raciocínios mais complexos.

Camada de raciocínio Camada de agente persistente
Modelo de fronteira Competências e procedimentos
Contexto da tarefa atual Ficheiros de origem RAG
Ferramentas selecionadas Bases de dados e memória
Raciocínio ativo Serviços MCP e API
Resposta atual Artefactos, registos e cópias de segurança

A vantagem prática é a portabilidade. O modelo de raciocínio pode mudar, enquanto os ficheiros, fluxos de trabalho, Skills, memória e dados de referência do utilizador permanecem intactos.

Pode um servidor doméstico tornar-se uma camada de execução de agentes?

Sim, mas não porque 269 KB de texto necessitem de um servidor. O requisito de armazenamento do próprio prompt é trivial. O caso de um servidor doméstico começa quando o agente depende de ficheiros persistentes, índices, bases de dados, ferramentas, registos, artefactos e serviços que devem sobreviver independentemente de uma sessão de um modelo.

Um servidor de IA doméstico pode alojar essa camada duradoura, enquanto os modelos na nuvem ou locais tratam do raciocínio. Se as ferramentas puderem modificar esses recursos, o desenho das permissões também é importante; começar com ferramentas de agente só de leitura limita os danos que uma instrução mal formulada ou um resultado de recuperação podem causar.

Para os utilizadores que querem um sistema sempre ligado para armazenamento e serviços auto-hospedados, o ZimaCube 2 adapta-se mais naturalmente a essa camada persistente do que fingir que substitui o Fable 5.1. O modelo de fronteira pode continuar remoto; os ficheiros, serviços, dados RAG e artefactos não têm de o ser.

Os prompts do sistema estão a tornar-se um sistema operativo de agentes?

A analogia só é útil até certo ponto. Um prompt do sistema é texto. Não pode impor permissões de armazenamento, isolar processos ou controlar o acesso à rede da mesma forma que um sistema operativo.

O harness mais abrangente assemelha-se mais a um sistema operativo. Decide o que o modelo pode ver, que capacidades ficam disponíveis, que autoridade recebem as ferramentas, como o estado persiste e como o trabalho continua entre chamadas ao modelo. É também por isso que a automatização de agentes de IA é, em última análise, um problema de permissões e infraestrutura, e não apenas um problema de qualidade do modelo.

A história do Fable 5.1 aponta, portanto, numa direção diferente de «os prompts vão continuar a ficar mais longos». O ambiente total do agente continuará a expandir-se, mas os melhores harnesses irão cada vez mais obter o Skill, a ferramenta, a memória e as evidências certas apenas quando o passo atual delas necessitar.

Perguntas frequentes

O prompt de sistema do Claude Fable 5.1 é público?

A Anthropic publica o prompt de sistema principal utilizado pelo Fable 5.1 no Claude.ai e nos seus produtos móveis. Esse prompt oficial deve ser distinguido de capturas de execução maiores, de terceiros, que contêm contexto de ferramentas e produtos.

O Claude Fable 5.1 foi pirateado?

A extração de um prompt de execução, por si só, não prova uma violação da infraestrutura da Anthropic. Não existem provas públicas associadas a esta captura do prompt que demonstrem que os pesos do modelo, conversas privadas, bases de dados de clientes ou credenciais tenham sido comprometidos.

Qual é o comprimento do prompt de sistema do Fable 5.1?

Não existe um único número útil sem definir o que está a ser medido. Foi reportada uma captura de execução de terceiros com aproximadamente 269 KB e 2195 linhas, mas esta contém mais do que as instruções de sistema principais da Anthropic.

O prompt do Fable 5.1 expôs memórias dos utilizadores?

O material de execução inclui instruções que descrevem o comportamento da memória. As instruções sobre um sistema de memória não são o mesmo que as memórias individuais armazenadas dos utilizadores, e não existem provas públicas, nesta captura, de que memórias privadas de utilizadores tenham sido extraídas.

Qual é a diferença entre um prompt de sistema e um ambiente de execução de agentes?

Um prompt de sistema fornece ao modelo instruções de alta prioridade. Um ambiente de execução de agentes é a camada de software mais ampla que gere instruções, ferramentas, recuperação, memória, permissões, execução e estado persistente em torno do modelo.

Um prompt de sistema mais longo utiliza mais tokens?

Sim, se esse texto for efetivamente colocado no contexto ativo do modelo. É por isso que as Skills, a recuperação, a pesquisa de ferramentas, a colocação em cache e a compactação do contexto são importantes: mantêm as capacidades disponíveis sem carregar tudo de cada vez.

As ferramentas MCP consomem tokens de contexto?

Podem. As descrições e os esquemas das ferramentas têm de ser apresentados ao modelo quando este precisa de as selecionar e chamar. A descoberta dinâmica e o carregamento adiado reduzem o custo de expor catálogos extensos de ferramentas.

A memória dos agentes de IA pode ser armazenada localmente?

Sim. A memória pode ser armazenada em ficheiros locais, bases de dados, armazenamentos vetoriais ou outros serviços persistentes, e recuperada seletivamente para tarefas posteriores. O problema mais difícil é decidir o que deve ser armazenado, considerado fiável, eliminado por expiração e recuperado.

O Claude Fable 5.1 pode ser executado localmente?

O Fable 5.1 não está disponível como pesos de modelo públicos para implementação local comum. Uma configuração híbrida pode ainda usar o Fable 5.1 para raciocínio de ponta, mantendo os dados privados, as fontes RAG, as Skills, a memória e os serviços autoalojados na infraestrutura local.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.