Modelo Laya explicado: o modelo de decisão de código aberto que pode executar localmente

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

A Laya não é outro modelo de linguagem pequeno a tentar tornar-se um ChatGPT mais barato. Não gera parágrafos token a token. Em vez disso, recebe um estado - como um email, um pedido de suporte, um registo de agente ou um objeto JSON - e devolve decisões estruturadas com probabilidades.

Isto coloca a Laya na mesma categoria emergente da Jev, da TypeSafe, mas com uma diferença importante: os pesos da Laya estão disponíveis sob a licença Apache 2.0 e o modelo pode ser executado inteiramente em hardware local. Para a IA local, isso torna a Laya mais interessante do que apenas mais um classificador rápido. Levanta uma questão mais abrangente: as decisões repetitivas de IA devem sequer ser enviadas para um modelo de fronteira?

O que é a Laya?

A Laya é um modelo de decisão não autorregressivo, com pesos abertos, desenvolvido pela Convai Innovations.

O principal checkpoint em inglês utiliza o ModernBERT-large como base e contém aproximadamente 421 milhões de parâmetros. Em vez de gerar linguagem arbitrária, a aplicação fornece um estado e uma ou mais perguntas tipadas.

Tipo de decisão O que a Laya devolve Exemplo
escolha Probabilidade entre opções predefinidas faturação / suporte / vendas
pontuação Valor esperado numa escala ordenada urgência de 0–4
noul P(verdadeiro) Este email é phishing?

Se essa interface lhe parece familiar, é porque a Jev utiliza um modelo de decisão tipado semelhante. O nosso guia anterior sobre modelos de decisão para agentes de IA explica por que razão esta categoria de modelos está a emergir.

A Laya é melhor compreendida como um motor de decisão aprendido

Um modelo generativo poderia receber:

“Leia este pedido de suporte e explique o que o cliente pretende.”

A Laya foi concebida para perguntas mais restritas:

  • Que departamento deverá recebê-lo?
  • É urgente?
  • Parece phishing?
  • Deverá outro modelo analisá-lo?
Modelo generativo Laya
Cria uma resposta arbitrária Seleciona resultados predefinidos
Gera tokens sequencialmente Pontua diretamente as opções
Útil para escrita e raciocínio Útil para encaminhamento e classificação
O comprimento da saída afeta a latência Sem uma sequência de saída longa

A distinção importante não é entre um “modelo inteligente e um modelo simples”. É saber se a aplicação precisa realmente de geração de linguagem.

Se o software só precisa de saber se é faturação, suporte técnico ou vendas, gerar um parágrafo e analisá-lo novamente para o converter numa enumeração é trabalho desnecessário.

Como é que a Laya toma decisões sem gerar texto?

De acordo com a documentação oficial da arquitetura, a Laya combina um codificador ModernBERT-large com aproximadamente 395 milhões de parâmetros, uma cabeça de decisão de duas camadas, pontuação de marcadores de opções e um componente de ação/escalamento.

Como o ModernBERT é bidirecional, a Laya pode considerar em conjunto o estado, a pergunta e as opções disponíveis, em vez de prever um resultado um token de cada vez.

Essa diferença arquitetural explica por que motivo um modelo de decisão pequeno pode ser atrativo para cargas de trabalho como:

  • encaminhamento de agentes;
  • triagem de e-mails;
  • moderação;
  • relevância de documentos;
  • deteção de intenção;
  • barreiras de segurança;
  • encaminhamento no fluxo de trabalho.

Estes são precisamente os tipos de tarefas rotineiras em que o encaminhamento híbrido de IA se torna útil: manter o trabalho repetitivo numa camada local mais barata e reservar um modelo maior para os casos difíceis.

A Laya tem realmente “zero alucinações”?

A documentação do projeto afirma que, como a Laya não gera texto, elimina erros de análise e alucinações.

Essa afirmação precisa de uma qualificação importante.

A Laya pode eliminar falhas como:

  • JSON malformado;
  • valores de enumeração inventados;
  • texto adicional em torno de uma resposta estruturada;
  • afirmações geradas livremente.

Mas ainda assim pode tomar a decisão errada.

Um modelo pode devolver:

faturação: 0,92

mesmo quando o pedido deveria ter sido encaminhado para o suporte técnico.

Um resultado tipado impede respostas inválidas. Não garante julgamentos corretos.

Essa distinção é fundamental se o resultado controlar um agente, um fluxo de trabalho de segurança, um processo financeiro ou uma ação automatizada.

Porque é que a calibração é mais importante do que um número de confiança

A Laya é treinada com RLCD, ou Aprendizagem por Reforço para Decisões Calibradas. O objetivo não é apenas selecionar a resposta certa, mas tornar útil a probabilidade apresentada.

Um sistema de produção poderia então utilizar a confiança para controlar o encaminhamento:

Confiança Ação possível
Muito alta Tratar automaticamente uma decisão de baixo risco
Média Perguntar a um modelo maior
Baixa Pedir revisão humana

Mas a própria documentação da Laya mostra por que motivo essas probabilidades não devem ser aceites cegamente. O projeto indica uma melhoria substancial da calibração após o ajuste da temperatura e recomenda calibrar o modelo no domínio de implementação.

Por outras palavras, um modelo concebido para decisões calibradas continua a precisar de calibração na sua carga de trabalho real.

O resultado mais importante da Laya não é a sua velocidade

Os números de latência publicados pela Laya são impressionantes. O projeto indica decisões curtas em dezenas de milissegundos numa Tesla T4, enquanto a implementação Laya-MLX independente indica aproximadamente 13,4 ms para o modelo em inglês e 7,4 ms para o checkpoint multilingue num M3 Max.

Estas medições confirmam que o Laya pertence a uma classe de implementação muito diferente da de um modelo generativo com vários milhares de milhões de parâmetros.

Mas o resultado mais revelador é o quanto o desempenho depende da especialização.

Na avaliação de decisões tipificadas do projeto, o modelo Laya base apresenta um desempenho apenas ligeiramente superior à referência aleatória quando utilizado sem exemplos. Após uma afinação específica para a tarefa, o checkpoint especializado melhora drasticamente.

Avaliação de decisões tipificadas Precisão comunicada
Referência aleatória ~0,318
Laya base, sem exemplos ~0,36
Laya com decisões tipificadas e afinação específica ~0,766

Isto altera a forma como o Laya deve ser entendido.

Não é necessariamente um modelo universal de raciocínio com 421 milhões de parâmetros que compreende magicamente todos os novos problemas de decisão.

A proposta mais forte do Laya é que um modelo pequeno pode ser especializado para uma superfície de decisão estável, calibrado e depois executado a custos extremamente baixos em grande volume.

A afinação pode ser mais importante do que o modelo base

O projeto publica ferramentas de treino e afinação juntamente com os checkpoints. Isto é significativo porque muitas decisões de produção são altamente específicas do domínio.

Considere:

  • Que equipa interna de suporte é responsável por este problema?
  • Este documento corresponde à nossa taxonomia privada?
  • Esta automatização doméstica deve ser executada?
  • Que agente deve receber esta tarefa?
  • Este ficheiro local requer uma análise de IA mais aprofundada?

Um modelo de uso geral pode responder a estas perguntas, mas pode gastar repetidamente recursos computacionais de um modelo grande a reconstruir um limite de decisão que quase não muda.

Um checkpoint especializado do Laya pode, em vez disso, aprender diretamente esse limite.

Isto enquadra-se numa tendência mais ampla de modelos abertos versus IA de fronteira: o modelo mais capaz não é automaticamente o modelo mais eficiente para uma carga de trabalho repetida e bem definida.

Onde o Laya ainda é fraco

Os resultados publicados também mostram limitações claras.

Espaços de etiquetas grandes são difíceis. A documentação do Laya recomenda limitar as perguntas de escolha a aproximadamente menos de 20 opções. As opções disponíveis partilham um orçamento fixo de tokens, pelo que taxonomias planas muito grandes podem degradar o desempenho.

Uma rota hierárquica faz frequentemente mais sentido:

Etapa Exemplo
Primeira decisão Faturação / Produto / Segurança / Conta
Segunda decisão Escolher uma de várias subcategorias

A pontuação ordinal é outra área mais fraca. Pedir a um modelo que escolha uma categoria é frequentemente mais fácil do que separar de forma fiável níveis muito próximos, como pontuações de frustração de 1 a 5.

O contexto também é limitado em comparação com os LLM modernos. O checkpoint em inglês utiliza um orçamento de entrada de 512 tokens, enquanto outras variantes do Laya o estendem para 1.024 tokens.

Isto significa que Laya é muito mais adequado para evidências selecionadas do que para inserir um documento longo completo no modelo.

Laya vs Jev: Modelo local aberto ou API de decisão gerida?

A Laya é frequentemente descrita como uma alternativa de código aberto à Jev, mas reduzir a comparação às pontuações dos benchmarks faz perder a diferença arquitetural mais importante.

Laya Jev
Função principal Decisões tipadas Decisões tipadas
Pesos abertos Sim Atualmente, não existem pesos públicos
Autoalojamento Sim Serviço alojado
Aperfeiçoamento Disponível Não existe atualmente um fluxo de trabalho local público equivalente
Caminho dos dados locais Possível O pedido é enviado para um serviço alojado
Encargo operacional O utilizador gere o modelo e a calibração O fornecedor gere a inferência

O checkpoint especializado da Laya apresenta uma precisão superior à da Jev num benchmark publicado de decisões tipadas, enquanto a Jev apresenta uma melhor calibração em parte da mesma comparação. Isto não constitui evidência suficiente para declarar um dos modelos universalmente melhor.

A maior diferença está no controlo.

A Jev fornece aos programadores um serviço de decisão gerido. A Laya fornece-lhes pesos de modelo que podem ser afinados, avaliados com benchmarks, fixados numa versão e implementados junto dos dados privados.

A Laya pode ser executada totalmente localmente?

Sim. Esta é a vantagem prática mais importante da Laya.

O modelo oficial é executado através do PyTorch e do Transformers. Os projetos da comunidade já alargaram a implementação a outros runtimes:

O principal checkpoint de 421M tem menos de 1 GB na representação publicada dos seus pesos, colocando-o numa classe de memória significativamente menor do que a maioria dos LLM generativos úteis.

Isto torna a Laya relevante para o problema prático de encaminhar modelos com base na utilização de memória. Um sistema não precisa de manter ativo um grande modelo generativo apenas para classificar cada pedido recebido.

Porque é importante executar localmente a camada de decisão

A inferência local não serve apenas para evitar o custo de uma API.

As entradas dos modelos de decisão são frequentemente sensíveis:

  • email;
  • pedidos de suporte;
  • documentos privados;
  • registos de clientes;
  • dados de origem;
  • rastos do agente;
  • resultados da pesquisa local.

Uma API de decisão alojada pode ser económica, mas a aplicação continua a ter de enviar o estado para algum local para classificação.

Laya permite outra arquitetura:

Camada local Camada de escalonamento
Obter ficheiros privados Raciocínio complexo
Classificar e atribuir pontuações localmente Modelo de fronteira
Detetar conteúdo sensível Síntese complexa
Encaminhar tarefas de rotina Casos-limite ambíguos

Esta é a mesma razão pela qual o processamento local de IA próximo dos dados armazenados é importante. Manter a decisão inicial junto dos dados pode reduzir tanto a exposição da rede como a inferência desnecessária na nuvem.

Laya pode tornar-se o filtro antes do modelo de grande escala

A arquitetura mais robusta pode não precisar de um LLM, mas sim de Laya.

Pode ser:

Camada Tarefa
Regras Lidar com casos determinísticos
Laya local Tratar de decisões difusas repetitivas
Modelo grande Tratar de raciocínios ou gerações difíceis
Política / pessoa Aprovar ações de grande impacto

Imagine um sistema de documentos privado com 10 000 registos locais. Um modelo de vanguarda não precisa de ler os 10 000 em profundidade.

Um pequeno modelo local pode começar por perguntar:

  • É relevante?
  • A que categoria pertence?
  • Contém informações sensíveis?
  • A confiança é suficientemente baixa para escalar?

Apenas o subconjunto difícil necessita de inferência dispendiosa.

Um assistente de IA privado num NAS é um ambiente óbvio para este padrão, porque o armazenamento, a pesquisa, a classificação e os dados pessoais podem permanecer locais, enquanto os pedidos mais difíceis são encaminhados seletivamente para níveis superiores.

O que o Laya realmente muda

Durante vários anos, a arquitetura de IA evoluiu no sentido de modelos cada vez mais gerais: um modelo que consegue raciocinar, programar, escrever, classificar, pesquisar e chamar ferramentas.

O Laya representa a ideia oposta.

Algumas tarefas poderão melhorar à medida que os modelos se tornam mais especializados, e não mais gerais.

Se um sistema precisar de milhões de avaliações, tais como:

relevante ou irrelevante?

seguro ou inseguro?

encaminhar para A, B ou C?

continuar ou escalar?

então, um modelo de decisão local de 421M pode ocupar uma camada económica e de privacidade muito diferente da de um LLM de vanguarda.

A questão importante, portanto, não é saber se o Laya consegue superar o Jev, o Claude, o Gemini ou o GPT em tudo.

Não consegue.

A pergunta mais útil é:

quantas decisões num fluxo de trabalho de IA nunca precisaram de um modelo generativo?

Se a resposta for «muitas», os pequenos modelos locais de decisão poderão tornar-se uma das camadas em falta na infraestrutura de IA prática.

Perguntas frequentes sobre o Laya

O que é o modelo Laya?

O Laya é um modelo de decisão não autorregressivo de pesos abertos da Convai Innovations. Recebe um estado e perguntas tipadas e devolve escolhas, pontuações ou probabilidades booleanas, em vez de gerar texto livre.

O Laya é de código aberto?

Os pesos do modelo são publicados ao abrigo da licença Apache 2.0, com recursos públicos de inferência, avaliação e afinação disponíveis no projeto.

O Laya pode ser executado localmente?

Sim. A implementação oficial é executada com PyTorch, enquanto os runtimes da comunidade suportam ONNX no Node.js e MLX em Apple Silicon. Não é necessária uma API de inferência alojada depois de o modelo ser transferido.

O Laya é melhor do que o Jev?

Não de forma universal. O Laya disponibiliza pesos abertos, autoalojamento e afinação, enquanto o Jev disponibiliza um serviço gerido de tomada de decisões alojado. Os benchmarks publicados mostram pontos fortes diferentes consoante o tipo de tarefa e a calibração.

Para que é melhor utilizado o Laya?

Laya é mais adequado para decisões limitadas repetitivas, como encaminhamento, moderação, avaliação de relevância, deteção de intenções, triagem de e-mails, verificações de segurança e decidir quando um modelo maior ou uma pessoa deve assumir o controlo.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.