Bonsai. Image: Unsplash

Em resumo

  • O Bonsai 27B do PrismML é um modelo de IA de 27 bilhões de parâmetros compactado em 3,9 GB – pequeno o suficiente para rodar em um iPhone 17 Pro Max a 11 tokens por segundo, a primeira vez que um modelo nesse nível de capacidade superou o orçamento de memória de um smartphone.
  • A variante ternária retém 94,6% do desempenho de benchmark de precisão total, superando as compilações Qwen convencionais de “2 bits” que são quase duas vezes maiores e entram em colapso em tarefas matemáticas e de codificação abaixo de 4 bits.
  • A Apple está em negociações iniciais com PrismML sobre a tecnologia de compressão subjacente, de acordo com a CNBC, com a empresa visando um modelo Gemma compactado a seguir no pipeline.

Os modelos consomem muita memória. Um modelo de IA de 27 bilhões de parâmetros, considerado de tamanho médio pelos padrões da indústria, precisa de aproximadamente 54 GB de memória para funcionar com meia precisão. A maioria dos laptops não aguenta isso. Algumas plataformas de desktop também não podem.

No início desta semana, o PrismML lançou um com 3,9 GB – pequeno o suficiente para caber em um iPhone.

Os parâmetros são o número de dials e ajustes que um modelo pode suportar. Quanto mais parâmetros, mais denso e capaz é o modelo.

Bonsai 27B é o primeiro modelo da classe 27B a ultrapassar o limite de memória de um smartphone de consumo, rodando a 11 tokens por segundo em um iPhone 17 Pro Max. (Tokens são a unidade básica de informação que os modelos de IA podem manipular e produzir.) A variante ternária, de 5,9 GB, atinge cerca de 26 tokens por segundo em um laptop M5 Pro. Ambos são gratuitos no Apache 2.0.

O método de compressão, baseado na propriedade intelectual da Caltech, reduz o peso de cada modelo de 16 bits de precisão de ponto flutuante para um único sinal – +1 ou -1 na construção binária, um dos três valores no ternário. Cada grupo de 128 pesos compartilha um fator de escala de 16 bits, resultando na variante binária em 1,125 bits por peso: 14 vezes menor que o original de precisão total. O modelo ternário adiciona um estado zero para um poder um pouco mais expressivo e se estabelece em 1,71 bits.

Em termos mais simples, isso significa que um modelo ternário de IA usa apenas três configurações para cada valor interno – negativo, zero ou positivo – enquanto uma IA padrão pode escolher entre cerca de 65.000 configurações.

O PrismML fez isso sem perder muito da qualidade da saída.

O que torna isso diferente dos modelos convencionais de “baixo bit” é que nada obtém uma saída de escape de maior precisão: incorporações, atenção e o cabeçalho completo do modelo de linguagem são todos compactados de ponta a ponta. A maioria das compilações quantizadas mantém certas camadas sensíveis com precisão total, o que acaba aumentando seu tamanho em troca de melhor qualidade. Bonsai não joga esse jogo.

Este é o segundo grande lançamento da família. Em março, a PrismML lançou o Bonsai 8B, um modelo de 1,15 GB que provou que a arquitetura de 1 bit poderia sobreviver a 8 bilhões de parâmetros sem que seu raciocínio entrasse em colapso. O salto para 27 mil milhões é onde os riscos mudam – é nessa escala que o raciocínio sustentado da cadeia de pensamento, a utilização de ferramentas fiáveis ​​e o comportamento agente em vários passos realmente emergem de forma consistente – coisas que os modelos mais pequenos ainda se atrapalham.

Referências

Em 15 benchmarks avaliados no modo de pensamento em GPUs NVIDIA H100 – abrangendo conhecimento, matemática, codificação e uso de ferramentas – o Ternary Bonsai 27B tem média de 80,49, ou 94,6% do modelo de precisão total. A variante de 1 bit atinge 76,11.

No geral, em benchmarks, os modelos têm desempenho muito melhor do que Gemma 4 ou Qwen 3.6 em termos de potencial que oferecem para seu tamanho.

Os modelos são muito bons para o que oferecem e, considerando os poucos recursos que requerem, eles levam hardware pequeno (smartphones e PCs de baixo custo) a outro nível em termos de capacidades. AIME25 e AIME26, modelados no American Invitational Mathematics Examination, chegam a 93,7% para Ternary Bonsai 27B contra 95,3% para o muito maior Qwen 3.6B. Bonsai marca 86 pontos em codig vs 88 para Qwen 3.6 e 77% em conhecimento geral vs 83 para Qwen 3.6.

O modelo também usa um backbone de atenção híbrido, onde cerca de 75% das camadas são lineares, em vez de atenção quadrática completa. Essa arquitetura é o que torna uma janela de contexto de 262 mil tokens prática no dispositivo – algo que uma pilha de atenção padrão tornaria proibitivamente cara no hardware do telefone.

Nós testamos

Nós mesmos executamos o Bonsai 27B. A codificação exige iteração: prompts únicos não competirão com modelos de fronteira de nuvem. Ser local e gratuito torna isso irrelevante. Para nosso jogo Zombie Type – um jogo de navegador de terror de digitação em primeira pessoa – duas rodadas de codificação de vibração produziram detecção de colisão limpa, lógica de pontuação adequada e gráficos que se mantiveram juntos. O modelo compreende a estrutura desde o início; a segunda passagem refina em vez de reconstruir.

Curiosamente, alguns modelos (como os esqueletos) pareciam mais elaborados que os do GPT 5.6 Sol. Isso não significa que seja melhor, apenas que nesta tarefa produziu um esqueleto bonito, enquanto o rei da IA ​​​​fez uma escolha estilística pior.

O jogo está disponível para teste aqui.

A escrita criativa é uma história mais qualificada e os critérios são mais subjetivos.

Grosso modo, os resultados não são particularmente imaginativos se você tiver em mente um aviso de tiro zero.

Dito isso, Bonsai produz histórias com lógica interna, ritmo e arco consistentes – melhor, ou no mesmo nível de Claude Haiku ou mesmo Sonnet em menor esforço em instruções comparáveis. Para um modelo que roda inteiramente em seu próprio hardware, sem custos de API, isso é muito a dizer.

A história criada pode ser encontrada em nosso repositório Github.

O PrismML também fornece uma camada de decodificação especulativa DSpark junto com o modelo – um redator leve que propõe blocos de tokens candidatos, que o modelo principal verifica em uma única passagem direta, em vez de gerar token por token. Em um H100 que adiciona um aumento de rendimento de 1,37x sem alteração na qualidade da saída, já que a verificação preserva a distribuição exata da saída. No Apple Silicon ainda não está habilitado por padrão, mas para servir GPU é um ganho real.

O interesse da Apple acrescenta uma dimensão comercial. O CEO da PrismML, Babak Hassibi, confirmou à CNBC que a empresa está em negociações iniciais com a Apple, que está avaliando a tecnologia de compressão para uso potencial no dispositivo.

Hassibi disse que um modelo Gemma compactado é o próximo a ser planejado, seguido por modelos de fronteira maiores; O Bonsai 27B de 1 bit está disponível para download gratuito agora no Apache 2.0. Se você precisar de uma introdução sobre a execução de modelos como este localmente, confira nosso guia.

Resumo Diário Boletim informativo

Comece cada dia com as principais notícias do momento, além de recursos originais, podcast, vídeos e muito mais.

Fontedecrypt

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *