<em>Moonshot’s flagship jumps from just over 1T to 2.8T in a single release, clearing DeepSeek’s 1.6T V4 Pro by a wide margin. The parameter count is the part of K3 that has drawn the most attention — and explains the least about how it runs.</em> <em><a href="https://www.artificialintelligence-news.com/news/kimi-k3-open-weight-model-memory-compute-china/Source: Kimi">Source: Kimi</a></em>

O modelo de peso aberto Kimi K3 da Moonshot AI foi lido quase inteiramente através de sua contagem de parâmetros desde que foi lançado em 16 de julho. Com 2,8 trilhões de parâmetros, é o maior modelo de peso aberto lançado até o momento. Os tamanhos dos modelos são geralmente agrupados em colchetes aproximados e 2,8 trilhões de cartuchos no que a indústria chama de classe 3T. Um nível em que nenhum modelo disponível abertamente havia entrado antes.

O carro-chefe do Moonshot salta de pouco mais de 1T para 2,8T em um único lançamento, superando o 1.6T V4 Pro do DeepSeek por uma ampla margem. A contagem de parâmetros é a parte do K3 que mais chama a atenção — e que menos explica como ele funciona. Fonte: Kimi

A conclusão natural é que o Moonshot contornou as restrições de computação dos EUA. O próprio blog técnico da empresa sugere algo mais específico: o K3 não evita a restrição, mas sim a realoja, trocando computação por memória em quase todas as camadas do design.

Vale a pena compreender esse comércio, porque a computação e a memória não são restrições intercambiáveis ​​e não estão igualmente disponíveis para um laboratório chinês.

Por que o modelo aberto Kimi K3 é um problema de memória

Duas coisas diferentes determinam quanto custa operar um modelo grande. Uma delas é quantos cálculos a máquina faz para produzir cada palavra. A outra é quanto do modelo deve ser mantido pronto e acessível instantaneamente durante todo o tempo em que estiver funcionando. O primeiro é calcular. A segunda é a memória. Os controles de exportação de chips pressionaram fortemente a China no início, e o projeto da Moonshot parece uma tentativa sustentada de gastar menos.

O movimento principal é uma técnica chamada mistura de especialistas. Em vez de executar o modelo inteiro para cada palavra, o K3 se divide em 896 seções especializadas e utiliza apenas 16 delas por vez, cerca de 1,8% do total. O cálculo por palavra cai drasticamente. A conta de memória não muda, porque todos os 2,8 trilhões de parâmetros ainda precisam estar carregados e prontos, caso sejam os próximos a serem chamados.

Então Moonshot foi diretamente atrás desse projeto. Ele treinou o K3 para trabalhar com quatro bits de precisão por parâmetro, em vez dos dezesseis habituais, um método conhecido como treinamento com reconhecimento de quantização, que a empresa aplicou desde o estágio de ajuste fino e diz ter escolhido “para ampla compatibilidade de hardware”, uma frase que vale a pena fazer uma pausa, pois pode ser lida como uma proteção contra a execução em silício que não seja o da Nvidia. As economias são substanciais. A análise independente do lançamento coloca o modelo em aproximadamente 1,4 TB nesse formato, contra os 5,6 TB que seriam necessários com precisão total.

A segunda mudança, Kimi Delta Attention, visa um custo de memória diferente. À medida que um modelo trabalha em um documento muito longo, ele acumula um armazenamento contínuo de tudo o que já leu. No limite anunciado do K3 de um milhão de tokens, alguns milhares de páginas, esse armazenamento, e não o modelo em si, torna-se a maior coisa na memória.

Moonshot é extraordinariamente direto sobre a participação comercial aqui. Ele contribuiu com código de cache para o projeto de serviço de código aberto vLLM e diz que essa combinação é o que permite que o preço do K3 seja competitivo, apesar do tamanho do modelo. Moonshot recomenda executar o K3 em 64 ou mais aceleradores conectados o suficiente para se comportarem como um pool.

Essa é a mesma abordagem por trás dos sistemas CloudMatrix da Huawei e aponta qual é a verdadeira solução alternativa. A memória pode ser acumulada em um grande número de chips individualmente normais. A computação de nível de treinamento não pode ser montada da mesma maneira.

Se esse agrupamento acontece no silício chinês é uma questão que o blog não responde. Os testes de nível de chip do Moonshot foram executados no Nvidia H200S e no que ele descreve apenas como um “GPGPU de um fornecedor alternativo”, que ele se recusa a nomear. Outros resultados são comparados com uma Nvidia L20, a placa reduzida vendida na China sob regras de exportação.

O blog não diz onde fica o hardware H200, e a Câmara dos EUA aprovou um projeto de lei em janeiro para fechar a brecha no aluguel de nuvem offshore que permitia às empresas chinesas acessar remotamente aceleradores restritos. A razão pela qual tudo isso é importante é que a memória, e não o poder de processamento, é onde a indústria de chips da China está mais atrasada.

Nas negociações comerciais em agosto de 2025, Pequim pediu alívio nas restrições à memória de alta largura de banda, em vez de ferramentas de litografia ou acesso TSMC, um sinal justo do que as autoridades consideram que é realmente vinculativo. A produção doméstica dessa memória está projetada em cerca de dois milhões de pilhas este ano, o suficiente para cerca de 250 mil a 300 mil chips Huawei Ascend classe 910C, enquanto a SMIC tem capacidade de wafer para mais de um milhão.

O que as empresas podem realmente implantar

Para as empresas desta região, a questão prática não é se a K3 está no topo da tabela de classificação. A questão é se um modelo aberto desse tamanho pode ser implementado. As empresas asiáticas procuram pesos abertos por três razões – preço, soberania de dados e cobertura em idiomas regionais – e os bancos e seguradoras em todo o Sudeste Asiático têm testado modelos abertos auto-hospedados especificamente para que os registos nunca saiam dos seus próprios sistemas.

Os pesos chegarão em 27 de julho, e qualquer organização que puder pagar pelo hardware estará livre para baixar, modificar e executar o K3 dentro de suas próprias paredes. A questão é quantos podem. Moonshot recomenda servir o modelo em 64 ou mais aceleradores conectados como um único pool, e os pesos sozinhos chegam a cerca de 1,4 TB no formato em que é enviado, com base em análises independentes, antes que a memória fosse necessária para trabalhar em um documento longo.

Esse é um compromisso do data center, não da sala de servidores. Para a maioria das empresas, o resultado prático é alugar capacidade dedicada em vez de possuí-la. Isso ainda mantém os dados no país e sob contrato, que é o que a maioria dos reguladores regionais pede. O que não proporciona é a independência dos fornecedores de infra-estruturas que, em primeiro lugar, levou muitos destes compradores a abrirem pesos.

O software também não está pronto. As duas principais mudanças arquitetônicas do K3 são novas o suficiente para que as ferramentas padrão de código aberto para execução de modelos ainda não as suportem, e Moonshot diz que está trabalhando com parceiros de inferência e mantenedores de código aberto para alinhar os detalhes técnicos antes do lançamento. As equipes que planejam uma implantação auto-hospedada devem tratar a data de lançamento e a data de utilização como coisas diferentes.

O preço também mudou. K3 custa US$ 3 por milhão de tokens de entrada, caindo para US$ 0,30 quando o modelo viu recentemente essa entrada, e US$ 15 por milhão de tokens de saída. Isso está bem abaixo dos US$ 50 de produção do Fable 5, mas muito acima do GLM-5.2 da z.ai, de US$ 4,40, e do DeepSeek V4, de US$ 0,87. O K3 não está mais no nível orçamentário que seus antecessores ocupavam.

Ele também é iniciado com esforço de raciocínio máximo como única configuração, com modos mais baixos a serem seguidos, de forma que longas cadeias de raciocínio e etapas repetidas se somam rapidamente. As empresas devem fazer um orçamento com base no custo de uma tarefa concluída, e não no preço de tabela.

O que é reivindicado e o que é verificado

A Arena colocou o K3 em primeiro lugar em sua avaliação do Frontend Code com 1.679 pontos, à frente do Fable 5, em testes cegos para desenvolvedores, conforme relatado por Ferragens do Tom. Esse resultado é real. É também uma referência em um domínio.

O próprio Moonshot é mais contido do que suas manchetes. A empresa afirma que o desempenho geral do K3 ainda está atrás de Claude Fable 5 e GPT 5.6 Sol, e lista três limitações: a qualidade da geração pode se tornar altamente instável se um chicote falhar em transmitir o conteúdo do pensamento histórico, o modelo pode tomar decisões inesperadas em nome do usuário quando a intenção é ambígua, e mostra uma lacuna notável na experiência do usuário em relação ao Fable 5 e GPT 5.6 Sol.

Suas próprias notas de rodapé também revelam que o Fable 5 atingiu falhas em 35% das tarefas na avaliação da SWE Marathon do Moonshot, o que pode ter afetado a pontuação medida desse modelo. Todo o resto continua sendo uma reivindicação da primeira parte. Nenhum número K3 publicado pode ser verificado de forma independente até que os pesos sejam públicos.

Analistas do Bank of America liderados por Alex Liu disseram em nota que K3 mostra que o pré-treinamento em grande escala combinado com o trabalho arquitetônico ainda pode proporcionar ganhos de mudança radical para os principais modelos chineses, apesar das restrições de computação, que é a versão sóbria do argumento, e mais próximo do que o blog apóia.

A direção da viagem não está em disputa. Os modelos de peso aberto movimentaram 29% de todos os tokens roteados através do gateway de produção da Vercel em junho, ante cerca de um nono do volume em abril, enquanto representavam menos de 4% dos gastos. 27 de julho é quando descobrimos quanto de K3 pertence a essa coluna.

Quer saber mais sobre IA e big data dos líderes do setor? Confira a AI & Big Data Expo que acontece em Amsterdã, Califórnia e Londres. O evento abrangente faz parte da TechEx e está localizado junto com outros eventos de tecnologia líderes, incluindo o Cyber ​​Security & Cloud Expo. Clique aqui para mais informações.

AI News é desenvolvido pela TechForge Media. Explore outros eventos e webinars de tecnologia empresarial futuros aqui.



Fontesartificialintelligence

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *