Inkling benmchmark results vs other AI models. Source: Thinking MachinesMira Murati. Image: OpenAI

Em resumo

  • O Thinking Machines Lab lançou o Inkling em 15 de julho – um modelo de IA multimodal de 975 bilhões de parâmetros treinado do zero, com peso total no Hugging Face sob uma licença Apache 2.0.
  • Inkling pontua 74,1% no MCP Atlas – quase 30 pontos acima do Nemotron 3 Ultra da Nvidia – tornando-o o modelo ocidental de peso aberto com melhor desempenho no uso de ferramentas de agente. Os modelos chineses GLM 5.2 e Kimi K2.6 ainda lideram em vários benchmarks importantes.
  • A Thinking Machines levantou US$ 2 bilhões com uma avaliação de US$ 12 bilhões em julho de 2025, depois supostamente buscou um aumento de US$ 50 bilhões em novembro, antes que essas negociações fracassassem em janeiro de 2026.

Mira Murati deixou a OpenAI em setembro de 2024 para fazer suas próprias coisas. Quase dois anos depois, essa exploração foi lançada. A Thinking Machines Lab, empresa que ela fundou, lançou o Inkling – um modelo de IA multimodal treinado inteiramente do zero, com todos os pesos disponíveis para download gratuito.

Quando o conselho da OpenAI demitiu Sam Altman em novembro de 2023, Murati – então CTO – foi nomeado CEO interino. Altman foi reintegrado cinco dias depois, Murati voltou ao CTO e saiu definitivamente cerca de 10 meses depois disso. Ela fundou o Thinking Machines Lab em fevereiro de 2025.

A empresa então ficou quieta – e rica. Ela levantou US$ 2 bilhões com uma avaliação de US$ 12 bilhões em julho de 2025, liderada por Andreessen Horowitz com Nvidia, Accel, ServiceNow, Cisco, AMD e Jane Street ao lado – uma das maiores rodadas de sementes na história do Vale do Silício na época.

Relatórios de novembro de 2025 fizeram com que a empresa buscasse uma nova rodada com uma avaliação de US$ 50 bilhões. Essas negociações fracassaram em janeiro de 2026.

O que é Inkling

Inkling é um modelo misto de especialistas – uma arquitetura onde apenas uma parte da rede é ativada para qualquer entrada, mantendo a inferência rápida sem sacrificar a profundidade. É um modelo muito grande: possui 975 bilhões de parâmetros totais (as configurações internas que definem como o modelo processa as informações), com 41 bilhões ativos por tarefa, então esqueça de executá-lo em sua máquina local.

Sendo multimodal, este modelo aceita texto, imagens e áudio e suporta uma janela de contexto – a quantidade de texto que o modelo pode raciocinar de uma vez – de 1 milhão de tokens, aproximadamente 750.000 palavras. Ele foi pré-treinado em 45 trilhões de tokens, abrangendo texto, imagens, áudio e vídeo.

“Nosso primeiro modelo, Inkling. Treinados do zero, os pesos estão abertos e podem ser ajustados no Tinker hoje”, escreveu Murati no X. O fato de ser treinado do zero significa muito, especialmente na comunidade de código aberto, pois pode trazer uma lufada de ar fresco para desenvolvedores ocidentais que desconfiam da China, mas precisam usar modelos asiáticos para seus desenvolvimentos, porque as principais empresas de IA no mundo ocidental estão principalmente focadas no envio de modelos de código próximo.

O ajuste fino é o processo de reciclagem de um modelo existente em um conjunto de dados especializado para melhorar seu desempenho em uma tarefa específica. Tinker é a plataforma em nuvem da Thinking Machines construída em torno desse caso de uso. Os pesos completos também estão no Hugging Face sob uma licença Apache 2.0, sem restrições.

As vitórias mais claras de Inkling vêm em tarefas de agência. No MCP Atlas – que mede a confiabilidade com que um agente de IA conclui tarefas do mundo real usando o Model Context Protocol, o padrão aberto para conectar assistentes de IA a ferramentas e serviços externos, pontuado como porcentagem de tarefas concluídas – o Inkling registra 74,1%. Isso é quase 30 pontos acima do Nemotron 3 Ultra da Nvidia, o principal rival ocidental de peso aberto na comparação.

No SWE-Bench Verified – um teste para saber se um agente de IA pode corrigir de forma autônoma bugs reais de software do GitHub, pontuado como uma porcentagem de problemas resolvidos – o Inkling obteve 77,6%, também acima dos 70,7% do Nemotron.

No geral, a Thinking Machines está vendendo este modelo como “completo” e generalista. Isso significa que ele não compromete a qualidade em um conjunto específico de tarefas porque seus recursos se concentram em outra coisa (como modelos que são ótimos em codificação, mas são péssimos em escrita criativa, por exemplo).

Fonte: Máquinas Pensantes

Os modelos chineses ainda levam vantagem em diversas frentes. O GLM 5.2 da Z.ai pontua 82,7% no Terminal Bench 2.1 – um benchmark que mede agentes autônomos de codificação de IA em um ambiente de terminal real, pontuado como porcentagem de tarefas concluídas – contra 63,8% do Inkling. Kimi K2.6 lidera o Último Exame da Humanidade, um teste de raciocínio científico em nível de doutorado.

Máquinas Pensantes reconhece isso. Inkling não é o modelo mais forte disponível hoje, aberto ou fechado.

O que é é o modelo de pesos abertos mais capaz construído por um laboratório ocidental. Os desenvolvedores que, por motivos legais, de segurança ou de conformidade, não roteiam cargas de trabalho por meio de modelos construídos em Pequim, agora têm uma alternativa real aos modelos chineses auto-hospedados.

Agora, esses desenvolvedores têm um modelo que (embora pior que os melhores modelos chineses em quase tudo) se alinha melhor com seus ideais, expectativas e valores. Os ajustes finos subsequentes podem fazer com que este modelo se destaque em tarefas específicas, tornando esses ajustes competitivos em benchmarks em relação aos modelos asiáticos.

No FORTRESS Adversarial – que testa a consistência com que um modelo recusa solicitações genuinamente prejudiciais sem bloquear demais as legítimas, pontuado como uma porcentagem tratada corretamente – Inkling pontua 78,0%, a nota mais alta entre todos os modelos de peso aberto na comparação.

Juntamente com o Inkling, a Thinking Machines previu o Inkling-Small: 276 bilhões de parâmetros totais, 12 bilhões ativos, já correspondendo ao modelo maior na maioria dos benchmarks de raciocínio. Seus pesos chegam assim que o teste é concluído, sem nenhum cronograma fornecido.

Resumo Diário Boletim informativo

Comece cada dia com as principais notícias do momento, além de recursos originais, podcast, vídeos e muito mais.

Fontedecrypt

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *