Introdução
A corrida pela eficiência em inteligência artificial acaba de ganhar um novo capítulo. A Thinking Machines, startup liderada pela ex-CTO da OpenAI Mira Murati, anunciou o Inkling Small, um modelo de linguagem multimodal open source que consegue entregar praticamente o mesmo desempenho de seu antecessor com apenas um quarto do tamanho. O lançamento, que acontece apenas duas semanas após a estreia do Inkling original, marca um ponto de inflexão importante no desenvolvimento de modelos de IA: a busca por eficiência computacional está se tornando tão crucial quanto a capacidade bruta de processamento.
Com 276 bilhões de parâmetros totais e licença Apache 2.0, o Inkling Small representa uma alternativa atraente para empresas que desejam implementar IA avançada em suas próprias infraestruturas, mas enfrentam limitações de recursos computacionais. O modelo aceita entradas de texto, imagem e áudio, produz texto como saída e suporta contextos de até um milhão de tokens, mantendo-se competitivo com modelos significativamente maiores.
Arquitetura inovadora permite eficiência sem sacrificar capacidade
O segredo do Inkling Small está em sua arquitetura Mixture-of-Experts (MoE) esparsa. Embora o modelo possua 276 bilhões de parâmetros totais, ele utiliza apenas 12 bilhões de parâmetros ativos por token processado – uma redução dramática comparada aos 41 bilhões do Inkling original. Isso é possível através de um sistema inteligente de roteamento que direciona cada token para seis de 256 especialistas disponíveis, além de dois especialistas compartilhados que permanecem sempre ativos.
Essa abordagem permite que o modelo mantenha uma vasta capacidade de conhecimento aprendido enquanto ativa apenas uma fração dele durante cada etapa de inferência. É como ter uma biblioteca completa à disposição, mas consultar apenas os livros relevantes para cada pergunta específica. O resultado é um modelo que preserva a maior parte das capacidades do original enquanto reduz drasticamente os requisitos computacionais.
Nos benchmarks da Artificial Analysis, o Inkling Small alcançou uma pontuação de 40 no Intelligence Index, apenas um ponto abaixo do Inkling original que marca 41. Mais impressionante ainda, o modelo superou seu antecessor em várias avaliações específicas: obteve 80,2% no SWE-bench Verified (contra 77,6% do Inkling) e 64,7% no Terminal Bench 2.1 (contra 63,8%). Esses resultados sugerem que a equipe da Thinking Machines não apenas reduziu o tamanho do modelo, mas também refinhou seu desempenho em tarefas específicas.
Requisitos de hardware: ainda corporativo, mas mais acessível
Apesar do nome “Small”, é importante esclarecer que este não é um modelo para rodar em laptops ou computadores pessoais. O Inkling Small requer pelo menos 600 GB de memória GPU agregada em sua versão padrão BF16, podendo ser executado em configurações como 4 GPUs NVIDIA B300 ou 8 GPUs NVIDIA H200. Uma versão quantizada NVFP4 reduz esse requisito para aproximadamente 180 GB, permitindo execução em uma única NVIDIA B300.
Para colocar isso em perspectiva, mesmo as workstations mais poderosas disponíveis no mercado brasileiro raramente ultrapassam 48 GB de VRAM. Estamos falando de hardware empresarial especializado, com custos que podem facilmente ultrapassar centenas de milhares de reais. No entanto, quando comparado aos requisitos do Inkling original, a redução é significativa e pode tornar a implementação viável para um número maior de organizações.
A boa notícia é que, sendo open source, o modelo certamente será alvo de técnicas de quantização e otimização pela comunidade. É provável que versões ainda menores e mais eficientes surjam nos próximos meses, potencialmente tornando variantes do Inkling Small acessíveis para hardware mais modesto.
Licenciamento Apache 2.0: o padrão ouro para IA empresarial
Um dos aspectos mais importantes do Inkling Small é sua licença Apache 2.0, considerada o padrão ouro para software open source empresarial. Diferentemente de muitas licenças “abertas” customizadas que vemos no mundo da IA, a Apache 2.0 oferece liberdade genuína para uso comercial, modificação, distribuição e integração em produtos proprietários, exigindo apenas atribuição adequada.
Isso contrasta fortemente com lançamentos recentes como o Kimi K3 da Moonshot, que apesar de disponibilizar os pesos do modelo, o faz sob uma licença customizada com condições comerciais adicionais. Para equipes jurídicas e de procurement em empresas brasileiras, a simplicidade e familiaridade da Apache 2.0 pode ser decisiva na hora de aprovar a adoção do modelo.
A Thinking Machines também disponibilizou os pesos completos no Hugging Face e adicionou suporte para fine-tuning através de sua API Tinker. Com preços promocionais de lançamento começando em US$ 0,58 por milhão de tokens de entrada, o modelo se posiciona competitivamente no mercado de APIs de IA.
Pipeline de desenvolvimento acelerado indica maturidade da equipe
Talvez tão impressionante quanto o modelo em si seja a velocidade com que foi desenvolvido. Horace He, pesquisador da Thinking Machines, comentou que enquanto o lançamento do Inkling original “precisou de uma vila inteira”, o Inkling Small foi muito mais rotineiro – bastou passar um modelo menor pelo pipeline já estabelecido.
Isso sugere que a empresa construiu uma infraestrutura robusta e repetível para desenvolvimento de modelos, incluindo pré-treinamento, pós-treinamento, aprendizado por reforço, avaliação e lançamento. O Inkling Small se beneficiou de melhorias no mix de dados de pré-treinamento, ajustes na receita de machine learning e destilação usando o Inkling original como professor, seguido por duas semanas adicionais de aprendizado por reforço focado em tarefas de programação.
Essa capacidade de iterar rapidamente é crucial no competitivo mercado de IA. Enquanto gigantes como OpenAI, Google e Anthropic competem pelos modelos mais poderosos, a Thinking Machines parece estar apostando em um nicho diferente: modelos eficientes e verdadeiramente open source que empresas podem implementar e controlar.
Implicações para o mercado brasileiro
Para o mercado brasileiro de tecnologia, o Inkling Small representa uma oportunidade interessante. Empresas que desejam implementar IA avançada mas enfrentam restrições regulatórias sobre dados, custos elevados de APIs internacionais ou simplesmente preferem manter controle total sobre seus modelos agora têm uma opção viável.
Setores como financeiro, saúde e governo, que frequentemente precisam processar dados sensíveis localmente, podem se beneficiar especialmente. O modelo é particularmente adequado para assistentes de programação, sistemas de análise de documentos, aplicações de retrieval-augmented generation (RAG) e workflows multimodais – casos de uso cada vez mais comuns em empresas brasileiras.
No entanto, é importante notar que o modelo tem limitações. Sua performance em tarefas que exigem conhecimento factual extenso é inferior ao Inkling original, com uma pontuação negativa em AA Omniscience. Isso significa que para aplicações críticas que dependem de precisão factual absoluta, sistemas adicionais de verificação e validação continuarão sendo necessários.
Conclusão
O lançamento do Inkling Small pela Thinking Machines marca um momento importante na evolução da IA open source. Ao demonstrar que é possível manter performance competitiva com uma fração dos recursos computacionais, a empresa está ajudando a democratizar o acesso a modelos de linguagem avançados. A combinação de eficiência, licenciamento permissivo e capacidades multimodais torna o modelo uma opção atraente para empresas que buscam implementar IA em suas próprias infraestruturas.
Mais importante ainda, o rápido ciclo de desenvolvimento – apenas duas semanas entre os lançamentos – sugere que estamos entrando em uma nova fase de maturidade no desenvolvimento de modelos de IA. Se a Thinking Machines conseguir manter esse ritmo de inovação e eficiência, podemos esperar uma série de modelos cada vez mais acessíveis e poderosos nos próximos meses. Para o ecossistema brasileiro de IA, isso representa uma oportunidade única de reduzir a dependência de APIs proprietárias e construir soluções verdadeiramente soberanas.
Fonte original: Este artigo foi adaptado e traduzido a partir da matéria publicada em VentureBeat, disponível em https://venturebeat.com/technology/thinking-machines-debuts-inkling-small-open-source-ai-model-nearing-performance-of-predecessor-at-about-1-4-size.



