A IBM lançou os modelos mais recentes de sua família de grandes modelos de linguagem de peso aberto, projetados para serem baixados e auto-hospedados. O recém-lançado Granite 4.2 vem em variantes de 3B, 8B e 30B parâmetros.

Como nas versões anteriores, a IBM está adotando uma abordagem apenas de decodificador aqui. Esses novos lançamentos oferecem uma janela de contexto de 128.000 tokens nativamente. As variantes de 8B e 30B (não a de 3B) também passam por um bloco de aprendizado por reforço agêntico; foram treinadas para capacidades expandidas, como usar o terminal, pesquisar na web ou usar ferramentas externas. O modelo de 3B também suporta ferramentas, mas sem o mesmo nível de treinamento especializado.

Além desses ajustes, este lançamento é particularmente notável porque, como a própria IBM escreve, "Granite 4.2 é o lançamento focado em raciocínio da família de modelos de linguagem Granite."

Quando pesquisadores ou desenvolvedores na área dizem que um modelo é capaz de raciocinar, eles não querem dizer no mesmo sentido que muitas vezes assumimos ao falar de raciocínio humano; os modelos não estão entendendo conscientemente o problema. Em vez disso, eles estão falando de raciocínio funcional, em particular via "cadeia de pensamento" e carregando resultados intermediários através de múltiplas etapas.

Para o usuário, isso significa respostas mais rigorosas e precisas em alguns casos, mas muitas vezes tempos de resposta mais lentos e maiores demandas computacionais.

A família de modelos Granite da IBM raramente ganha manchetes por ser a mais rápida ou a mais agressivamente inovadora. Em relação até mesmo a outros concorrentes no espaço empresarial local, como o Nemotron da Nvidia, a proposta parece ser implantações previsíveis - que é a prioridade que você pode esperar da IBM atualmente.

Tem havido uma enorme quantidade de discurso sobre o custo e a crise de computação em torno dos modelos de nuvem de fronteira de empresas como Anthropic ou OpenAI ultimamente. Em muitos domínios, tanto desenvolvedores individuais quanto organizações empresariais têm explorado modelos locais como alternativas mais baratas.

Isso também levou a um aumento do interesse em roteadores de modelos - ferramentas de IA cujo principal trabalho é interpretar prompts, tarefas ou projetos do usuário e roteá-los para modelos de escopo apropriado para equilibrar desempenho, velocidade e custo.

Modelos como este também são populares entre amadores, pesquisadores de IA e desenvolvedores individuais porque podem ser ajustados em hardware local sem taxas de API por token.