IBM ha lanciato i nuovi modelli della sua famiglia di modelli linguistici di grandi dimensioni a peso aperto, progettati per essere scaricati e auto-ospitati. I nuovi Granite 4.2 sono disponibili in varianti da 3B, 8B e 30B parametri.

Come le versioni precedenti, IBM adotta un approccio decoder-only. Queste nuove release offrono nativamente una finestra di contesto di 128.000 token. Le varianti 8B e 30B (non quella 3B) passano anche attraverso un blocco di apprendimento per rinforzo agentico; sono state addestrate per capacità estese come l'uso del terminale, la ricerca sul web o l'uso di strumenti esterni. Anche il modello 3B supporta gli strumenti, ma senza lo stesso livello di addestramento specializzato.

Oltre a queste modifiche, questa release è particolarmente degna di nota perché, come scrive la stessa IBM, "Granite 4.2 è la release incentrata sul ragionamento della famiglia di modelli linguistici Granite".

Quando ricercatori o sviluppatori del settore dicono che un modello è capace di ragionare, non intendono nel senso che spesso assumiamo quando parliamo di ragionamento umano; i modelli non comprendono consapevolmente il problema. Invece, si riferiscono a un ragionamento funzionale, in particolare tramite la "catena di pensiero" e il trasporto di risultati intermedi attraverso più passaggi.

Per l'utente, ciò significa risposte più rigorose e accurate in alcuni casi, ma spesso tempi di risposta più lenti e maggiori richieste di calcolo.

La famiglia di modelli Granite di IBM raramente fa notizia per essere la più veloce o la più aggressivamente innovativa. Rispetto anche ad altri concorrenti nello spazio enterprise locale, come Nvidia's Nemotron, la proposta sembra essere distribuzioni prevedibili - che è la priorità che ci si aspetterebbe da IBM in questi giorni.

C'è stato un'enorme quantità di discussioni sul costo e sulla carenza di calcolo attorno ai modelli cloud di frontiera di aziende come Anthropic o OpenAI ultimamente. In molti domini, sia sviluppatori individuali che organizzazioni enterprise hanno esplorato modelli locali come alternative più economiche.

Ciò ha anche portato a un maggiore interesse per i router di modelli - strumenti AI il cui compito principale è interpretare i prompt, i compiti o i progetti degli utenti e instradarli verso modelli adeguatamente dimensionati per bilanciare prestazioni, velocità e costo.

Modelli come questo sono anche popolari tra hobbisti, ricercatori AI e sviluppatori individuali perché possono essere sperimentati su hardware locale senza costi API per token.