IBM har rullat ut de senaste modellerna i sin familj av öppna språkmodeller med öppen vikt, designade för att laddas ner och köras lokalt. De nyligen lanserade Granite 4.2-modellerna finns i varianter med 3B, 8B och 30B parametrar.

Liksom tidigare versioner använder IBM en decoder-only-approach här. Dessa nya utgåvor erbjuder ett 128 000-token kontextfönster inbyggt. 8B- och 30B-varianterna (inte 3B) går också igenom ett agentiskt reinforcement-learning-block; de tränades för utökade förmågor som att använda terminalen, söka på webben eller använda externa verktyg. 3B-modellen stöder också verktyg, men utan samma nivå av specialiserad träning.

Utöver dessa justeringar är denna utgåva särskilt anmärkningsvärd eftersom, som IBM själv skriver, "Granite 4.2 är den resonemangsfokuserade utgåvan av Granite-språkmodellfamiljen."

När forskare eller utvecklare inom området säger att en modell är kapabel till resonemang, menar de inte det i samma mening som vi ofta antar när vi pratar om mänskligt resonemang; modellerna förstår inte problemet medvetet. Istället pratar de om funktionellt resonemang, särskilt via "chain-of-thought" och att föra mellanresultat framåt genom flera steg.

För användaren innebär detta mer rigorösa och korrekta svar i vissa fall, men ofta långsammare svarstider och högre beräkningskrav.

IBMs Granite-modellfamilj tar sällan rubrikerna för att vara snabbast eller mest aggressivt innovativ. Jämfört med även andra konkurrenter inom lokala företagslösningar, som Nvidias Nemotron, verkar budskapet vara förutsägbara driftsättningar - vilket är den prioritet man kan förvänta sig av IBM nuförtiden.

Det har funnits en enorm mängd diskussion om kostnad och beräkningsbrist kring molnmodeller i frontlinjen från företag som Anthropic eller OpenAI på senare tid. Inom många domäner har både enskilda utvecklare och företagsorganisationer utforskat lokala modeller som billigare alternativ.

Det har också lett till ökat intresse för modellroutrar - AI-verktyg vars huvuduppgift är att tolka användarprompter, uppgifter eller projekt och dirigera dem till lämpligt avgränsade modeller för att balansera prestanda, hastighet och kostnad.

Modeller som dessa är också populära bland hobbyister, AI-forskare och enskilda utvecklare eftersom de kan mixtras med på lokal hårdvara utan API-avgifter per token.