DevNews

Granite 4.2 d'IBM met un interrupteur de raisonnement en 3B

Sur cette page
  1. Trois modes, un seul déploiement
  2. Ce que l'apprentissage en environnement leur a apporté
  3. Les chiffres
  4. Architecture, contexte et petites lignes
  5. Pourquoi la licence est le vrai titre pour certains lecteurs
  6. Ce que nous en ferions
  7. Sources et pour aller plus loin

IBM a publié Granite 4.2 le mardi 25 août 2026, une famille de modèles de raisonnement denses, à décodeur seul, en trois milliards, huit milliards et trente milliards de paramètres, avec des poids diffusés sous licence Apache 2.0. La nouveauté n'est pas la gamme de tailles, c'est l'interrupteur : chaque modèle tourne en réflexion complète, sans réflexion, ou en mode effort réduit qui n'accorde qu'un court budget de raisonnement aux questions faciles. Les versions huit et trente milliards ont en plus subi un apprentissage par renforcement dans de vrais bacs à sable, un dépôt logiciel, un terminal vivant et une recherche web réelle, plutôt que sur des traces figées.

The short answer

IBM a publié Granite 4.2 le 25 août 2026. Trois modèles denses, chacun doté d'un interrupteur réflexion, sans réflexion et effort réduit, un contexte natif de 128 000 jetons extensible à 512 000, et l'appel d'outils natif. Le pré entraînement a porté sur environ 15 000 milliards de jetons, l'ajustement supervisé sur près de 7,2 millions d'échantillons, et les 8B et 30B ont suivi un apprentissage par renforcement agentique dans trois environnements vivants : un vrai dépôt via OpenHands, un shell via Terminus-2, et la recherche web réelle. Les poids sont sur Hugging Face, Ollama, LM Studio, OpenRouter et watsonx.

3B, 8B, 30Bmodèles de raisonnement denses à décodeur seul
Apache 2.0poids, affinage et redéploiement commercial
57,00 %SWE-bench Verified, pour le modèle 30B
Carte réponse résumant la sortie d'IBM Granite 4.2 le 25 août 2026 : modèles denses à décodeur seul en 3B, 8B et 30B paramètres sous Apache 2.0, interrupteur réflexion, sans réflexion et effort réduit sur chaque modèle, contexte natif de 128 000 jetons extensible à 512 000, et apprentissage par renforcement agentique en bacs à sable dépôt, terminal et recherche web pour les 8B et 30B.
Ce que contient Granite 4.2, et sous quelle licence. PNG

Il existe une taille de modèle qui compte plus que les classements ne le laissent croire : celle que vous pouvez faire tourner sur du matériel qui vous appartient, dans un réseau que vous maîtrisez, sans demander la permission à personne. Granite 4.2 vise exactement ce créneau, et l'ingénierie intéressante tient à la façon dont le raisonnement a été entraîné plutôt qu'au nombre de paramètres.

Trois modes, un seul déploiement

Chaque modèle Granite 4.2 embarque un interrupteur. La réflexion complète est le mode par défaut, et le modèle émet une chaîne de raisonnement entre balises avant de répondre. Le mode sans réflexion la supprime. Le mode effort réduit alloue un court budget de raisonnement, sur la théorie raisonnable que la plupart des questions n'exigent pas trois cents jetons de délibération.

Cela ressemble à une petite fonctionnalité et n'en est pas une, car les jetons de raisonnement forment la première ligne de coût sur toute charge bavarde. Régler le mode requête par requête signifie qu'un seul point d'accès couvre à la fois l'extraction lancée dix mille fois par heure et la session de débogage où vous voulez que le modèle réfléchisse pour de bon. Auparavant, cela voulait dire deux modèles, deux déploiements et deux jeux d'invites à maintenir.

L'appel d'outils natif vient avec, ce qui constitue l'autre moitié de la question quand on fait tourner des agents sur un modèle local plutôt qu'hébergé.

Ce que l'apprentissage en environnement leur a apporté

Le détail d'entraînement à lire deux fois concerne l'endroit où l'apprentissage par renforcement a eu lieu.

IBM a pré entraîné chaque modèle depuis zéro sur environ 15 000 milliards de jetons en cinq phases, la dernière étirant la fenêtre de contexte. L'ajustement supervisé a suivi sur près de 7,2 millions d'échantillons, soit environ 100 milliards de jetons de chaîne de raisonnement, de logique et de trajectoires agentiques. Jusque là, du classique.

Ensuite, les 8B et 30B sont passés par un apprentissage par renforcement agentique dans trois environnements vivants. Un agent de génie logiciel a travaillé sur un dépôt réel dans son propre bac à sable via le harnais OpenHands. Un agent terminal a traité des tâches en plusieurs étapes dans un shell vivant avec Terminus-2. Un agent de recherche a répondu à des questions difficiles à sauts multiples avec de vrais appels de recherche web.

La différence avec l'imitation de trajectoires n'a rien d'académique. Un modèle entraîné sur des transcriptions enregistrées a surtout vu des tâches qui se passent bien, puisque c'est ce que l'on enregistre. Un modèle entraîné en environnement a rencontré les échecs : la commande qui ne renvoie rien, le test qui casse pour une raison sans rapport, la recherche qui revient vide. Le comportement de récupération s'apprend au lieu de se déduire, et c'est ce comportement qui sépare l'agent qui termine de celui qui tourne en boucle.

Carte de comparaison montrant les scores IBM Granite 4.2 publiés le 25 août 2026 : AIME25 à 78,33 pour cent pour le 3B, 86,67 pour cent pour le 8B et 89,17 pour cent pour le 30B, MMLU-Pro à 67,84, 74,04 et 77,60 pour cent, et SWE-bench Verified à 47,67 pour cent pour le 8B et 57,00 pour cent pour le 30B.
Les scores publiés, croissants avec le nombre de paramètres. PNG

Les chiffres

IBM a publié des scores qui se comportent comme on l'espère sur les trois tailles.

Sur AIME25, le 3B atteint 78,33 pour cent, le 8B 86,67 pour cent et le 30B 89,17 pour cent. Sur MMLU-Pro, la série donne 67,84, 74,04 et 77,60 pour cent. Sur SWE-bench Verified, seuls les deux plus gros modèles sont rapportés : 47,67 pour cent pour le 8B et 57,00 pour cent pour le 30B.

Ce dernier mérite l'attention. Un modèle de trente milliards de paramètres à poids ouverts qui résout 57 pour cent de SWE-bench Verified est un modèle exécutable en local qui clôt de vraies anomalies dans de vrais dépôts plus d'une fois sur deux. Il y a dix huit mois, c'était une capacité de pointe hébergée, avec un prix au jeton attaché.

Le 8B est sans doute le point le plus utile pour la plupart des gens : 47,67 pour cent sur SWE-bench Verified depuis un modèle qui tient confortablement sur une seule carte grand public change ce qu'il devient raisonnable de tenter sur un portable.

Architecture, contexte et petites lignes

Les modèles sont des transformeurs denses à décodeur seul, pas des mélanges d'experts. Le 8B utilise l'attention à requêtes groupées avec 32 têtes d'attention et 8 têtes clé valeur, des encodages de position rotatifs, des activations SwiGLU avec une taille cachée de 12 800, et une normalisation RMSNorm, en bfloat16.

Le contexte est annoncé à 128 000 jetons en natif avec une extension contexte long à 512 000. Traitez ces deux chiffres comme deux niveaux de confiance distincts. Le natif correspond à ce sur quoi les modèles ont été entraînés et évalués. L'extension existe, mais c'est le genre de nombre qui se comporte moins bien en production que sur un test d'aiguille dans une botte de foin.

Douze langues sont listées : anglais, allemand, espagnol, français, japonais, portugais, arabe, tchèque, italien, coréen, néerlandais et chinois.

IBM a également publié des variantes Granite Speech 5.0 Turbo CTC à 470 millions de paramètres, destinées aux portables et aux téléphones.

Pourquoi la licence est le vrai titre pour certains lecteurs

Apache 2.0 vous autorise à télécharger les poids, à les affiner sur vos données, à déployer commercialement le résultat et à l'embarquer dans un produit, sans plafond d'usage ni négociation. C'est une proposition matériellement différente des licences source disponible qui dominent la conversation sur les poids ouverts.

Pour qui travaille sous contrainte de résidence des données, cela règle souvent toute la décision. Le modèle n'a pas besoin d'égaler la meilleure option hébergée, il doit être assez bon tout en tournant sur une infrastructure que l'équipe conformité a déjà validée. La croissance régulière des déploiements à poids ouverts, visible dans des jalons comme le milliard de téléchargements de Gemma, tient surtout à cette dynamique plutôt qu'à un goût abstrait pour l'ouverture.

Cela contraste d'ailleurs avec le reste de la semaine d'IBM, qui a aussi consisté à placer des instructions Arm au cœur d'un processeur central. La même entreprise soutient à la fois qu'il faut exécuter les modèles sur du matériel qui vous appartient et que sa gamme matérielle la plus propriétaire a un avenir. Les deux peuvent être vrais.

Ce que nous en ferions

Prenez le 8B en premier. C'est la taille où le travail d'apprentissage agentique est présent alors que l'exigence matérielle reste modeste, et celle qui vous dira vite si le comportement d'appel d'outils tient sur votre propre pile.

Testez le mode effort réduit en particulier. C'est celui qui dispose du moins de preuves publiées et du plus grand bénéfice d'exploitation, puisqu'il décide si une charge à gros volume reste abordable.

Et vérifiez la licence face à vos contraintes juridiques avant de mesurer quoi que ce soit, car sur cette famille la licence est le différenciateur et les scores ne sont que compétitifs.

Sources et pour aller plus loin

Questions fréquentes

Que change concrètement l'interrupteur de réflexion à l'exécution ?

Il détermine si le modèle émet une chaîne de raisonnement entre balises de réflexion avant sa réponse, et la longueur autorisée pour cette chaîne. Trois modes sont livrés : réflexion complète par défaut, sans réflexion quand vous voulez la réponse sans préambule ni jetons superflus, et effort réduit, qui alloue un court budget de raisonnement aux questions faciles. L'intérêt pratique est la maîtrise des coûts. Les jetons de raisonnement se facturent comme les autres et dominent la note sur une charge bavarde : pouvoir couper le raisonnement requête par requête plutôt que basculer vers un autre point d'accès est un vrai confort d'exploitation. Un seul déploiement sert alors la classification en masse et la session de débogage.

Qu'est ce que l'apprentissage par renforcement agentique et pourquoi compte t il ici ?

La plupart des modèles ajustés aux instructions apprennent l'usage des outils sur des trajectoires enregistrées : quelqu'un a fait la tâche, la transcription est devenue une donnée d'entraînement. L'apprentissage par renforcement agentique place le modèle dans l'environnement et le récompense sur les résultats. IBM en a mené trois pour les 8B et 30B. Un agent de génie logiciel a travaillé sur un dépôt réel dans son propre bac à sable via le harnais OpenHands. Un agent terminal a traité des tâches en plusieurs étapes dans un shell vivant avec Terminus-2. Un agent de recherche a répondu à des questions difficiles à sauts multiples avec de vrais appels d'outil de recherche web. La différence apparaît quand un appel d'outil échoue ou renvoie l'inattendu : un modèle entraîné sur des transcriptions propres a rarement vu la récupération, un modèle entraîné en environnement l'a vécue.

Quelle fenêtre de contexte ces modèles ont ils réellement ?

Les fiches modèles indiquent 128 000 jetons en natif, avec une extension contexte long à 512 000 jetons. Ce sont deux affirmations différentes qu'il vaut mieux garder séparées. Le chiffre de 128 000 correspond à ce que les modèles ont été entraînés et évalués à traiter de façon fiable. L'extension à 512 000 vient de la cinquième phase de pré entraînement, qui a étiré la fenêtre, et c'est le nombre à manier avec plus de prudence en production. Dans les faits, si vous alimentez un modèle de trois milliards de paramètres avec un demi million de jetons, vous avez un problème d'architecture et non de contexte. La recherche documentaire reste moins chère et plus prévisible que les invites très longues, à toutes les tailles.

À quoi ressemblent les scores publiés ?

IBM a publié des scores qui progressent logiquement avec la taille. Sur AIME25, le 3B obtient 78,33 pour cent, le 8B 86,67 pour cent et le 30B 89,17 pour cent. Sur MMLU-Pro, la série donne 67,84, 74,04 et 77,60 pour cent. Sur SWE-bench Verified, le repère qui compte si les agents doivent travailler sur de vrais dépôts, le 8B atteint 47,67 pour cent et le 30B 57,00 pour cent. Ce dernier chiffre est le plus intéressant, car un modèle exécutable sur une seule station de travail bien dotée qui résout plus de la moitié de SWE-bench Verified aurait été un résultat de pointe il n'y a pas si longtemps.

Où les récupérer et que permet Apache 2.0 ?

Hugging Face, Ollama, GitHub, LM Studio, OpenRouter, Replicate, DeepInfra, AnythingLLM et IBM watsonx, entre autres. Apache 2.0 est une véritable licence libre et non une licence source disponible assortie de restrictions d'usage : vous pouvez télécharger les poids, les affiner, redéployer commercialement le résultat et l'embarquer dans un produit sans rien négocier. Cette distinction explique la présence récurrente de Granite dans les environnements régulés. Pour une banque ou un hôpital, la question de la licence se tranche souvent avant même que celle des scores soit posée.