IBM a publié Granite 4.2 le mardi 25 août 2026, une famille de modèles de raisonnement denses, à décodeur seul, en trois milliards, huit milliards et trente milliards de paramètres, avec des poids diffusés sous licence Apache 2.0. La nouveauté n'est pas la gamme de tailles, c'est l'interrupteur : chaque modèle tourne en réflexion complète, sans réflexion, ou en mode effort réduit qui n'accorde qu'un court budget de raisonnement aux questions faciles. Les versions huit et trente milliards ont en plus subi un apprentissage par renforcement dans de vrais bacs à sable, un dépôt logiciel, un terminal vivant et une recherche web réelle, plutôt que sur des traces figées.
The short answer
IBM a publié Granite 4.2 le 25 août 2026. Trois modèles denses, chacun doté d'un interrupteur réflexion, sans réflexion et effort réduit, un contexte natif de 128 000 jetons extensible à 512 000, et l'appel d'outils natif. Le pré entraînement a porté sur environ 15 000 milliards de jetons, l'ajustement supervisé sur près de 7,2 millions d'échantillons, et les 8B et 30B ont suivi un apprentissage par renforcement agentique dans trois environnements vivants : un vrai dépôt via OpenHands, un shell via Terminus-2, et la recherche web réelle. Les poids sont sur Hugging Face, Ollama, LM Studio, OpenRouter et watsonx.
Il existe une taille de modèle qui compte plus que les classements ne le laissent croire : celle que vous pouvez faire tourner sur du matériel qui vous appartient, dans un réseau que vous maîtrisez, sans demander la permission à personne. Granite 4.2 vise exactement ce créneau, et l'ingénierie intéressante tient à la façon dont le raisonnement a été entraîné plutôt qu'au nombre de paramètres.
Trois modes, un seul déploiement
Chaque modèle Granite 4.2 embarque un interrupteur. La réflexion complète est le mode par défaut, et le modèle émet une chaîne de raisonnement entre balises avant de répondre. Le mode sans réflexion la supprime. Le mode effort réduit alloue un court budget de raisonnement, sur la théorie raisonnable que la plupart des questions n'exigent pas trois cents jetons de délibération.
Cela ressemble à une petite fonctionnalité et n'en est pas une, car les jetons de raisonnement forment la première ligne de coût sur toute charge bavarde. Régler le mode requête par requête signifie qu'un seul point d'accès couvre à la fois l'extraction lancée dix mille fois par heure et la session de débogage où vous voulez que le modèle réfléchisse pour de bon. Auparavant, cela voulait dire deux modèles, deux déploiements et deux jeux d'invites à maintenir.
L'appel d'outils natif vient avec, ce qui constitue l'autre moitié de la question quand on fait tourner des agents sur un modèle local plutôt qu'hébergé.
Ce que l'apprentissage en environnement leur a apporté
Le détail d'entraînement à lire deux fois concerne l'endroit où l'apprentissage par renforcement a eu lieu.
IBM a pré entraîné chaque modèle depuis zéro sur environ 15 000 milliards de jetons en cinq phases, la dernière étirant la fenêtre de contexte. L'ajustement supervisé a suivi sur près de 7,2 millions d'échantillons, soit environ 100 milliards de jetons de chaîne de raisonnement, de logique et de trajectoires agentiques. Jusque là, du classique.
Ensuite, les 8B et 30B sont passés par un apprentissage par renforcement agentique dans trois environnements vivants. Un agent de génie logiciel a travaillé sur un dépôt réel dans son propre bac à sable via le harnais OpenHands. Un agent terminal a traité des tâches en plusieurs étapes dans un shell vivant avec Terminus-2. Un agent de recherche a répondu à des questions difficiles à sauts multiples avec de vrais appels de recherche web.
La différence avec l'imitation de trajectoires n'a rien d'académique. Un modèle entraîné sur des transcriptions enregistrées a surtout vu des tâches qui se passent bien, puisque c'est ce que l'on enregistre. Un modèle entraîné en environnement a rencontré les échecs : la commande qui ne renvoie rien, le test qui casse pour une raison sans rapport, la recherche qui revient vide. Le comportement de récupération s'apprend au lieu de se déduire, et c'est ce comportement qui sépare l'agent qui termine de celui qui tourne en boucle.
Les chiffres
IBM a publié des scores qui se comportent comme on l'espère sur les trois tailles.
Sur AIME25, le 3B atteint 78,33 pour cent, le 8B 86,67 pour cent et le 30B 89,17 pour cent. Sur MMLU-Pro, la série donne 67,84, 74,04 et 77,60 pour cent. Sur SWE-bench Verified, seuls les deux plus gros modèles sont rapportés : 47,67 pour cent pour le 8B et 57,00 pour cent pour le 30B.
Ce dernier mérite l'attention. Un modèle de trente milliards de paramètres à poids ouverts qui résout 57 pour cent de SWE-bench Verified est un modèle exécutable en local qui clôt de vraies anomalies dans de vrais dépôts plus d'une fois sur deux. Il y a dix huit mois, c'était une capacité de pointe hébergée, avec un prix au jeton attaché.
Le 8B est sans doute le point le plus utile pour la plupart des gens : 47,67 pour cent sur SWE-bench Verified depuis un modèle qui tient confortablement sur une seule carte grand public change ce qu'il devient raisonnable de tenter sur un portable.
Architecture, contexte et petites lignes
Les modèles sont des transformeurs denses à décodeur seul, pas des mélanges d'experts. Le 8B utilise l'attention à requêtes groupées avec 32 têtes d'attention et 8 têtes clé valeur, des encodages de position rotatifs, des activations SwiGLU avec une taille cachée de 12 800, et une normalisation RMSNorm, en bfloat16.
Le contexte est annoncé à 128 000 jetons en natif avec une extension contexte long à 512 000. Traitez ces deux chiffres comme deux niveaux de confiance distincts. Le natif correspond à ce sur quoi les modèles ont été entraînés et évalués. L'extension existe, mais c'est le genre de nombre qui se comporte moins bien en production que sur un test d'aiguille dans une botte de foin.
Douze langues sont listées : anglais, allemand, espagnol, français, japonais, portugais, arabe, tchèque, italien, coréen, néerlandais et chinois.
IBM a également publié des variantes Granite Speech 5.0 Turbo CTC à 470 millions de paramètres, destinées aux portables et aux téléphones.
Pourquoi la licence est le vrai titre pour certains lecteurs
Apache 2.0 vous autorise à télécharger les poids, à les affiner sur vos données, à déployer commercialement le résultat et à l'embarquer dans un produit, sans plafond d'usage ni négociation. C'est une proposition matériellement différente des licences source disponible qui dominent la conversation sur les poids ouverts.
Pour qui travaille sous contrainte de résidence des données, cela règle souvent toute la décision. Le modèle n'a pas besoin d'égaler la meilleure option hébergée, il doit être assez bon tout en tournant sur une infrastructure que l'équipe conformité a déjà validée. La croissance régulière des déploiements à poids ouverts, visible dans des jalons comme le milliard de téléchargements de Gemma, tient surtout à cette dynamique plutôt qu'à un goût abstrait pour l'ouverture.
Cela contraste d'ailleurs avec le reste de la semaine d'IBM, qui a aussi consisté à placer des instructions Arm au cœur d'un processeur central. La même entreprise soutient à la fois qu'il faut exécuter les modèles sur du matériel qui vous appartient et que sa gamme matérielle la plus propriétaire a un avenir. Les deux peuvent être vrais.
Ce que nous en ferions
Prenez le 8B en premier. C'est la taille où le travail d'apprentissage agentique est présent alors que l'exigence matérielle reste modeste, et celle qui vous dira vite si le comportement d'appel d'outils tient sur votre propre pile.
Testez le mode effort réduit en particulier. C'est celui qui dispose du moins de preuves publiées et du plus grand bénéfice d'exploitation, puisqu'il décide si une charge à gros volume reste abordable.
Et vérifiez la licence face à vos contraintes juridiques avant de mesurer quoi que ce soit, car sur cette famille la licence est le différenciateur et les scores ne sont que compétitifs.
Sources et pour aller plus loin
- Granite 4.2 brings native reasoning to enterprise agents, IBM Research, 25 août 2026
- Granite 4.2 LLMs: How They're Built, IBM Granite sur Hugging Face, 25 août 2026
- Fiche du modèle ibm-granite/granite-4.2-8b, Hugging Face
- IBM Releases Granite 4.2: Bringing Native Reasoning and Agentic RL to Open Enterprise Models, MarkTechPost, 25 août 2026
- IBM's Granite 4.2 Models Learn to Think and Act Inside Environments, Unite.ai
Questions fréquentes
Que change concrètement l'interrupteur de réflexion à l'exécution ?
Il détermine si le modèle émet une chaîne de raisonnement entre balises de réflexion avant sa réponse, et la longueur autorisée pour cette chaîne. Trois modes sont livrés : réflexion complète par défaut, sans réflexion quand vous voulez la réponse sans préambule ni jetons superflus, et effort réduit, qui alloue un court budget de raisonnement aux questions faciles. L'intérêt pratique est la maîtrise des coûts. Les jetons de raisonnement se facturent comme les autres et dominent la note sur une charge bavarde : pouvoir couper le raisonnement requête par requête plutôt que basculer vers un autre point d'accès est un vrai confort d'exploitation. Un seul déploiement sert alors la classification en masse et la session de débogage.
Qu'est ce que l'apprentissage par renforcement agentique et pourquoi compte t il ici ?
La plupart des modèles ajustés aux instructions apprennent l'usage des outils sur des trajectoires enregistrées : quelqu'un a fait la tâche, la transcription est devenue une donnée d'entraînement. L'apprentissage par renforcement agentique place le modèle dans l'environnement et le récompense sur les résultats. IBM en a mené trois pour les 8B et 30B. Un agent de génie logiciel a travaillé sur un dépôt réel dans son propre bac à sable via le harnais OpenHands. Un agent terminal a traité des tâches en plusieurs étapes dans un shell vivant avec Terminus-2. Un agent de recherche a répondu à des questions difficiles à sauts multiples avec de vrais appels d'outil de recherche web. La différence apparaît quand un appel d'outil échoue ou renvoie l'inattendu : un modèle entraîné sur des transcriptions propres a rarement vu la récupération, un modèle entraîné en environnement l'a vécue.
Quelle fenêtre de contexte ces modèles ont ils réellement ?
Les fiches modèles indiquent 128 000 jetons en natif, avec une extension contexte long à 512 000 jetons. Ce sont deux affirmations différentes qu'il vaut mieux garder séparées. Le chiffre de 128 000 correspond à ce que les modèles ont été entraînés et évalués à traiter de façon fiable. L'extension à 512 000 vient de la cinquième phase de pré entraînement, qui a étiré la fenêtre, et c'est le nombre à manier avec plus de prudence en production. Dans les faits, si vous alimentez un modèle de trois milliards de paramètres avec un demi million de jetons, vous avez un problème d'architecture et non de contexte. La recherche documentaire reste moins chère et plus prévisible que les invites très longues, à toutes les tailles.
À quoi ressemblent les scores publiés ?
IBM a publié des scores qui progressent logiquement avec la taille. Sur AIME25, le 3B obtient 78,33 pour cent, le 8B 86,67 pour cent et le 30B 89,17 pour cent. Sur MMLU-Pro, la série donne 67,84, 74,04 et 77,60 pour cent. Sur SWE-bench Verified, le repère qui compte si les agents doivent travailler sur de vrais dépôts, le 8B atteint 47,67 pour cent et le 30B 57,00 pour cent. Ce dernier chiffre est le plus intéressant, car un modèle exécutable sur une seule station de travail bien dotée qui résout plus de la moitié de SWE-bench Verified aurait été un résultat de pointe il n'y a pas si longtemps.
Où les récupérer et que permet Apache 2.0 ?
Hugging Face, Ollama, GitHub, LM Studio, OpenRouter, Replicate, DeepInfra, AnythingLLM et IBM watsonx, entre autres. Apache 2.0 est une véritable licence libre et non une licence source disponible assortie de restrictions d'usage : vous pouvez télécharger les poids, les affiner, redéployer commercialement le résultat et l'embarquer dans un produit sans rien négocier. Cette distinction explique la présence récurrente de Granite dans les environnements régulés. Pour une banque ou un hôpital, la question de la licence se tranche souvent avant même que celle des scores soit posée.