Google DeepMind a publié Gemini Robotics 2 le 30 juillet 2026, et l'essentiel n'est pas la vidéo de démonstration humanoïde. La sortie compte trois modèles distincts, avec trois niveaux d'accès distincts. Gemini Robotics ER 2 assure la planification et le raisonnement, s'appuie sur Gemini 3.5 Flash avec une fenêtre de contexte de 128k, et c'est le seul appelable dès aujourd'hui via l'API Gemini et AI Studio. Le modèle vision langage action qui commande réellement les articulations reste réservé aux partenaires en accès anticipé. Gemini Robotics On-Device 2 tourne sur l'ordinateur du robot et s'adapte à une nouvelle plateforme à deux bras avec moins de 200 exemples.
The short answer
Google DeepMind a annoncé Gemini Robotics 2 le 30 juillet 2026. La sortie compte trois modèles, pas un. Gemini Robotics ER 2 assure le raisonnement et la planification de haut niveau, repose sur Gemini 3.5 Flash, accepte texte, image, vidéo et audio entrelacés jusqu'à 128k jetons, et se trouve en préversion publique via l'API Gemini et AI Studio. Gemini Robotics 2 est le modèle vision langage action qui pilote le corps entier des humanoïdes et des robots à deux bras, réservé aux partenaires en accès anticipé. Gemini Robotics On-Device 2 tourne sur l'ordinateur embarqué du robot et s'adapte à une nouvelle plateforme à deux bras en quelques heures, avec moins de 200 exemples.
Les annonces de robotique arrivent avec une vidéo, et la vidéo est un mauvais instrument pour juger un modèle. Ce que nous pouvons juger, c'est le tableau de réussite publié et les niveaux d'accès. Sur ces deux points, cette sortie dit quelque chose de plus précis que la bande démo.
Ce qui a réellement été publié
Trois modèles, sortis ensemble, pour trois métiers différents.
Gemini Robotics ER 2 est le modèle de raisonnement incarné. Vous décrivez une tâche en langage naturel, et il planifie, selon Google, des centaines d'étapes sur plusieurs minutes. Il peut appeler des outils externes, répartir le travail entre plusieurs robots, et observer les flux caméra pour vérifier que le plan tient. Il repose sur Gemini 3.5 Flash, accepte texte, image, vidéo et audio entrelacés avec une fenêtre de 128k jetons, et produit jusqu'à 64K jetons.
Gemini Robotics 2 est le modèle vision langage action. Il prend ce que voient les caméras plus l'instruction et produit des commandes moteur. Le changement par rapport à la génération précédente, c'est qu'il pilote désormais le corps entier plutôt que le haut du corps. Google mentionne explicitement la gestion du centre de gravité pour qu'un humanoïde puisse s'accroupir ou se pencher sans tomber, et la prise en charge des mains multi doigts à 22 degrés de liberté comme des pinces parallèles simples.
Gemini Robotics On-Device 2 est un VLA plus compact, construit sur Gemini Robotics 1.5 et Gemma, conçu pour tourner sur l'ordinateur du robot sans dépendance réseau.
Lisez le tableau entier, pas la ligne titre
Le chiffre qui a circulé est 92 %, le taux de réussite pour dévisser une ampoule sur un Apptronik Apollo 2 équipé de mains SharpaWave. C'est une tâche réellement difficile, qui demande de tenir une position tout en appliquant un couple. C'est aussi, et de loin, la meilleure ligne de son tableau.
Revisser l'ampoule tombe à 36 %. Nouer un sac poubelle, 44 %. Un ziplock, 40 %. Une pelle à poussière, 32 %. Côté manipulation générique avec des mains Inspire, la prise depuis une étagère atteint 76,3 %, depuis une table 68,4 %, et depuis le sol 45,7 %, ce qui met à l'épreuve la promesse de contrôle corps entier et la place en milieu de tableau. Les résultats sur pince Franka Duo sont meilleurs, avec 89,6 % en insertion précise et 78,9 % en préparation d'outils, mais un robot à deux bras sur base fixe avec une pince pose un problème de commande bien plus simple qu'un humanoïde qui marche avec des doigts.
Le motif est constant et c'est lui qu'il faut retenir. Les pièces rigides dans des logements rigides fonctionnent. Les filetages, les matériaux déformables et tout ce qui exige un contrôle en effort prolongé tout en gardant l'équilibre, non, pas encore. Un taux de prise au sol inférieur à une chance sur deux n'est pas un système autour duquel on planifie du travail.
Ce qu'un développeur peut toucher cette semaine
Uniquement ER 2, et uniquement comme planificateur.
C'est une contrainte réelle et elle change l'usage immédiat de ces modèles. ER 2 dans l'API Gemini est un composant de raisonnement : il accepte une scène et un objectif, produit un plan structuré avec des références spatiales, et juge la progression à partir de la vidéo. Il n'actionne rien. Ce qui exécute le plan reste votre problème, qu'il s'agisse d'un planificateur de trajectoire classique, d'un SDK constructeur, ou d'un robot que vous n'avez pas.
Cela rapproche ER 2 de l'outillage agent du reste de la gamme de modèles Gemini plutôt que d'une pile robotique. Si vous prototypez, le cadrage honnête est que vous construisez aujourd'hui un planificateur en réservant une place pour un contrôleur encore inaccessible.
Le résultat embarqué est celui à retenir
Sous les images d'humanoïde se cache le chiffre qui compte le plus en exploitation. Gemini Robotics On-Device 2 s'adapte à un robot à deux bras entièrement nouveau en quelques heures, typiquement avec moins de 200 démonstrations. Google rapporte un SO101 passant de 6,7 % à 53,3 % et un Dexmate de 24,4 % à 75,6 % après cette adaptation.
Le transfert entre incarnations était la partie coûteuse du déploiement de politiques apprises. Chaque nouveau corps de robot signifiait historiquement une nouvelle campagne de collecte de données. Deux cents exemples, c'est un autre ordre de grandeur de coût, et c'est la différence entre une démonstration de recherche et quelque chose qu'un intégrateur peut chiffrer.
Tourner en local retire aussi le réseau d'une boucle de commande, ce que toute personne ayant déverminé un système temps réel reconnaîtra comme le choix par défaut correct plutôt que comme une optimisation. La contrepartie est que le modèle embarqué repose sur des fondations plus petites : vous achetez du déterminisme avec de la capacité. L'investissement dans la couche physique ne ralentit pas non plus, comme le montrent les levées de fonds dans la robotique généraliste.
La sûreté a désormais un banc d'essai, ce qui est un progrès relatif
Google a introduit ASIMOV-Agentic en même temps que les modèles. Il mesure si un agent de raisonnement incarné refuse les appels d'outils dangereux, prédit si une tâche est seulement faisable, demande spontanément l'aide d'un humain, et s'arrête quand une personne approche. Google qualifie ER 2 de son modèle robotique le plus sûr à ce jour sur le respect des contraintes de sûreté et la proximité humaine.
Un banc d'essai n'est pas une certification, et un fournisseur qui évalue son propre modèle n'est pas un audit. Cela reste préférable à la situation précédente, qui était l'absence de toute mesure partagée. Traitez ces chiffres comme une base de comparaison entre versions, pas comme une autorisation d'exploiter à proximité de personnes.
Ce qu'il faut en retenir
Rien ici ne place un humanoïde opérationnel dans un entrepôt cette année. Ce qui change, c'est la forme de l'offre : la couche de raisonnement est désormais une API ordinaire, la couche de commande reste fermée, et la couche embarquée apporte une réponse crédible au problème de transfert entre incarnations qui maintenait les politiques robotiques apprises dans les laboratoires.
Si vous construisez du logiciel plutôt que des robots, la lecture pratique est qu'ER 2 est un modèle agent doté d'ancrage spatial et de suivi de progression vidéo, et ces deux capacités servent bien au delà de la robotique. Si vous construisez des robots, le chiffre à surveiller à la prochaine version n'est pas les 92 % sur une ampoule. C'est de savoir si la prise au sol sort enfin des quarante et quelques pour cent.
Sources et pour aller plus loin
- Google DeepMind : Gemini Robotics 2 brings whole body intelligence to robots
- Page du modèle Gemini Robotics 2 chez Google DeepMind
- SiliconANGLE : Google DeepMind debuts Gemini Robotics 2 model series for humanoid robots
- MarkTechPost : trois modèles d'IA physique pour le contrôle corps entier, la dextérité et la collaboration multi robots
- Engadget : Google's new Gemini Robotics 2 platform allows for intelligent whole body control
Questions fréquentes
Lequel des trois modèles est utilisable aujourd'hui ?
Un seul sans candidature. Gemini Robotics ER 2, le modèle de raisonnement incarné, est en préversion publique via l'API Gemini et Google AI Studio, avec une préversion privée sur la plateforme Gemini Enterprise Agent. Le modèle vision langage action, celui qui convertit un plan en commandes articulaires, est limité aux partenaires en accès anticipé qui remplissent un formulaire. Gemini Robotics On-Device 2 est réservé aux testeurs de confiance. Autrement dit, si vous voulez expérimenter cette semaine, vous expérimentez avec le planificateur, pas avec le contrôleur. La distinction compte, car ER 2 ne déplace rien par lui même : il produit des plans, des points d'ancrage et des jugements de progression qu'une autre couche doit exécuter.
Sur quoi repose ER 2, et quelles sont ses limites d'entrée et de sortie ?
Google décrit Gemini Robotics ER 2 comme construit sur Gemini 3.5 Flash. Il accepte du texte, de l'image, de la vidéo et de l'audio entrelacés avec une fenêtre de contexte allant jusqu'à 128k jetons, et produit jusqu'à 64K jetons. La partie vidéo est la plus intéressante en exploitation. ER 2 observe un flux caméra continu pour déterminer si la tâche progresse, ce qui lui permet de détecter un échec et de recommencer plutôt que de dérouler un plan à l'aveugle. Google annonce 57,4 % de justesse sur la classification de progression et 91,3 % sur la localisation d'un instant dans une vidéo, avec une distance absolue moyenne de 0,96 seconde.
Le chiffre de 92 % sur l'ampoule est impressionnant. Est il représentatif ?
Non, et le tableau publié est honnête sur ce point. Sur un Apptronik Apollo 2 équipé de mains multi doigts SharpaWave, dévisser une ampoule réussit dans 92 % des cas et la revisser dans 36 % des cas. Même matériel, même modèle, tâche inversée, et le taux de réussite chute de plus de moitié. Nouer un sac poubelle tombe à 44 %, un ziplock à 40 %, une pelle à poussière à 32 %. Les chiffres de manipulation générique avec des mains Inspire se situent entre les deux : 76,3 % depuis une étagère, 68,4 % depuis une table, 45,7 % depuis le sol. Lisez le tableau entier, pas la ligne titre. L'insertion d'une pièce rigide dans un logement est presque fiable, tout ce qui touche à un matériau souple ou à un filetage ne l'est pas.
Que signifie « moins de 200 exemples » pour adapter le modèle embarqué ?
Cela signifie que le budget de démonstrations nécessaire pour apprendre à Gemini Robotics On-Device 2 un nouveau corps de robot à deux bras se collecte en une après midi. Google rapporte un passage de 6,7 % à 53,3 % de réussite sur la plateforme SO101 et de 24,4 % à 75,6 % sur Dexmate, en quelques heures d'adaptation chacune, typiquement avec moins de 200 exemples. Le mot important est incarnation, pas tâche : il s'agit de porter le modèle sur un robot aux bras et à la cinématique différents, pas de lui apprendre une compétence nouvelle. Pour qui entretient une flotte de matériels hétérogènes, c'est ce chiffre qui change le calcul, davantage que n'importe quel taux de réussite.
Pourquoi tourner sur le robot plutôt que dans le nuage change t il quelque chose ?
La latence et le mode de panne. Un modèle vision langage action placé dans une boucle de commande doit la refermer plus vite que le robot ne bascule, et un aller retour vers un centre de données ajoute des dizaines de millisecondes de gigue que vous ne maîtrisez pas. Tourner en local signifie aussi que le robot continue de fonctionner quand le lien tombe, ce qui n'est pas un confort pour un déploiement en entrepôt ou sur le terrain. La contrepartie est la capacité : le modèle embarqué s'appuie sur Gemini Robotics 1.5 et Gemma plutôt que sur le modèle de pointe complet, donc vous échangez de la profondeur de raisonnement contre du déterminisme. La séparation en trois niveaux, c'est exactement cet arbitrage rendu explicite.