Ce que la CMR 2026 révèle sur le passage de la démonstration à la mise en œuvre dans le domaine de l'IA incarnée
Quand les stands robotisés ont cessé de danser : ce que le WRC 2026 révèle sur le passage de la démonstration à la mise en œuvre de l’IA incarnée
Introduction : Une espèce disparue
Si vous avez assisté à la Conférence mondiale sur la robotique en 2023 ou 2024, vous vous souvenez du spectacle : une rangée de robots humanoïdes faisant des saltos arrière synchronisés sur scène, des téléphones en l’air, des applaudissements de toutes parts.
À Pékin, en août 2026, ce spectacle avait disparu.
Non pas que les robots aient perdu la capacité de se retourner – au contraire, ils le font avec une fiabilité accrue. Ils ont simplement cessé de se retourner. À la place de cette chorégraphie s'est imposée une activité plus discrète : lors du WRC 2026, on pouvait observer un humanoïde se tenir devant une réplique à l'échelle 1:1 d'un poste de tri de colis, face à des paquets introduits aléatoirement, et exécuter pendant quatre heures d'affilée la tâche complexe de « détection – saisie – réorientation – placement ». Aucun ingénieur à proximité. Aucun bouton d'arrêt d'urgence prêt à être actionné.
Il s'agit d'un moment charnière pour l'industrie de l'IA incarnée — non pas une percée technique, mais une fracture et une reconstruction du système d'évaluation lui-même.
1. De la « capacité cinématique » au « taux d’achèvement des tâches » : la naissance d’un nouvel indicateur de performance clé (KPI).
Pendant trois ans, les présentations aux investisseurs en robotique pour lever des fonds reposaient sur la densité du couple articulaire, les algorithmes de marche et la coordination corporelle globale. Les questions étaient sans cesse posées : combien de degrés de liberté ? Quelle est l’autonomie de la batterie ?
Lors de la WRC 2026, le poids de ces questions est déplacé par quelque chose de plus direct : le débit par unité de temps et la durée de fonctionnement continu sans surveillance (temps de fonctionnement ajusté au MTBF).
Prenons l'exemple du tri logistique. Ce n'est pas un phénomène nouveau, mais la version 2026 diffère qualitativement de celle d'il y a deux ans :
| Dimension | Démo 2024 | WRC 2026 en direct |
| Configuration des tâches | Position fixe, objet fixe, éclairage fixe | Positionnement aléatoire, objets variés (emballages souples / boîtes rigides / formes irrégulières), éclairage mixte naturel et artificiel |
| Évaluation | « Réussir une fois » compte comme une réussite. | Rémunération à la pièce + forfait horaire, 4 heures consécutives, sans interruption |
| Intervention humaine | Ingénieur en alerte | Sans surveillance à l'extérieur de la clôture ; récupération automatique ou signalement en cas de panne |
| Barre d'acceptation | La vidéo est lisible | Le client peut signer un bon de commande. |
La portée de ce changement dépasse largement le cadre de l'exposition. Cela signifie que les produits d'IA incarnée entrent dans une logique d'acceptation industrielle plutôt que dans une logique de démonstration de recherche. La première exige reproductibilité, prévisibilité et quantification ; la seconde ne requiert qu'un seul moment d'éclat.
2. La « pyramide de déploiement à trois niveaux » de l'IA physique
Si l'on représente le déploiement de l'IA incarnée sous forme de pyramide, la CMR 2026 met en lumière le véritable niveau de chaque palier :
Niveau 1 : Scènes industrielles structurées (écart déjà comblé)
Induction de colis, assemblage de produits 3C, lignes pilotes de batteries : ces processus partagent des limites de tâches clairement définies, un coût de défaillance maîtrisable et un retour sur investissement calculable. Ils passent de la phase pilote à la production en série.
Un détail à noter : Dobot (Yuejiang) a utilisé un comparateur à cadran sur le salon pour démontrer une précision de répétabilité inférieure à 0,05 mm pour son humanoïde. Ce chiffre n’a rien d’exceptionnel en soi ; des bras industriels l’atteignaient déjà il y a une dizaine d’années. Ce qui est remarquable, c’est qu’il ait été obtenu sur une plateforme humanoïde bipède. Cela signifie que l’humanoïde n’est plus seulement capable de marcher, mais qu’il commence à acquérir les capacités de manipulation de précision propres au secteur industriel.
Niveau 2 : Services commerciaux semi-structurés (comblement de l’écart)
Réapprovisionnement des supermarchés, service de barista, livraison en chambre d'hôtel : l'ouverture s'accroît, mais les contraintes persistent (itinéraires fixes, gamme de produits limitée, environnements contrôlés). Ces situations étaient légion lors de la WRC 2026, pourtant, le nombre de robots se traduisant par de véritables commandes reste très faible. Le goulot d'étranglement n'est pas la technologie, mais le coût : lorsqu'une nomenclature de robot dépasse trois ans de coût de main-d'œuvre humaine, la décision d'achat est systématiquement bloquée sur le bureau du directeur financier.
Niveau 3 : Scènes domestiques non structurées (de l'autre côté du fossé, brumeuses)
La maison est le Graal de l'IA incarnée et son principal facteur de valorisation. Lors de la WRC 2026, au moins six fournisseurs ont présenté des prototypes de robots domestiques : rangement du salon, pliage du linge, préparation des repas, rangement des chaussures.
Mais le consensus interne du secteur est sans appel : la complexité des scénarios domestiques dépasse largement les capacités des modèles actuels. Un exemple concret : en laboratoire, le taux de réussite des tâches ménagères dès la première tentative peut atteindre 95 %. Mais dès qu’on introduit trois variables (modification de l’éclairage, substitution d’objets et présence de personnes), ce taux chute brutalement à moins de 60 %. Il ne s’agit pas du problème d’une seule entreprise ; c’est la réalité à laquelle tout le secteur sera confronté en 2026.
3. Une « explosion cambrienne » des cerveaux incarnés — et la pression de convergence qui en découle
Le plus important à observer au WRC 2026 n'est pas l'apparence des robots, mais leur fonctionnement cognitif. Les technologies utilisées pour concevoir ces intelligences embarquées révèlent une diversité rare – peut-être le dernier champ de bataille d'« architecture non convergente » en IA.
- VLA de bout en bout (Vision-Langage-Action) : Réduire la perception, la compréhension et l'action en un seul modèle ; rechercher la simplicité du principe « pixels en entrée, commandes conjointes en sortie ». Représenté par la famille RT de Google DeepMind et π0 de Physical Intelligence.
- Architecture hiérarchique : La « pensée lente » régit la planification des tâches, tandis que « l'exécution rapide » régit le contrôle en temps réel – un peu comme le Système 1 / Système 2 du cerveau humain.
- Camp de mannequins mondiaux : Il faut d'abord apprendre les lois physiques, puis déployer des séquences d'actions au sein d'une simulation interne. Ce modèle est représenté par la ligne JEPA de Yann LeCun et les architectures prédictives basées sur la diffusion.
- Camp de représentation unifiée : encoder la perception, le langage et l'action dans un espace latent unique ; poursuivre le modèle « un cerveau, plusieurs corps » (un modèle contrôlant différents corps matériels).
Toutes ces routes partagent exactement un goulot d'étranglement : les données.
Il ne s'agit pas d'une métaphore. Le problème des données auquel est confrontée l'IA physique est d'une gravité bien plus grande qu'à l'époque du LLM :
| Dimension | LLM (texte) | IA physique (robot) |
| Source de données | Existe nativement sur Internet | Doit être collecté physiquement ou généré par simulation |
| coût d'annotation | Le crowdsourcing fonctionne | L'annotation synchrone multimodale (vision + force + angles articulaires) est extrêmement coûteuse. |
| Réutilisation des données | Transferts de texte entre les tâches | Les données de morphologie croisée sont incompatibles (les données UR5 ne peuvent pas entraîner directement un humanoïde). |
| Couverture de la longue traîne | Internet couvre déjà la longue traîne | La véritable longue traîne physique est à peine collectée |
Lors du WRC, JD Cloud a révélé un ordre de grandeur révélateur : les données physiques de haute qualité et facilement exploitables du secteur ne représentent actuellement que « quelques centaines de milliers d’heures » (de l’ordre de 100 000 heures). Comparé aux billions de jetons utilisés pour entraîner les modèles linéaires logiques, cet écart n’est pas « un peu moins », mais bien de cinq ordres de grandeur.
C’est pourquoi, en 2026, on a vu émerger une nouvelle génération d’« entreprises d’infrastructure de données » : elles ne conçoivent pas directement de robots, mais développent des plateformes de capture de données, des chaînes d’outils de gouvernance des données et des pipelines d’augmentation de la simulation. Dans la course à l’IA incarnée, ces entreprises de données pourraient bien être les premières à en tirer profit avant les fabricants de robots.
4. Le problème du dernier centimètre : pourquoi un succès à 99 % ne suffit pas
Le fondateur d'Unitree, Wang Xingxing, a fait une déclaration lors d'un forum à huis clos sur le WRC 2026 qui a été largement citée :
C’est le problème du « dernier centimètre » de l’IA physique. Les 99 premiers centimètres concernent l’architecture du modèle, les données d’entraînement, l’environnement de simulation, la conception de la fonction de récompense et le calibrage du matériel — autant d’éléments sur lesquels on peut investir des ressources d’ingénierie. Le dernier centimètre, c’est la capacité du système à se dégrader progressivement plutôt que de subir une panne catastrophique lorsque le monde réel s’écarte de la distribution d’entraînement.
Ce problème est quasiment inexistant dans les langages de modélisation linguistique (LLM) : lorsque ChatGPT rencontre une requête inconnue, sa réponse est au pire médiocre ; il ne « défaillit » pas. En revanche, face à un coefficient de frottement de surface inconnu, un robot peut projeter une pièce, percuter un convoyeur, voire blesser une personne. C’est pourquoi la définition de la « généralisation » en IA incarnée est bien plus stricte qu’en traitement automatique du langage naturel (TALN) : non pas « à peu près correct », mais « ne doit pas se tromper ».
5. Économie des jetons physiques : un nouveau cadre d'évaluation
Lors de la WRC 2026, Jia Kui, fondateur de Cross Dimension (DexForce), a proposé un concept à retenir : l’économie du jeton physique. Par analogie avec les LLM qui facturent par jeton, l’IA physique devrait également avoir son « jeton » : une boucle complète perception-décision-action. L’indicateur clé n’est pas la taille du modèle, mais :
- Coût d'acquisition : Combien coûte l'obtention d'un jeton physique valide de données d'entraînement ?
- Coût de la formation : Quelle quantité de calcul consomme la mise à jour du modèle correspondant à un jeton physique ?
- Coût du déploiement : Les coûts d'amortissement du matériel, d'énergie et de maintenance nécessaires à un robot pour exécuter un jeton physique ?
- Valeur de sortie : Combien d'heures de travail humain ce jeton remplace-t-il, et à quel salaire horaire ?
La force de ce cadre réside dans sa capacité à transformer un « récit technologique » en un « modèle financier ». Les investisseurs n'ont pas besoin de comprendre la différence entre les modèles VLA et les modèles mondiaux ; ils doivent seulement calculer si la courbe de coût des jetons physiques d'une entreprise peut passer sous la courbe du coût de main-d'œuvre du client dans un délai de 18 mois.
6. Une perspective mondiale : ce que la CMR 2026 signifie pour l'industrie d'outre-mer
Vus d'un point de vue global, trois signaux de la CMR 2026 méritent l'attention des lecteurs étrangers :
Signal 1 : La chaîne d’approvisionnement chinoise définit l’« horizon des coûts » du matériel intégré
Contrairement à il y a trois ans, d'ici 2026, le coût de la nomenclature des humanoïdes aura suffisamment baissé pour que les fabricants de taille moyenne puissent sérieusement envisager le retour sur investissement. Cette baisse des coûts est principalement due à la chaîne d'approvisionnement complète des composants en Chine — des réducteurs harmoniques aux moteurs de couple en passant par les capteurs de force-couple 6D, avec un taux de localisation supérieur à 80 %. Pour les équipementiers étrangers, la possibilité de développer l'intégralité du matériel en interne se réduit ; la voie la plus judicieuse consiste désormais à développer les algorithmes de base en interne et à s'approvisionner auprès de fournisseurs chinois.
Signal 2 : La guerre des données en IA physique est plus féroce que la guerre des modèles
Les entreprises américaines conservent une longueur d'avance en matière d'architecture de modèles fondamentaux (Physical Intelligence, Skild AI, Covariant, entre autres), mais la Chine bénéficie d'un avantage structurel grâce à une forte densité de données et une volonté accrue de collecter ces informations : les usines toléreront les défaillances des robots, les entrepôts logistiques ouvriront leurs données et le gouvernement subventionnera les infrastructures de collecte de données. Une fois ce cercle vertueux des données physiques enclenché, les lacunes au niveau des modèles seront rapidement comblées par celles au niveau des données.
Signal 3 : Le « moment Android » n’est pas encore arrivé, mais un « moment Windows » pourrait bien le précéder.
Aujourd'hui, tous les constructeurs automobiles s'efforcent de maîtriser l'ensemble de la chaîne de développement (matériel, système d'exploitation et données), mais l'expérience montre qu'une telle intégration verticale est insoutenable. D'ici deux à trois ans, une convergence au niveau du système d'exploitation est probable : un ou plusieurs « systèmes d'exploitation robotisés » unifieront la couche d'abstraction matérielle, permettant ainsi aux développeurs d'applications de déployer leurs solutions sur différentes plateformes. Celui qui définira cette norme en premier s'assurera la mainmise sur les prix lors de la phase suivante.
Conclusion : De « société de robotique » à « société de productivité »
La plus grande révélation de la CMR 2026 sera peut-être moins technique qu'identitaire. Les entreprises qui survivront ne seront pas, au final, qualifiées d'« entreprises de robotique », mais d'entreprises de productivité – tout comme personne aujourd'hui ne qualifie SAP d'« entreprise de logiciels » en ignorant la valeur ajoutée qu'elle apporte aux entreprises.
L’objectif final de l’IA incarnée n’est pas de « construire des machines qui ressemblent à des humains », mais de « rendre les tâches du monde physique définissables par logiciel ». De ce point de vue, 2026 n’est ni un point de départ ni un point d’arrivée ; c’est, sur le long chemin qui mène de la « construction de machines » à la « création de valeur », le moment où les premiers jalons deviennent clairement visibles.











