iancr
RxBrain : Tencent construit le cerveau des robots pendant qu'OpenAI rêve de chatbots

RxBrain : Tencent construit le cerveau des robots pendant qu'OpenAI rêve de chatbots

Tencent vient de lâcher RxBrain, un modèle fondamental de 6,2 milliards de paramètres capable de raisonner sur des tâches complexes ET d'imaginer visuellement ce que ses actions vont produire. Une première mondiale dans le domaine de la "cognition incarnée". Et pendant ce temps, OpenAI peaufine des GPT pour rédiger des emails.

Le problème que personne ne voulait résoudre

Les robots sont idiots. Pas techniquement mécaniquement, ils sont géniaux. Un bras robotique ABB peut souder 2 000 pièces par heure avec une précision de 0,02 mm. Mais demandez-lui de ramasser un objet qu'il n'a jamais vu, dans une lumière différente, sur une surface inégale il plante. Parce que "voir" et "comprendre" et "planifier" et "agir" sont, dans la robotique classique, quatre systèmes séparés qui ne se parlent pas.

C'est ce que les chercheurs appellent le problème de la cognition incarnée. L'idée que pour vraiment agir dans un monde physique, il faut connecter la pensée abstraite ("prends la tasse rouge") aux états physiques concrets ("voilà à quoi ressemblera la tasse une fois saisie, depuis cet angle, avec cette force"). Les humains font ça naturellement. Les robots, non.

Tencent vient de publier RxBrain officiellement Hy-Embodied-RxBrain-1.0 le 15 juillet 2026 sur arXiv et HuggingFace. Le papier compte 28 auteurs. L'architecture pèse 6,2 milliards de paramètres. Et la revendication centrale est franche : c'est le premier modèle fondamental qui couple raisonnement textuel et imagination visuelle dans une même séquence de planification.

Ce que RxBrain fait vraiment

Avant RxBrain, les approches se divisaient en deux camps. Soit des modèles vision-langage (GPT-4V, LLaVA, Qwen-VL) excellents pour comprendre une scène, nuls pour prédire ce qui se passe après une action. Soit des world models génératifs (Sora, Genie) capables de générer des frames futures, mais sans raisonnement causal sur le pourquoi de l'action.

RxBrain fusionne les deux dans une architecture Mixture-of-Transformers (MoT). Ce routeur intelligent décide quel "spécialiste" traite chaque type d'input texte, image, vidéo avant de tout fusionner dans un backbone commun. L'output peut être du texte, des images, ou directement des commandes d'action pour un robot.

Concrètement, voici ce que ça donne. On demande à RxBrain : "Comment faire un sandwich ?" Un modèle classique répond par une liste textuelle. RxBrain produit un plan hybride : chaque étape textuelle ("prendre le pain") est couplée à une image générée représentant l'état physique intermédiaire correspondant. Langage pour la structure logique. Vision pour l'ancrage dans la réalité physique. Les deux en même temps, dans la même séquence.

C'est ce que le papier appelle le "joint subgoal planning". Pas deux systèmes en parallèle. Une seule chaîne de pensée où mots et pixels se renforcent mutuellement.

L'architecture dans le détail

La Mixture-of-Transformers, c'est une réponse élégante au problème multimodal. Au lieu d'un Transformer monolithique qui doit tout gérer (texte, images, vidéo), on a plusieurs Transformers spécialisés avec un routeur qui sélectionne dynamiquement le chemin optimal. Résultat : efficacité computationnelle maintenue malgré la complexité multimodale.

Les trois capacités cœur du modèle :

Compréhension incarnée. RxBrain analyse images et vidéos multi-frames pour répondre à des questions sur les capacités d'un robot, ses contraintes physiques, sa posture. Pas juste "qu'est-ce que c'est ?" mais "que peut faire cet agent avec ça ?"

Prédiction d'état du monde. Donnez-lui une action ("lever le bras de 30 cm vers la gauche"), il génère les frames correspondant aux états futurs probables. C'est ce qui permet de simuler avant d'agir réduire drastiquement les coûts d'essai-erreur en robotique réelle.

Planification conjointe de sous-objectifs. Décomposition d'une tâche complexe en étapes, chacune avec sa représentation textuelle ET visuelle. La partie langage donne la logique temporelle. La partie vision ancre chaque étape dans un état physique réel.

Pour entraîner tout ça, Tencent a construit un pipeline automatique qui convertit des vidéos de manipulation robotique en supervision text-visuelle : segmentation par keyframes, alignement avec les transitions d'état physique, génération de descriptions textuelles. Le tout sans annotation humaine massive.

RxBrain-Bench : le benchmark maison

Tencent a aussi publié RxBrain-Bench, un benchmark d'évaluation en 22+ suites de tests couvrant la perception visuelle, la compréhension incarnée, la prédiction d'états futurs et la cohérence planification. Les résultats comparent RxBrain à des concurrents directs comme Qwen3-VL et RoboBrain2.5.

Sur le benchmark précédent de Tencent (HY-Embodied-0.5), les chiffres donnaient +10,2% vs Qwen3-VL-4B et +8,6% vs RoboBrain2.5-4B. RxBrain 1.0 pousse plus loin. Les scores exacts sur FVD (Fréchet Video Distance, la métrique standard pour les vidéos générées) et sur la cohérence texte-vision ne sont pas encore tous publiés en dehors du papier complet.

Ce qu'on sait : le modèle "étend" ses capacités à la génération d'actions continues pour robots réels, "sans pré-entraînement massif sur données d'action". Ce qui est à la fois une force (moins de data robotique spécifique nécessaire) et une limite assumée.

Le contexte géopolitique qu'on fait semblant d'ignorer

RxBrain sort le 15 juillet 2026. SEED, le framework d'apprentissage par renforcement de Tencent, est sorti quelques jours avant. Ce n'est pas un hasard.

Les labs chinois Tencent, Alibaba, ByteDance, Baidu ont compris quelque chose que les Occidentaux n'ont pas encore digéré : le prochain champ de bataille de l'IA n'est pas le LLM. C'est le Physical AI. L'IA qui agit dans le monde réel. Robots industriels, logistique, entrepôts, manufacturing. Des marchés qui se chiffrent en centaines de milliards.

OpenAI a GPT-4o et des agents pour rédiger des PowerPoint. Google a ses robots Waymo et son équipe Robotics mais rien d'aussi unifié que RxBrain dans l'open. Figure AI, Tesla Optimus des acteurs hardware avec leurs modèles propriétaires. Personne ne publie un modèle fondamental open-source pour la robotique qui combine raisonnement textuel ET monde visuel.

Tencent le fait. Et le rend disponible sur HuggingFace.

C'est soit une stratégie de captation de communauté, soit une conviction que la valeur se créera dans les services cloud d'inférence plutôt que dans le modèle lui-même. Probablement les deux.

Les limites réelles

Faut pas déconner. Un modèle de recherche, même excellent, c'est loin d'un robot qui fonctionne dans un vrai entrepôt Amazon.

Le sim-to-real gap. C'est le problème #1 de la robotique depuis 30 ans. Les modèles entraînés en simulation échouent sur les vrais robots dans 50 à 80% des cas. Tencent parle de "performances prometteuses" en conditions réelles ce qui, traduit, signifie "ça marche sur nos démos soigneusement préparées". Les données de succès sur des tâches libres en environnement non contrôlé n'existent pas encore publiquement.

La spécificité morphologique. RxBrain n'a probablement pas été entraîné sur tous les types de robots existants. Un bras industriel ABB, un robot mobile MiR, un bras collaborative Universal Robots morphologies radicalement différentes. Le modèle peut-il généraliser ? Inconnu.

L'horizon de planification. Peut-il planifier des tâches en 50 étapes ou seulement 5-10 ? Un "faire à manger" a 30+ sous-tâches. Les long-horizon tasks, c'est le mur où tous les systèmes de planification robotique se cassent la figure.

Les données d'action. "Sans pré-entraînement massif sur données d'action", ça veut dire qu'il manque quelque chose que Google a avec son Open X-Embodiment un million de trajectoires réelles de robots. RxBrain compense par le transfert depuis les domaines vision-langage. Intelligent. Mais pas équivalent.

Qui va vraiment utiliser ça ?

À court terme : les chercheurs en robotique. C'est gratuit, c'est open-source (le poids est sur HuggingFace), le code est sur GitHub. Pour un labo universitaire qui construit des agents robotiques, RxBrain est un composant planning clé-en-main. Pas négligeable.

À moyen terme : les startups robotique qui ne peuvent pas se payer les modèles propriétaires de Figure AI ou les intégrations Nvidia. RxBrain joue le rôle de cerveau cognitif dans des pipelines custom, couplé à un modèle de bas-niveau pour la génération d'actions moteur fines.

À long terme : dépend de si Tencent continue de pousser le modèle. V1.1, V2.0 avec 20B ou 50B paramètres, entraîné sur l'Open X-Embodiment dataset ? Là, les choses deviennent sérieuses.

Verdict

RxBrain n'est pas "le robot de demain est là". C'est le début d'une architecture qui résout un problème réel et qui était non résolu. L'unification du raisonnement textuel et de l'imagination visuelle dans une seule séquence de planification c'est une contribution intellectuelle solide, pas du marketing.

La différence avec les précédents travaux est mesurable. Les limites sont documentées honnêtement dans le papier. Le modèle est open-source. Et Tencent met 28 chercheurs dessus.

Dans un secteur où OpenAI cache ses architectures, où les majors cloud construisent des walled gardens, et où la France débat encore de souveraineté numérique en attendant que quelqu'un ait bien voulu construire quelque chose le fait qu'un lab chinois publie un modèle fondamental pour la robotique en open access, ça mérite au moins qu'on le lise.

Les robots du futur attendront encore quelques années. Mais leur cerveau commence à prendre forme. Et il a été dessiné à Shenzhen.


Sources

  • Papier arXiv : https://arxiv.org/abs/2607.14187 "RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination" (juillet 2026)
  • HuggingFace Model Card : https://huggingface.co/tencent/Hy-Embodied-RxBrain-1.0
  • HuggingFace Papers : https://huggingface.co/papers/2607.14187
  • GitHub Repository : https://github.com/Tencent-Hunyuan/Hy-Embodied-RxBrain-1.0
  • Papier HY-Embodied-0.5 (prédécesseur) : https://arxiv.org/abs/2604.07430
  • AlphaXiv discussion : https://www.alphaxiv.org/abs/2607.14187
  • EmbodiedBench Benchmark : https://embodiedbench.github.io/
  • OpenX-Embodiment (Google Robotics) : https://robotics-transformer-x.github.io/
  • Databubble résumé : https://databubble.co/news/rxbrain-embodied-cognition-foundation-model-with-joint-language-visual-reasoning-and-imagination

Idée d'illustration : Vue en coupe d'un crâne mi-humain mi-robotique en style néobrutaliste à gauche, des câbles et engrenages métalliques ; à droite, un réseau neuronal lumineux bleu-orange. En arrière-plan flou, une main robotique en train de saisir un objet. Palette : noir profond, bleu électrique, orange chaud. Typographie massive "RxBrain" superposée en blanc cassé.