EG
Robostral Navigate : un VLM 8B établit un nouvel état de l'art en navigation robotique monoculaire
ResearchJuly 25, 2026Stax

Robostral Navigate : un VLM 8B établit un nouvel état de l'art en navigation robotique monoculaire

Robostral Navigate, le VLM 8B de Mistral AI, prédit des waypoints de navigation à partir d'une seule caméra RGB et établit un nouvel état de l'art sur les benchmarks R2R-CE et RxR-CE, sur robots à roues, à pattes et drones.

#Mistral AI#Robostral Navigate#vision-language model#robot navigation#VLM#waypoint prediction
Reading in French

Le laboratoire d'IA phare français entre dans la robotique. Mistral AI a dévoilé Robostral Navigate, un modèle vision-langage de 8 milliards de paramètres capable de naviguer un robot à partir d'un simple flux d'images RGB monoculaires — sans capteur de profondeur, sans LiDAR, sans multi-caméras ni cartes préconstruites. L'article, publié sur arXiv et accompagné d'un billet de recherche Mistral, fait état de nouveaux records sur les deux benchmarks de référence de navigation vision-langage en environnements continus.

Le « pointage » plutôt que les coordonnées métriques

Robostral Navigate décompose la navigation en deux problèmes. Le VLM de 8B gère la compréhension des instructions, le raisonnement sur la scène et la planification grossière, en prédisant le prochain waypoint par pointage des coordonnées image de la cible dans la vue caméra courante, avec le cap souhaité à l'arrivée. Parce que les waypoints vivent dans l'espace image plutôt que dans des coordonnées métriques propres au robot, la politique est naturellement robuste aux changements d'intrinsèques caméra et d'échelle de scène. Lorsque la destination sort du champ de vision, le modèle bascule sur des déplacements métriques, et il apprend à produire STOP une fois la tâche terminée.

Une politique de diffusion légère de 121M paramètres convertit ensuite chaque waypoint en trajectoire dense d'une seconde à 10 Hz, puis un contrôleur de suivi de mouvement propre à chaque plateforme la traduit en commandes moteurs à 100 Hz. Le VLM fonctionne à 0,5 Hz — une séparation « réflexion lente, action rapide » qui s'impose dans les modèles fondationnels robotiques.

Un entraînement 100 % simulation, compressé 22×

L'équipe a entraîné entièrement en simulation, générant 2,4 millions de trajectoires sur 350 000 scènes — sans collecte de données réelles. Une recette de « prefix-caching » compresse des épisodes entiers en séquences d'entraînement uniques, réduisant les tokens par 22× et faisant passer des mois d'entraînement à quelques jours, tandis qu'un masque d'attention en arbre empêche le conditionnement sur les actions précédentes. Une phase finale d'apprentissage par renforcement en ligne (CISPO) sur un sous-ensemble difficile ajoute encore 4 points de taux de réussite.

Résultats : battre les systèmes à profondeur avec une seule caméra

Sur R2R-CE (validation unseen), Robostral Navigate atteint 77,4 % de réussite — 10,5 points au-dessus de la meilleure méthode monoculaire (Qwen-RobotNav-4B, 66,9 %) et 5,3 points au-dessus du meilleur système à profondeur ou multi-caméras (Qwen-RobotNav-8B, 72,1 %). Sur RxR-CE, il signe un nouvel état de l'art à 75,1 % de réussite et 68,7 % de SPL, avec une meilleure efficacité de trajectoire que les modèles assistés par profondeur.

Mêmes poids, robots différents

Pour démontrer le transfert inter-plateformes, l'équipe a déployé les mêmes poids VLM et diffusion sur deux plateformes très différentes — le Galaxea R1 et le Hiwonder JetAuto — en randomisant hauteur du robot (0,4–1,8 m), rayon, placement et inclinaison de la caméra pendant la génération des données. Seul le contrôleur bas niveau change d'un robot à l'autre.

Le signal stratégique compte autant que les chiffres : le laboratoire d'IA le plus valorisé d'Europe publie désormais de la recherche en IA incarnée avec une recette pensée pour l'échelle — capteurs minimaux, entraînement 100 % simulation, déploiement agnostique de la plateforme. Si l'approche tient au-delà de la navigation, elle esquisse une voie économique vers des politiques robotiques générales, sans piles de capteurs coûteuses.

Source: arXiv / Mistral AI
Language: French- Showing content in French