Une équipe de chercheurs a présenté FM-VLA (Force-based Memory for Vision-Language-Action models), une nouvelle approche qui ajoute un module de mémoire de force dédié aux architectures VLA standard. Publié sur arXiv (2607.18231), ce travail permet aux robots humanoïdes de raisonner sur des séquences de contacts physiques — débloquant des capacités dans des tâches où l'information visuelle seule est ambiguë.
L'innovation clé : la mémoire de force comme état temporel
L'idée clé derrière FM-VLA est que les robots peuvent utiliser l'historique des forces physiques qu'ils ont subies comme une forme de mémoire, complétant la perception visuelle dans des environnements à contact riche. Le système utilise un auto-encodeur variationnel (VAE) entraîné sur des séquences de signaux de couple à 6 axes (force à 3 axes + couple à 3 axes) provenant de capteurs force-couple montés au poignet.
Le VAE apprend une représentation compacte et indépendante de la tâche de l'historique de contact du robot, comprimant une fenêtre glissante de séries temporelles de force en seulement 8 tokens latents. Ces « tokens de mémoire de force » sont ensuite injectés dans le transformateur expert d'action du VLA, permettant à la politique de se souvenir des interactions physiques passées même lorsque les observations visuelles actuelles sont identiques ou ambiguës.
Résultats impressionnants sur trois tâches à contact riche
Évalué sur un robot humanoïde bi-manuel AgiBot G1, FM-VLA a été testé sur trois tâches à contact riche nécessitant un raisonnement temporel :
- Jeu des coquillages (tasse et bloc) : 16–24 étapes où le robot doit se souvenir des tasses déjà soulevées
- Insertion de pion : insertion séquentielle où le retour de contact guide l'alignement
- Ouverture de tiroir : manipulation de poignées pouvant paraître visuellement similaires
Sur 18 essais par tâche, FM-VLA a atteint un taux de succès supérieur à 85% sur toutes les tâches, surpassant considérablement les références :
- Référence uniquement visuelle (pas de mémoire de force) : moins de 30% de succès
- Vision + conditionnement de force sur une seule image : ~50% de succès, échouant souvent lorsque les indices visuels étaient ambigus
- Vision + mémoire visuelle (empilement d'images) : amélioré mais toujours en difficulté avec des états physiquement identiques
Notamment, le module de mémoire de force ajoute moins de 2 ms de latence d'inférence par étape — négligeable pour le contrôle en temps réel.
Pipeline d'entraînement en deux étapes
FM-VLA utilise une approche en deux étapes :
- Étape 1 — Pré-entraînement du VAE de mémoire de force : Le VAE est entraîné sur des séries temporelles de force à 100 Hz de toutes les tâches de démonstration combinées, produisant un espace latent polyvalent qui encode les schémas temporels des événements de contact.
- Étape 2 — Intégration dans la politique VLA : L'encodeur VAE gelé est attaché aux encodeurs visuels et proprioceptifs existants. Les tokens de mémoire de force sont concaténés avec les tokens d'action dans le transformateur expert d'action, et la politique complète est affinée de bout en bout sur les démonstrations de tâche.
Les études d'ablation ont confirmé que la suppression de la mémoire de force ou son remplacement par des signaux uniquement proprioceptifs réduisait les performances aux niveaux de référence.
Pourquoi c'est important pour la robotique industrielle
La détection de force est déjà peu coûteuse, robuste et largement disponible sur les robots humanoïdes et collaboratifs. FM-VLA démontre que l'ajout d'un module de mémoire de force peut débloquer de nouvelles capacités significatives sans mises à niveau matérielles coûteuses — une découverte avec des implications directes pour la fabrication, l'assemblage et la logistique.
Pour les robots industriels réaffectés à l'automatisation flexible, l'ajout d'un capteur de force à faible coût et de ce module de mémoire pourrait permettre de nouvelles capacités d'inspection et de manipulation. Dans les entrepôts, la mémoire de force pourrait suivre quels colis ont été manipulés même lorsque les scanners de codes-barres ou les systèmes de vision échouent.
Limitations et perspectives d'avenir
L'implémentation actuelle utilise un goulot d'étranglement VAE fixe de 8 tokens, ce qui peut limiter les performances sur des tâches à très long horizon avec des centaines d'événements de contact. Les chercheurs notent qu'une compression hiérarchique ou adaptative pourrait y remédier.
De plus, le VAE a été entraîné uniquement sur les trois tâches de démonstration. Un pré-entraînement sur de grands ensembles de données force-couple diversifiés pourrait encore améliorer la généralisation à de nouveaux environnements et types de capteurs.
Le travail a été publié sous arXiv:2607.18231 en juillet 2026.


