Une équipe de recherche dirigée par Peng Ren et Kai Chen a introduit la Tokenisation d'Objets Persistants (POT), une approche novatrice pour fermer la boucle dans les politiques Vision-Langage-Action (VLA) humanoïdes en traitant les objets de la tâche comme des entités physiques persistantes à travers le mouvement, le contact, l'occlusion et la récupération.
Le problème de divergence d'état des objets
La loco-manipulation humanoïde à long horizon présente un défi fondamental : l'état de l'objet utilisé pour conditionner une action corps entier peut diverger de l'état utilisé pour vérifier si cette action a atteint la relation physique visée. Les politiques VLA standard traitent les objets comme des caractéristiques visuelles transitoires, perdant leur trace pendant le mouvement ou l'occlusion.
Fonctionnement de POT-VLA
Le cadre POT proposé maintient des enregistrements d'objets 3D indexés par rôle extraits d'observations RGB-D. Ces enregistrements persistants sont convertis en tokens d'objets qui conditionnent à la fois l'expert d'action corps entier et la vérification de prédicats géométriques. Cela produit un système d'exécution en boucle fermée où l'état de l'objet est simultanément actionnable et vérifiable.
Résultats concrets sur Unitree G1
Instancié sous le nom de POT-VLA et testé sur un robot humanoïde Unitree G1, l'approche démontre des améliorations spectaculaires :
- 39/80 → 71/80 succès sur huit familles de tâches du monde réel par rapport à une référence GR00T-N1.7 appariée
- 44/50 succès sur des tâches de service alignées sur Being-0, contre 37/50 rapporté par l'article Being-0
- Les gains les plus importants sur les tâches nécessitant le maintien de relations spatiales 3D
Implications pour la VLA humanoïde
Les résultats suggèrent qu'une représentation d'état persistante et centrée sur les objets est une abstraction utile pour l'exécution VLA humanoïde vérifiable. En ancrant les actions et la vérification dans les mêmes enregistrements d'objets 3D, POT-VLA comble un écrit critique entre la génération d'action et la vérification des résultats dans les tâches robotiques à long horizon.
Article : arXiv:2607.18016 [cs.RO], soumis le 20 juillet 2026.


