Des chercheurs ont presente V-VLAPS (Value-Guided Vision-Language-Action Planning and Search), un nouveau framework qui resout une limitation fondamentale des modeles VLA actuels : leur biais reactif et leur incapacite a planifier dans des taches de manipulation complexes. En augmentant les planificateurs VLA avec un estimateur de valeur leger, V-VLAPS permet au MCTS de prioriser les branches d actions les plus prometteuses.
L innovation centrale de V-VLAPS est une tete de valeur compacte entrainee hors ligne sur un large corpus de simulations VLA. Cette tete de valeur apprend a predire le retour attendu d une paire etat-action donnee. Les resultats sur la suite LIBERO montrent des ameliorations de +6 points sur LIBERO-Object et +4 points sur LIBERO-10.


