Les modèles de génération vidéo absorbent déjà de riches a priori sur la façon dont le monde visuel se déplace, se déforme et réagit au contact. La question ouverte pour la robotique était de savoir comment indiquer à un tel modèle ce que l'on veut voir se produire. Une équipe menée par l'Université de Stanford, avec l'Université du Maryland et Harvard — dont Li Fei-Fei, Jiajun Wu, Wenlong Huang, Yilun Du et Jia-Bin Huang — a soumis une réponse sur arXiv le 21 juillet : Masked Visual Actions (MVA), une interface de contrôle dans l'espace pixel qui transforme un modèle vidéo unique en modèle du monde unifié pour les robots.
L'action comme trajectoire partiellement révélée
L'idée centrale est d'une simplicité désarmante. Une action s'exprime comme une trajectoire partiellement révélée d'une entité arbitraire dans une vidéo — un masque qui expose où quelque chose se déplace dans le temps. Révélez le mouvement du robot, et le modèle se comporte comme un modèle de dynamique directe, prédisant comment la scène répond aux actions de bas niveau. Révélez plutôt le mouvement souhaité de l'objet, et le même checkpoint exécute la dynamique inverse, synthétisant le comportement du robot compatible avec ce résultat. Une seule interface, les deux directions de la modélisation du monde — sans tokenisation d'actions spécifique à chaque incarnation.
15 heures, un checkpoint, des incarnations jamais vues
L'efficacité des données est le chiffre marquant : le modèle a été affiné avec seulement 15 heures d'exemples masqués issus de vidéos réelles et de simulation. Il en résulte un checkpoint unique offrant une forte fidélité visuelle et une bonne contrôlabilité sur des scènes diverses et de multiples incarnations robotiques — et l'équipe souligne que chaque incarnation montrée sur la page du projet était absente de l'entraînement, des bras de table aux plateformes humanoïdes. Dans un domaine où le transfert inter-incarnations exige d'ordinaire de coûteuses collectes de données par robot, l'affirmation est significative.
Trois usages immédiats
L'article démontre trois applications en aval qui s'intègrent directement aux piles d'apprentissage robotique existantes. Pour l'évaluation de politiques, les déploiements imaginés par le modèle produisent des résultats corrélés à l'exécution réelle — un proxy économique pour tester des politiques sans user le matériel. Pour la planification basée modèle, il classe les futurs candidats et choisit la séquence d'actions dont le résultat imaginé semble le meilleur. Et pour la modélisation inverse, il génère le mouvement du robot à partir d'une trajectoire d'objet souhaitée — en somme, « montrez le but, obtenez le comportement ».
MVA s'inscrit dans la poussée plus large du domaine vers les modèles d'action-monde — l'idée, formulée dans plusieurs articles de feuille de route de 2026, que les modèles du monde unifiés ont besoin d'une manière commune et réutilisable d'exprimer les interventions. Une interface d'action dans l'espace pixel est à peu près aussi agnostique d'incarnation que possible. Le code est disponible sur le dépôt GitHub du projet, ce qui devrait rendre l'approche facile à sonder, évaluer et prolonger.


