Des chercheurs d'Alaya Studio et de Shanda AI Research, en collaboration avec l'Institut de technologie de Pékin et l'Université Tsinghua, ont publié un nouvel article sur arXiv intitulé « From Pixels to States: Rethinking Interactive World Models as Game Engines », soutenant que les modèles de monde basés sur les états représentent une approche structurellement supérieure à la prédiction de pixels.
L'article, soumis le 15 juillet 2026, s'est classé huitième parmi les articles tendance de Hugging Face Daily Papers pour la semaine au 19 juillet, reflétant un fort intérêt de la communauté pour ce débat architectural.
L'approche dominante de la modélisation interactive du monde utilise des modèles génératifs vidéo — souvent basés sur la diffusion ou les transformeurs autorégressifs — pour prédire l'image visuelle suivante en fonction des images précédentes et d'une action du joueur. Cependant, l'article soutient que les modèles de prédiction de pixels ont un problème structurel fondamental : l'absence d'état interne persistant.
Les auteurs identifient trois défaillances cumulatives : l'application incohérente des règles dans des conditions évolutives, des conséquences qui ne persistent pas sur de longs horizons temporels, et des boucles de génération trop lentes pour une interaction en temps réel.
Yann LeCun, qui a fondé AMI Labs après avoir quitté Meta, a publiquement fait valoir le même argument : tout système qui modélise le monde en prédisant des pixels gaspille sa capacité sur des détails intrinsèquement imprévisibles. Son architecture JEPA prédit dans un espace de représentation abstrait plutôt qu'au niveau des pixels.
Les implications de l'article s'étendent à la robotique et à l'IA incarnée, où des modèles de monde interactifs fiables pourraient remplacer ou compléter les essais physiques pour la formation des robots et des systèmes autonomes.


