Recherche
Articles académiques, percées techniques et découvertes scientifiques
543 articles

SynthRender and I-AsSET: Open-Source Framework and Dataset for Bidirectional Sim-Real Transfer in Industrial Object Perception
New research on arXiv explores advanced approaches in robotics and embodied AI, presenting novel methods for robot learning and autonomous manipulation.


FORGE-plus : un LLM figé fixe les budgets de force, 256/256 essais réussis
Un cadre à deux couches permet à un LLM figé purement textuel d'attribuer des plafonds de force par objet et de choisir des manœuvres de récupération à partir de signatures de force textuelles, réussissant les 256 épisodes d'évaluation — pose de bouteille fragile et insertion d'engrenage à jeu de 0,4 mm — sans casse.

SoftNav : des tokens de scène 3D transforment un VLM gelé en navigateur transférable
SoftNav, accepté à IROS 2026, injecte des tokens de scène 3D au niveau entité directement dans l'espace latent d'un VLM gelé — 74,2 % de réussite sur HM3D-OVON avec seulement ~17M de paramètres entraînables et ~1 200 échantillons, puis transfert zéro-shot sur un vrai Unitree Go2.

KineBench : un benchmark sans IDM soumet les modèles du monde incarnés à un test cinématique de réalité
KineBench, accepté à ECCV 2026, évalue les modèles du monde incarnés sans modèles de dynamique inverse fragiles : des modèles de vision en cascade extraient des poses 6D de l'effecteur terminal depuis les vidéos générées et les rejouent dans un simulateur physique sur 20 tâches ManiSkill3.

Masked Visual Actions : une interface fait des modèles vidéo des modèles du monde unifiés pour robots
Une équipe menée par Stanford présente Masked Visual Actions, une interface de contrôle dans l'espace pixel qui permet aux modèles de génération vidéo de servir de modèles de dynamique directe et inverse pour les robots — avec seulement 15 heures de finetuning.