L'assemblage à contact riche est le cimetière des démonstrations d'apprentissage robotique. Un pion 0,4 mm trop serré, une bouteille qui se fissure au-delà de quelques newtons : ces tâches punissent les politiques « force brute » qui excellent dans les benchmarks de pick-and-place. Un article soumis sur arXiv le 23 juillet par Kyupaeck Jeff Rah et Midum Oh propose une autre répartition du travail : FORGE-plus, un cadre à deux couches qui a réussi l'intégralité de ses 256 épisodes d'évaluation — pose d'objets fragiles et insertion d'engrenages à jeu serré — sans briser une seule pièce.
Un LLM qui budgète la force au lieu de la produire
L'intuition de départ : les grands modèles de langage sont mauvais pour émettre des commandes de force continues, mais remarquablement bons pour raisonner sur des limites. FORGE-plus garde son LLM figé et purement textuel : à partir d'une description de tâche, le modèle attribue à chaque objet un plafond de force par contact et, quand quelque chose tourne mal, choisit des manœuvres de récupération dans un menu fixe — guidé par des descriptions textuelles de signatures de force plutôt que par des flux de capteurs bruts. L'exécution bas niveau reste aux contrôleurs de force classiques ; le modèle de langage ne touche jamais la boucle de couple. Le système obtenu possède une enveloppe de sécurité explicite, auditable et fixée avant même que le bras ne bouge.
5,4 N de pic moyen, zéro casse
Évalué sur la pose d'une bouteille fragile et l'insertion d'un engrenage avec un jeu de 0,4 mm — avec une pince Robotiq 2F-140 sur un bras Franka Panda — FORGE-plus affiche un pic de force de contact moyen de seulement 5,4 N sur l'ensemble du benchmark. Quand les chercheurs ont délibérément injecté du glissement en cours d'épisode, l'étape de récupération par signatures textuelles a sauvé entre 40 % et 64 % des essais selon la condition, transformant des échecs annoncés en insertions réussies.
Les résultats négatifs comptent autant
Tout aussi précieux : ce que l'article rapporte ne pas fonctionner. Les politiques entraînées par PPO échouent sous des contraintes de force strictes, et les stratégies de relâchement apprises sous-performent leurs équivalents scriptés — la preuve que pour l'assemblage fragile, une décomposition soigneuse bat l'apprentissage de bout en bout quand les marges matérielles se mesurent en newtons.
La réserve est énoncée tout aussi clairement : toutes les évaluations ont été menées en simulation de corps rigides pure, sans aucune revendication de transfert sim-to-real. Mais la recette est bon marché à adopter — un modèle figé, un budget de force, un menu de récupération — et elle offre aux intégrateurs un canevas pour embarquer le raisonnement des modèles de langage sur de vraies lignes sans leur confier la boucle servo.


