Les politiques de manipulation basées sur l'apprentissage prédisent généralement les actions du robot à partir d'observations sensorielles et confient l'exécution à un contrôleur bas niveau séparé. Un nouvel article de l'Université Sungkyunkwan soutient que cette séparation est précisément la raison pour laquelle les tâches à contact rigide échouent — et propose une solution permettant à la politique de décider non seulement quel mouvement commander, mais comment le contrôleur doit se comporter pendant l'exécution.
Le problème : inadéquation politique-contrôleur
En contact rigide, la même commande de mouvement peut mener à un contact instable, une erreur de suivi, une charge excessive ou un dommage d'outil selon le comportement du contrôleur bas niveau. Le contrôle en admittance suit précisément le mouvement mais peut accumuler des forces dangereuses ; le contrôle en impédance est plus sûr au contact mais sacrifie la précision de suivi. La plupart des politiques apprises n'ont aucun mot à dire sur le régime qui exécute leurs commandes.
URF : un cadre unique pour l'action et le contrôle
Le Unified Robot Control-Policy Framework (URF), soumis à IEEE Robotics and Automation Letters (RA-L), relie la prédiction d'actions compliantes à un contrôle unifié impédance-admittance. À partir d'observations multimodales, URF prédit trois éléments simultanément :
- Une cible virtuelle — où le robot doit se déplacer
- Une matrice de rigidité — le degré de rigidité de chaque direction
- Un ratio de commutation impédance-admittance — quand le contrôleur doit se comporter en admittance pour un suivi précis du mouvement ou en impédance pour un contact rigide plus sûr
Les données de démonstration ne fournissant pas la rigidité réelle de l'environnement, l'équipe a construit des étiquettes de ratio de commutation à partir des forces de contact mesurées, supervisant ainsi la prédiction du mode de contrôle — une solution pratique à une lacune clé des données d'entraînement.
Résultats : moins d'outils cassés, moins d'arrêts de sécurité
Sur des tâches de retournement de boîte et de pression de ligne, URF a obtenu des taux de réussite supérieurs à la référence en admittance seule (ACP) tout en éliminant ses modes de défaillance caractéristiques. En retournement de boîte, ACP a cassé son outil 0,86 seconde après le contact, tandis qu'URF a accompli la tâche en abaissant la rigidité et le ratio de commutation avant le contact, puis en changeant de régime en cours de mouvement lorsque la poussée se transformait en levage. En pression de ligne, URF a maintenu une force de contact stable supérieure à 5N, tandis qu'ACP n'établissait pas de contact stable et montrait de fortes oscillations de force avant de déclencher un arrêt de sécurité du robot.
Pourquoi c'est important
À mesure que les modèles VLA abordent des tâches industrielles à contact riche — de l'insertion et l'assemblage à la finition de surface — l'interface entre politiques haut niveau et contrôle bas niveau devient un goulot d'étranglement de fiabilité. Les résultats d'URF suggèrent que les politiques sensibles au contact gagnent à prédire non seulement des actions compliantes mais aussi le comportement du contrôleur utilisé pour les exécuter, ouvrant la voie à une co-conception politique-contrôle plus étroite pour la manipulation de qualité industrielle.
La page du projet est disponible sur jiyou384.github.io/urf_project_page.


