EG
La mise à l'échelle des modèles de fondation comportementale révèle une recette de co-dimensionnement données-diversité
ResearchJuly 21, 2026Embodied Global

La mise à l'échelle des modèles de fondation comportementale révèle une recette de co-dimensionnement données-diversité

Une équipe de recherche multi-institutionnelle présente une recette systématique de mise à l'échelle pour les modèles de fondation comportementale, combinant suivi de mouvement en cadre global, données on-policy co-dimensionnées et diversité des mouvements de référence avec une architecture Humanoid Transformer.

#research#foundation-model#humanoid#scaling#transformer#arxiv
Reading in French

Une équipe de recherche regroupant l'Université chinoise de Hong Kong, l'Université Jiao Tong de Shanghai, l'Université du Zhejiang, l'Université de Pékin, l'Université Tsinghua, Galbot et le Laboratoire d'IA de Shanghai a publié une étude majeure sur la mise à l'échelle des Behavior Foundation Models (BFM) pour les robots humanoïdes. L'article, intitulé « Scaling Behavior Foundation Model for Humanoid Robots » (arXiv:2607.15163), identifie une recette à trois composants qui génère des améliorations substantielles en fidélité de contrôle et généralisation des tâches.

La recette de mise à l'échelle à trois composants

L'équipe démontre que la mise à l'échelle des BFM nécessite un réglage coordonné de trois piliers, plutôt que de simplement ajouter plus de paramètres :

  1. Paradigme de suivi de mouvement — Reformuler divers problèmes de contrôle humanoïde comme la reproduction de comportements corporels intégrés dans le cadre de coordonnées global, plutôt qu'un suivi découplé de la base et de la pose.
  2. Co-dimensionnement données-diversité — La synergie stratégique entre la quantité de déploiements on-policy (gouvernée par le parallélisme des environnements et l'horizon de déploiement) et la diversité des mouvements de référence (l'étendue des schémas comportementaux utilisés pour l'imitation).
  3. Architecture Humanoid Transformer — Une architecture de modèle expressive et évolutive qui fait émerger naturellement des représentations comportementales structurées.

Résultats : 82 % de réduction de l'erreur de suivi global

Le BFM mis à l'échelle réduit l'erreur moyenne de position par point clé (MPKPE) sur l'ensemble de test de plus de 10 % en mode local et de manière remarquable de 82 % en mode global par rapport aux contrôleurs humanoïdes existants. Le mode global est le problème le plus difficile — il nécessite que le robot suive à la fois le déplacement de la base et la posture du corps entier comme un tout intégré.

Principales conclusions des expériences de mise à l'échelle :

  • La mise à l'échelle des données on-policy nécessite des augmentations équilibrées à la fois en largeur (environnements parallèles) et en profondeur (horizon de déploiement). Augmenter une seule dimension n'améliore pas systématiquement les performances.
  • La diversité des mouvements de référence suit deux régimes : la mise à l'échelle homogène (plus de données du même domaine) n'apporte que des gains marginaux, tandis que la mise à l'échelle hétérogène (introduction de sources de données diverses) améliore considérablement les performances hors domaine.
  • Humanoid Transformer surpasse systématiquement les MLP conventionnels, un Transformer de taille moyenne égalant ou dépassant déjà un MLP sensiblement plus grand.

102 millions de trames de données de mouvement

L'équipe a construit un jeu de données de mouvement humain à grande échelle en agrégeant plus de 102 millions de trames à 50 IPS provenant de plusieurs sources, ensuite réorientées vers la plateforme humanoïde cible. C'est l'un des plus grands ensembles de données de mouvement utilisés pour le pré-entraînement des BFM humanoïdes à ce jour.

L'article couvre une gamme impressionnante de comportements démontrés répartis en quatre catégories : manipulation dextre (arrangement floral, cueillette de fruits, branchement de chargeurs), locomotion naturelle et agile (boxe, roulades, tai-chi, course), loco-manipulation coordonnée du corps entier (linge, cuisine, badminton, faire le lit), et contrôle polyvalent sous contraintes éparses.

Analyse de l'espace latent

Peut-être le plus intéressant d'un point de vue scientifique est l'analyse latente. Le Humanoid Transformer apprend naturellement des représentations latentes structurées sans objectifs auxiliaires — présentant localité, organisation globale et robustesse aux perturbations. L'augmentation de la capacité du modèle conduit à une convergence des représentations latentes à travers différents modes de contrôle, suggérant que des représentations comportementales partagées plus riches émergent à mesure que les BFM sont mis à l'échelle.

Cette convergence peut expliquer le comportement de mise à l'échelle dépendant du mode : les améliorations dans certains modes de contrôle s'accompagnent d'une légère dégradation dans d'autres en raison d'un couplage plus fort au sein de l'espace latent partagé.

Implications pour le domaine

L'étude établit le BFM comme un fondement principe et efficace pour un contrôle humanoïde évolutif et polyvalent. En démontrant des lois de mise à l'échelle claires avec des mesures empiriques, la recherche fournit une feuille de route pour les travaux futurs — un peu comme les lois de mise à l'échelle ont guidé les progrès des grands modèles de langage.

Cependant, les auteurs notent des limites : la conception de l'interface pour intégrer les BFM avec des politiques de haut niveau reste une question ouverte, et l'infrastructure de pré-entraînement actuelle reste préliminaire. L'équipe espère que ce travail fournira une base pour le développement systématique des BFM vers une intelligence humanoïde polyvalente.

Article : arXiv:2607.15163
Page du projet : scalebfm.github.io
Code : GitHub

Language: French- Showing content in French