EG
RoboTTT : l'entraînement au moment du test étend le contexte des politiques robotiques à 8 000 pas sans surcoût de latence
ResearchJuly 24, 2026Embodied Global Editorial

RoboTTT : l'entraînement au moment du test étend le contexte des politiques robotiques à 8 000 pas sans surcoût de latence

Des chercheurs de NVIDIA GEAR, Stanford et UT Austin présentent RoboTTT, intégrant l'entraînement au moment du test dans les modèles de fondation robotiques pour étendre le contexte visuomoteur à 8 000 pas sans latence ajoutée, réalisant des gains de 87 % sur les tâches à long horizon.

#robottt#test-time-training#robot-policy#long-horizon#context-length#visuomotor#vla#nvidia-gear#stanford#ut-austin#siggraph-2026
Reading in French

Des chercheurs du laboratoire GEAR de NVIDIA, de l'université Stanford et de l'université du Texas à Austin ont présenté RoboTTT (Test-Time-Training Robot Policies), une méthode qui étend le contexte visuomoteur dans les modèles de fondation robotiques à 8 000 pas de temps — soit environ trois ordres de grandeur au-delà des politiques actuelles les plus avancées — sans aucune augmentation de la latence d'inférence.

Ce travail établit la longueur de contexte comme un nouvel axe de mise à l'échelle pour les modèles de fondation robotiques, de manière analogue à la façon dont l'extension de la fenêtre de contexte a entraîné des percées dans les grands modèles de langage. Les résultats ont été présentés à SIGGRAPH 2026.

L'idée centrale. Au cœur de RoboTTT se trouve l'intégration de l'entraînement au moment du test (TTT) dans les politiques vision-langage-action (VLA). Au lieu de stocker l'historique comme une séquence croissante de tokens dans un Transformer, RoboTTT compresse l'expérience historique en « poids rapides » — un petit ensemble de paramètres mis à jour en continu par descente de gradient pendant l'entraînement et l'inférence.

Les « poids lents » du modèle de base restent figés au moment de l'inférence, tandis que les poids rapides agissent comme un état de mémoire dynamique qui se met à jour à chaque nouvelle paire observation-action. Comme la taille des poids rapides est fixe, le coût d'inférence par pas reste constant quelle que soit la durée de fonctionnement du robot.

Conception technique clé. Construit sur l'architecture GR00T N1.7, l'équipe a inséré des couches TTT dans la tête d'action DiT à 16 couches du modèle plutôt que d'entraîner un modèle de fondation entièrement séparé. Pour étendre l'entraînement à des séquences de 8 000 pas, ils ont combiné le forçage d'actions séquentielles (niveaux de bruit indépendants pour différents blocs d'actions) avec la rétropropagation tronquée dans le temps (découpage des trajectoires pour l'entraînement tout en laissant les poids rapides se transmettre d'un segment à l'autre).

Le modèle a été pré-entraîné pendant 30 000 pas sur 16 GPU NVIDIA GB200 en utilisant des données de robot de bureau à deux bras et des vidéos humaines à la première personne, puis affiné pendant 20 000 pas supplémentaires sur des tâches cibles.

Résultats : 87 % d'amélioration sur les tâches à long horizon. Sur des tâches de manipulation robotique réelle difficiles utilisant un robot de bureau YAM à deux bras avec quatre caméras RealSense D405, RoboTTT a amélioré la performance globale de 87 % par rapport à une référence à contexte à pas unique. Fait critique, le modèle a entièrement accompli une tâche d'assemblage de dix étapes durant cinq minutes — quelque chose qu'aucune méthode de référence n'a jamais réussi.

Les capacités supplémentaires débloquées incluent :

  • Imitation en contexte en un seul essai : RoboTTT a réussi à imiter des tâches à partir de démonstrations vidéo humaines uniques 6 fois sur 10, tandis que les méthodes de référence échouaient entièrement.
  • Amélioration de la politique à la volée : La performance s'est améliorée de 36 % par rapport au même modèle sans capacité TTT, même lorsqu'il est déployé en temps réel.
  • Robustesse aux perturbations : Le modèle a réussi 83 % des essais sous des perturbations externes, contre 53 % pour la meilleure référence à contexte court.
  • Loi d'échelle confirmée : RoboTTT entraîné avec 8 000 pas a surpassé le même modèle pré-entraîné avec 1 000 pas de 62 %, fournissant la première preuve que la performance en boucle fermée augmente de manière constante avec la longueur du contexte de pré-entraînement.

Pourquoi c'est important. Si la longueur de contexte est bien un axe d'échelle propre pour les modèles de fondation robotiques — comme ce travail le suggère fortement — cela implique que simplement s'entraîner sur des trajectoires plus longues pourrait générer des gains de performance continus, de la même manière que la mise à l'échelle des paramètres et des données l'a fait pour les LLM. La propriété de latence fixe de l'approche TTT signifie que ces gains surviennent sans l'explosion de mémoire au moment de l'inférence qui résulterait d'une simple expansion des fenêtres de contexte Transformer. Pour les systèmes d'IA incarnée opérant dans le monde réel — où les tâches se déroulent sur des minutes, pas des millisecondes — cela pourrait être une insight architecturale fondatrice.

Source: arXiv / NVIDIA GEAR / Stanford / UT Austin
Language: French- Showing content in French