Le coût d'une reprise à zéro
Les politiques VLA et les agents de génération de code échouent de manière caractéristique : les VLA sous-performent hors distribution, les agents de code régénèrent des solutions entières à la moindre défaillance perceptive mineure.
SPARK soutient que la perception est la couche qui échoue le plus souvent et qu'il faut consacrer le calcul à un ancrage perceptif robuste.
Architecture
SPARK génère un arbre de comportement avec un unique appel Gemini, consacre le reste du budget à la perception (trois prompts par objet évalués par SAM3) et utilise une boucle de récupération en boucle fermée sans nouvel appel LLM.
Résultats
Sur LIBERO-Pro, SPARK atteint 43,7 %, soit plus du double de CaP-Agent0 (18,2 %) et des VLA. Il fonctionne sur UR10e, Franka FR3 et Franka bimanuelle avec 68 % de réussite moyenne sur neuf tâches.

