EG
OpenBMB open-source la série MiniCPM-Robot pour l'IA incarnée à faible latence
ResearchJuly 23, 2026Stax Chen

OpenBMB open-source la série MiniCPM-Robot pour l'IA incarnée à faible latence

OpenBMB a publié la série MiniCPM-Robot, une famille open-source de modèles d'intelligence incarnée conçus pour la perception en temps réel, la prise de décision et l'interaction physique dans les systèmes robotiques. La série inclut MiniCPM-RobotManip, un modèle VLA (Vision-Language-Action) de 1,5 milliard de paramètres pour la manipulation robotique qui surpasse des architectures plus grandes comme π0.5 et Qwen-VLA sur les benchmarks standard, et MiniCPM-RobotTrack, un modèle de 0,9 milliard de paramètres pour le suivi de cible incarné qui obtient des résultats à l'état de l'art parmi les alternatives open-source sur EVT-Bench. Complétant les modèles, PhyAI est un moteur d'inférence haute performance qui augmente le débit de 10 Hz à 37 Hz sur matériel NVIDIA H20 grâce à CUDA Graph et des kernels Triton fusionnés personnalisés. Publiée sous licence Apache-2.0, la série vise à combler l'écart entre les grands modèles vision-langage et les exigences de latence du matériel robotique du monde réel.

#OpenBMB#MiniCPM-Robot#embodied AI#VLA model#open source#robotic manipulation#PhyAI#on-device AI
Reading in French

Une IA incarnée open-source pour les robots du monde réel

OpenBMB a officiellement lancé la série MiniCPM-Robot, une nouvelle famille de modèles d'intelligence incarnée open-source conçus pour apporter des capacités d'IA embarquée et à haute vitesse aux systèmes robotiques du monde réel. La publication, disponible sous licence Apache-2.0 sur GitHub et Hugging Face, représente une étape importante vers la mise à disposition de la technologie Vision-Language-Action (VLA) avancée pour les développeurs en robotique, sans nécessiter d'infrastructure de calcul massive.

L'annonce répond à un défi de longue date dans l'IA incarnée : si les grands modèles vision-langage ont démontré des capacités de raisonnement impressionnantes, leur taille et leur latence d'inférence les rendent peu pratiques pour un déploiement direct sur du matériel robotique exigeant une réactivité en temps réel.

Deux modèles spécialisés, un cadre unifié

La série MiniCPM-Robot comprend deux modèles spécialisés couvrant des aspects complémentaires de l'intelligence incarnée, ainsi qu'un moteur d'inférence dédié optimisé pour le débit :

  • MiniCPM-RobotManip (1,5 Md) — Un modèle Vision-Language-Action polyvalent pour les tâches de manipulation robotique. Utilisant une politique unifiée avec un seul ensemble de poids, il gère diverses tâches aval tant en simulation que dans des environnements réels. Malgré sa taille compacte, il surpasse des modèles plus grands comme π₀.₅ (3 Md) et Qwen-VLA (5 Md+) sur les benchmarks d'évaluation représentatifs.
  • MiniCPM-RobotTrack (0,9 Md) — Un modèle ultra-compact optimisé pour le suivi de cible incarné. Il intègre des instructions en langage naturel avec des caractéristiques visuelles DINOv3 et SigLIP fusionnées pour prédire les points de passage futurs pour des tâches telles que le suivi de personne, obtenant des résultats SOTA parmi les modèles open-source sur le benchmark EVT-Bench.
  • Moteur d'inférence PhyAI — Un cadre d'exécution haute performance offrant un support Jour-0 pour la série. Sur matériel NVIDIA H20, PhyAI augmente le débit d'inférence de 10 Hz à 37 Hz grâce à CUDA Graph et des kernels Triton fusionnés personnalisés — une accélération de 3,7× qui est critique pour les boucles de contrôle robotique en temps réel.

Innovations techniques au service de la performance

MiniCPM-RobotManip met en œuvre une inférence en flux continu qui intègre les observations historiques dans le contexte du modèle, lui permettant de conserver jusqu'à une minute de mémoire visuelle tout en réduisant significativement la surcharge computationnelle. Le modèle hérite également de la compression de tokens visuels de MiniCPM-V 4.6, réduisant l'empreinte frame de 256 à 64 tokens visuels — un taux de compression de 4× qui se traduit directement par une inférence plus rapide et une utilisation mémoire moindre.

Pour le suivi, MiniCPM-RobotTrack s'appuie sur un pipeline de données auto-évolutif axé sur la qualité combiné à des interactions modèle-environnement de style DAgger pour améliorer la généralisation dans des scénarios réels complexes incluant croisements de cibles, virages rapides et occlusions partielles.

Sur matériel H100 en précision BF16, RobotManip atteint une latence forward de seulement 120 ms par étape de décision — bien en deçà du seuil de 200 ms généralement considéré comme nécessaire pour une manipulation robotique réactive. Déployé sur une plateforme Unitree Go2 EDU, RobotTrack maintient stablement plus de 5 IPS avec environ 180 ms de latence de bout en bout en utilisant un suivi en langage naturel entièrement local et uniquement visuel — aucune dépendance au cloud requise.

Pourquoi c'est important pour l'écosystème de l'IA incarnée

Cette publication signale un écosystème en voie de maturation où les modèles spécialisés et efficaces commencent à surpasser les grands modèles polyvalents sur des tâches robotiques spécifiques. En open-sourçant à la fois les modèles et le cadre d'inférence, OpenBMB abaissse la barrière à l'entrée pour les développeurs en robotique qui ont besoin d'intelligence embarquée en temps réel mais n'ont pas les ressources pour former ou déployer des modèles de fondation massifs.

La tendance vers des modèles plus petits et spécialisés a des implications importantes pour la robotique humanoïde. À mesure que les robots passent d'environnements de laboratoire contrôlés à des usines, des entrepôts et des maisons imprévisibles, la capacité de prendre des décisions compétentes localement — avec une latence minimale et aucune dépendance à la connectivité cloud — devient un prérequis pour un déploiement fiable et sûr.

OpenBMB, organisation de recherche IA chinoise surtout connue pour sa série MiniCPM de modèles de langage compacts, se positionne comme un acteur clé dans l'espace de l'IA incarnée en étendant son expertise en conception de modèles efficaces du domaine numérique au monde physique.

Source: OpenBMB / GitHub / Hugging Face
Language: French- Showing content in French