Systèmes de construction similaires au chat de prochaine génération pour la robotique
L’idée qu’un « moment de chatppt » pour la robotique est imminente a attiré à la fois l’excitation et le scepticisme. Bien que la séquence temporelle reste incertaine, les preuves suggèrent que la robotique approche rapidement d’un point de flexion. Les progrès de la collecte de données sur une grande échelle de téléopération, de simulation et de génération de balles synthétiques permettant la création de politiques de robot de plus en plus capables et généralisées.
Tout comme la façon dont Chatgpt a rénové la compréhension du public des grands modèles (LLM), le champ robotique pourrait essayer un saut similaire. La réalisation de cela, cependant, nécessitera non seulement des découvertes dans les algorithmes d’apprentissage, mais aussi de nouvelles stratégies pour la datation des données, l’assurance sécurité et le dépôt dans les environnements du monde réel non liés.
1. Évolution des pratiques de données dans l’apprentissage automatique
Au début de l’apprentissage automatique, les ensembles de données étaient modestes, souvent basés sur des tâches d’étiquetage de base effectuées par un travail humain à faible coût. En tant que pieu le apprentissage en profondeur, une conduite annotée spécialisée est apparue pour répondre aux besoins de domaines plus complexes, y compris l’apprentissage du renforcement de la rétroaction humaine (RLHF).
Le développement du modèle linguistique a progressé sur la doline Ensemble de données (démonstrations directes de la sortie souhaitée) vers hors de politique Ensemble de données (axé sur la robustesse, la sécurité et la résistance contradictoire).
Au contraire, la robotique fonctionne toujours principalement dans la phase politique, basée fortement sur des démonstrations téléopériques directes. L’intégration croissante des instructions du langage naturel dans les tuyaux de contrôle ouvre maintenant la route Action de vision-langage (VLA) Modèles, qui pourraient déplacer le champ vers des politiques plus riches et polyvalentes.
2. Découvertes récentes dans l’apprentissage de la robotique
Des recherches récentes ont produit des modèles capables de Généralisation à zéro coupeffectuer de nouvelles activités sans réaménagement spécifique de l’activité. Ces progrès exploitent souvent le prétraitement sur la stratégie Internet-A indiquée dans le LLM et l’adaptent à la robotique à travers Clonage de comportement informé par plusieurs données de téléopération.
L’émergence Paradigme VLA Combiner:
-
Modèle modèle de langue de grande langue
-
Fine run avec des données d’interaction robot réelles et simulées
-
Différentes activités, objets et couverture environnementale pour améliorer la généralisation
Les initiatives de collaboration contribuent également à des ensembles de données open source et à des protocoles expérimentaux partagés pour accélérer les progrès entre les institutions.
3. Collection de données de la meilleure pratique de la robotique aujourd’hui
Les projets de robotique modernes adoptent une variété de stratégies évolutives:
-
Téléopération de réduction des effectifs avec un reciblage croisé pour former plus de types de robots à partir des mêmes démonstrations
-
Interfaces ingornation-autochtones Pour réduire la complexité de la collecte de données
-
Services de collecte de troisième partie et le référentiel des ensembles de données publics pour communs les ressources de la communauté
-
Simulation et données synthétiques généré à l’aide de moteurs à forte fidélité et de physique générative pour combler l’écart sim-to-réel
4. Instructions futures pour le développement d’ensembles de données robotiques
4.1 Paramètres de référence et d’évaluation
Contrairement à l’élaboration du langage naturel, le manque de référence universellement accepté en raison de la variabilité du matériel, de la détection et des environnements. Des initiatives prometteuses travaillent sur:
-
Ensembles de données partagés et réimplémentations des activités reproductibles
-
Protocoles d’évaluation standardisés
-
Systèmes de classification automatisés pour réduire l’intervention humaine, bien que ceux-ci restent limités sur le terrain
4.2 Diversité des tests
L’évaluation équilibrée nécessite les deux Tests contrôlés centralisés ET Distributions décentralisées du monde réel Pour découvrir des scénarios rares ou contradictoires. Les mesures devraient s’étendre au-delà du succès de la tâche binaire pour inclure:
4.3 Sécurité rouge et équipe
La sécurité robotique nécessite une approche multicouche:
-
Garanties physiques (Limites de couple, mise en œuvre conforme, chauffeurs arrière)
-
Politiques logicielles pour éviter la collision et la protection humaine
5. Défis dans le déploiement du monde réel
Pour que les robots passent des ateliers à l’industrie et aux maisons, ils doivent fonctionner ci-dessous Aspire et conditions imprévisibles – y compris l’exposition à la poussière, à la boue, à l’eau et aux vibrations mécaniques – pendant que vous répondez aux normes de protection de l’entrée industrielle (IP) telles que IP65 – IP69k.
Les défis persistants comprennent:
-
Horizon de raisonnement long pendant plus d’heures et de multiples activités
-
Coordination dans les systèmes multi-robot et multi-agents
-
Filtrage des épisodes de données bruyantes ou à faible qualité à partir de grands ensembles de données
6. Outlook
Si la robotique suit la trajectoire du développement de LLM, l’intégration de compétences de raisonnement plus fortes, de données d’entraînement plus riches et de systèmes de sécurité rigoureux dans la simulation se traduira par des systèmes physiques plus fiables et plus fiables. Le chemin avant nécessite:
En combinant la collecte de données évolutives, des mécanismes de sécurité adaptatifs et une évaluation standardisée, la robotique peut progresser vers un réel « moment de chatppt », fournissant des systèmes capables, sûrs et fiables à travers la production, le service et les environnements nationaux.
En rapport