Qumulo LogoQumulo Logo

Blog

Comparaison d'ensembles de données pour le réglage et l'inférence de l'IA : Grands modèles de langage et systèmes de conduite autonome

Chez Qumulo, nous avons consacré des années à créer des systèmes de stockage primaire Scale Anywhere à l'échelle de l'entreprise et à les faire évoluer vers une véritable plate-forme de données en nuage : au service des secteurs de l'informatique haute performance, du supercalculateur, de l'intelligence artificielle, de la création de contenu, de la santé, des sciences de la vie, de la défense / du renseignement et de la recherche. L'un des cas d'utilisation les plus marquants de notre technologie a été la prise en charge de Clusters de conduite autonome également connu sous le nom de Systèmes avancés d'aide à la conduite (ADAS). Ces clusters d'IA, essentiels au développement des véhicules autonomes, s'appuient sur les atouts uniques de Qumulo pour gérer des ensembles de données massifs avec un mélange de fichiers de grande et de petite taille, offrant une durabilité, une cohérence et une évolutivité inégalées dans les environnements de cloud public, hybride et privé.

Tandis que les grands modèles linguistiques (LLM) comme le GPT-4 ont fait la une des journaux pour leur capacité à écrire des histoires, à affiner le langage ou même à faire des blagues décentes, Les grappes ADAS ont un objectif plus critique les domaines d'application les plus importants sont les suivants : améliorer la sécurité des conducteurs, optimiser l'utilisation du carburant et, en fin de compte, sauver des vies. Chacun de ces domaines à forte intensité de calcul - ADAS et LLM - présente des différences nuancées qui engendrent à la fois des défis et des opportunités. Alors que les LLM peuvent capter l'imagination du public, chez Qumulo, nous sommes fiers de renforcer les systèmes de données derrière plusieurs des plus grands clusters ADAS du monde, une application transformatrice qui touche la vie de chacun sur la route, en améliorant la sécurité et l'efficacité.

Ces dernières années, les progrès de l'intelligence artificielle ont conduit à des LLM, tels que la série GPT d'OpenAI, ainsi qu'à des ADAS. Bien que tous deux s'appuient sur des ensembles de données considérables pour la formation, la nature, l'échelle et la structure de ces ensembles de données diffèrent considérablement. Examinons ces contrastes au niveau technique, en mettant en lumière leurs défis et opportunités respectifs.

Finalité et nature des données

La différence fondamentale entre les LLM et les ensembles de données ADAS réside dans leur objectif et le type de données qu'ils ingèrent.

Grands modèles linguistiques (LLM) :

Les LLM sont conçus pour traiter et générer des textes de type humain. Leurs ensembles de données consistent en jetons dérivés de sources de langage naturel telles que des livres, des articles, des sites web et des référentiels de code. Ces ensembles de données mettent l'accent sur généralisation linguistique la tokenisation - un processus par lequel le texte est divisé en unités de sous-mots ou de mots - permet une représentation efficace des données. La tokenisation - un processus par lequel le texte est divisé en unités de sous-mots ou en mots - permet une représentation efficace des données.

Conduite autonome / Systèmes avancés d'aide à la conduite (ADAS) :

Les véhicules autonomes s'appuient sur des données de capteurs pour naviguer dans des environnements réels. Ces données comprennent sorties brutes, non compressées à partir de caméras, de LiDAR, de radars, de GPS et d'unités de mesure inertielle (IMU). L'objectif est de former des modèles capables de comprendre les environnements spatiaux, de reconnaître les objets et de prendre des décisions en temps réel. Les ensembles de données ADAS ne doivent pas seulement capturer les scénarios de conduite courants, mais aussi les cas extrêmes rares, tels que des conditions météorologiques défavorables ou un comportement inhabituel de la part des piétons.

Taille des ensembles de données : Une perspective quantitative

Les tailles des ensembles de données diffèrent à la fois en termes absolus et dans la manière dont elles sont mesurées :

LLMs :

L'échelle des ensembles de données LLM est généralement mesurée en jetons. Par exemple :

  • Le GPT-3 a été formé sur environ 300 milliards de jetons ce qui équivaut à ~570 Go de données compressées ou à plusieurs téraoctets non compressés (Brown et al., 2020).

  • Les LLM modernes tels que le GPT-4 utilisent probablement des ensembles de données excédant 1 à 2 pétaoctets en particulier lorsqu'il s'agit de sources multimodales et multilingues. Cela équivaut à environ cent longs métrages 8K RAW.

ADAS :

Les ensembles de données ADAS sont mesurés en stockage de données brutes en raison de la nature non comprimée des résultats des capteurs :

  • Un seul véhicule autonome génère 1 à 10 téraoctets de données par jour (Waymo, 2023).

  • Les ensembles de données à l'échelle d'une flotte, utilisés par des entreprises telles que Tesla et Waymo, dépassent les 100-500 pétaoctets par an. Pour donner un ordre d'idée, la flotte de Tesla recueille plus de 1 million de kilomètres de données de conduite par jour (Tesla AI Day, 2021). En comparaison avec les ensembles de données d'entraînement LLM, cela représente approximativement 25 000 longs métrages 8K RAW par an, soit 32 ans de cinéma moderne.

Diversité et structure des données

La structure et la diversité des données font également ressortir des contrastes importants :

LLMs :

  • Données hautement compressées grâce aux processus de tokenisation et de déduplication.

  • Priorité à la diversité des domaines (par exemple, articles scientifiques, fiction, code) afin de garantir la généralisation.

  • Un prétraitement important est effectué pour filtrer les textes de mauvaise qualité ou biaisés (OpenAI, 2020).

ADAS :

Les données sont par nature hautement dimensionnelles et spatiales :

  • Vidéo: Enregistrements en haute résolution (1080p ou 4K) à 30-60 images par seconde.

  • LiDAR: Des millions de points 3D par seconde.

Une part importante des données est utilisée pour simulation et validation en particulier pour les cas marginaux rares.

Défis informatiques

Bien que les ensembles de données LLM soient plus petits en termes de stockage brut, leur complexité d'apprentissage et leurs exigences de calcul rivalisent avec celles d'ADAS :

LLMs :

  • La formation implique des milliards, voire des trillions de paramètres, ce qui nécessite un traitement à haut débit d'ensembles de données tokenisées.

  • La formation GPT-3 a nécessité environ 3640 jours-pétaflop de calcul (Brown et al., 2020).

  • Les pipelines de données optimisés (par exemple, la tokenisation, la mise en lots) réduisent la taille effective de l'ensemble de données pendant la formation.

ADAS :

  • Le traitement implique des données de séries temporelles et une modélisation spatiale, nécessitant souvent des performances en temps réel.

  • Des environnements de simulation (par exemple, CARLA, NVIDIA DRIVE) sont utilisés pour renforcer la formation, ce qui accroît la complexité des calculs.

  • Du matériel spécialisé, tel que des GPU ou des TPU dédiés, et des CPU CISC monosocket à grande largeur de cœur traitent de vastes ensembles de données brutes pour l'apprentissage et l'inférence.

Longévité et croissance des données

LLMs :

  • La taille des ensembles de données augmente progressivement avec la complexité du modèle. Cependant, la croissance ralentit en raison de la diminution des rendements à l'échelle (Kaplan et al., 2020).

  • Les ensembles de données plus anciens restent pertinents, car les principes linguistiques fondamentaux n'évoluent pas rapidement.

ADAS :

  • La croissance des ensembles de données est exponentielle en raison de :

    • Augmentation de la taille des flottes et des taux d'adoption.

    • Les progrès de la technologie des capteurs (résolution et taux d'échantillonnage plus élevés).

    • Extension de la couverture des cas limites pour une généralisation robuste.

  • Les anciens ensembles de données peuvent devenir obsolètes au fur et à mesure que les technologies des véhicules et des capteurs évoluent.

Comparaisons des ensembles de données

AspectLLMsADAS/Conduite autonomeTaille du jeu de donnéesTéraoctets à faibles pétaoctetsCentaines de pétaoctetsType de donnéesTexte (jetons)Vidéo, LiDAR, Radar, GPS, GIS, Imagerie satelliteCompressionHautement compressée (symbolisation)Compression minimale (données brutes)ObjectifCompréhension linguistiqueDécision spatiale en temps réel - sauver des vies et améliorer la sécurité des transportsCroissanceMise à l'échelle réduite avec des rendements décroissantsCroissance exponentielle (parc de véhicules, capteurs)

Conclusion

Les ensembles de données utilisés pour la formation des LLM et des systèmes ADAS sont adaptés aux défis uniques de leurs domaines respectifs. Alors que les LLM s'appuient sur des données hautement compressées et traitées, principalement textuelles, les systèmes ADAS traitent des données de capteurs brutes, non compressées, dont les besoins en stockage sont bien plus importants. Cependant, la complexité informatique de la formation des LLM rivalise souvent avec celle des ADAS, reflétant le vaste espace de paramètres des modèles de langage modernes. Alors que ces domaines continuent d'évoluer, les innovations en matière de traitement des données et d'architectures de modèles resteront essentielles pour relever leurs défis respectifs. Alors que les systèmes ADAS sont confrontés aux obstacles logistiques de la mise à l'échelle des données brutes, les LLM doivent trouver un équilibre entre la taille des ensembles de données, la qualité et les rendements décroissants.

Liberté de choix

Lorsque l'on considère les défis modernes que représente le traitement de grands modèles de langage ou de systèmes ADAS, une question clé se pose : mon centre de données a-t-il la capacité - espace, puissance et refroidissement - de prendre en charge les technologies de calcul accéléré nécessaires à la formation ? Il est tout aussi important de déterminer si une formation et un réglage continus sur du matériel spécialisé sont essentiels ou s'il suffit d'exploiter ces ressources temporairement pour obtenir un résultat spécifique avant de passer à l'inférence.

Cela conduit à une décision stratégique plus large : l'infrastructure informatique accélérée doit-elle être construite sur place ou est-il plus efficace d'utiliser l'évolutivité et la capacité des environnements de cloud public, en connectant les ensembles de données de manière transparente à travers des infrastructures hybrides ? Chez Qumulo, nous visons à permettre à nos clients d'exceller dans les deux scénarios, en éliminant les barrières technologiques afin qu'ils puissent prendre les meilleures décisions commerciales, techniques et opérationnelles pour leurs besoins uniques. Pour en savoir plus sur les performances révolutionnaires que Qumulo a livrées dans l'environnement du cloud public à l'aide de notre plate-forme de données cloud, consultez les sites suivants cette vidéo.

Références

Brown, T., et al. (2020). Les modèles de langue sont des apprenants à peu d'égards. NeurIPS. Lien

Kaplan, J., et al. (2020). Scaling Laws for Neural Language Models (lois d'échelle pour les modèles de langage neuronaux). OpenAI. Lien

Waymo (2023). Aperçu de l'ensemble des données sur la conduite autonome. Recherche Waymo. Site web

Journée de l'IA Tesla (2021). Collecte de données sur le parc automobile de Tesla. Tesla. Lien