Qumulo LogoQumulo Logo

Blog

Vergleich von Datensätzen für die KI-Optimierung und -Inferenz: Große Sprachmodelle vs. autonome Fahrsysteme

Bei Qumulo haben wir uns jahrelang der Entwicklung von unternehmensweiten „Scale Anywhere“-Primärspeichersystemen gewidmet und diese zu einer echten Cloud-Datenplattform weiterentwickelt: für die Bereiche Hochleistungsrechnen, Supercomputing, künstliche Intelligenz, Content-Erstellung, Gesundheitswesen, Biowissenschaften, Verteidigung/Nachrichtendienste und Forschung. Einer der wirkungsvollsten Anwendungsfälle für unsere Technologie war die Unterstützung von Cluster für autonomes Fahren, auch bekannt als Fahrassistenzsysteme (ADAS). Diese KI-Cluster, die für die Entwicklung autonomer Fahrzeuge von grundlegender Bedeutung sind, nutzen die einzigartigen Stärken von Qumulo bei der Verwaltung riesiger Datensätze mit einer Mischung aus großen und kleinen Dateien und bieten unübertroffene Beständigkeit, Konsistenz und Skalierbarkeit in öffentlichen, hybriden und privaten Cloud-Umgebungen.

Während große Sprachmodelle (LLMs) wie GPT-4 haben die Schlagzeilen beherrscht, weil sie in der Lage sind, Geschichten zu schreiben, den Sprachstil zu verfeinern oder sogar ganz passable Witze zu erzählen, ADAS-Cluster erfüllen eine noch wichtigere Aufgabe: die Sicherheit der Fahrer zu erhöhen, den Kraftstoffverbrauch zu optimieren und letztendlich Leben zu retten. Jeder dieser rechenintensiven Bereiche – ADAS und LLMs – weist feine Unterschiede auf, die sowohl Herausforderungen als auch Chancen mit sich bringen. Während LLMs zwar die Fantasie der Öffentlichkeit beflügeln mögen, sind wir bei Qumulo stolz darauf, die Datensysteme hinter vielen der weltweit größten ADAS-Cluster zu unterstützen – eine bahnbrechende Anwendung, die das Leben aller Verkehrsteilnehmer beeinflusst und Sicherheit sowie Effizienz verbessert.

In den letzten Jahren haben Fortschritte im Bereich der künstlichen Intelligenz die Entwicklung von LLMs wie der GPT-Serie von OpenAI sowie von ADAS vorangetrieben. Zwar sind beide für ihr Training auf umfangreiche Datensätze angewiesen, doch unterscheiden sich Art, Umfang und Struktur dieser Datensätze erheblich. Betrachten wir diese Unterschiede auf technischer Ebene und beleuchten wir dabei die jeweiligen Herausforderungen und Chancen.

Zweck und Art der Daten

Der grundlegende Unterschied zwischen LLMs und ADAS-Datensätzen liegt in ihrem Verwendungszweck und der Art der Daten, die sie verarbeiten.

Große Sprachmodelle (LLMs):

LLMs sind darauf ausgelegt, menschenähnliche Texte zu verarbeiten und zu generieren. Ihre Datensätze bestehen aus Token die aus Quellen natürlicher Sprache wie Büchern, Artikeln, Websites und Code-Repositorien stammen. Diese Datensätze legen den Schwerpunkt auf sprachliche Verallgemeinerung, wobei die Daten vielfältig und repräsentativ für die Sprache(n) sein müssen, für die das Modell eingesetzt werden soll. Die Tokenisierung – ein Prozess, bei dem Text in Teilworte oder Wörter zerlegt wird – ermöglicht eine effiziente Darstellung der Daten.

Autonomes Fahren / Fahrerassistenzsysteme (ADAS):

Autonome Fahrzeuge stützen sich bei der Navigation in realen Umgebungen auf Sensordaten. Zu diesen Datensätzen gehören unbearbeitete, unkomprimierte Ausgabedaten von Kameras, LiDAR, Radar, GPS und Trägheitsmesseinheiten (IMUs). Das Ziel besteht darin, Modelle so zu trainieren, dass sie räumliche Umgebungen erfassen, Objekte erkennen und Entscheidungen in Echtzeit treffen können. ADAS-Datensätze müssen nicht nur gängige Fahrsituationen, sondern auch seltene Randfälle wie widrige Wetterbedingungen oder ungewöhnliches Verhalten von Fußgängern erfassen.

Größen von Datensätzen: Eine quantitative Perspektive

Die Größen der Datensätze unterscheiden sich sowohl in absoluten Werten als auch hinsichtlich der Art und Weise, wie sie gemessen werden:

LLMs:

Der Umfang von LLM-Datensätzen wird in der Regel gemessen in Token. Zum Beispiel:

  • GPT-3 wurde auf etwa 300 Milliarden Token, was etwa 570 GB komprimierten Daten oder mehreren Terabyte unkomprimierten Daten entspricht (Brown et al., 2020).

  • Moderne LLMs wie GPT-4 nutzen wahrscheinlich Datensätze, die 1–2 Petabyte, insbesondere bei der Einbeziehung multimodaler und mehrsprachiger Quellen. Dies entspricht etwa einhundert 8K-RAW-Spielfilme.

ADAS:

ADAS-Datensätze werden gemessen in Speicherung von Rohdaten aufgrund der unkomprimierten Form der Sensorausgangssignale:

  • Ein einzelnes autonomes Fahrzeug erzeugt Täglich 1–10 Terabyte an Daten (Waymo, 2023).

  • Flottenweite Datensätze, die von Unternehmen wie Tesla und Waymo genutzt werden, übersteigen 100–500 Petabyte pro Jahr. Zum Vergleich: Die Flotte von Tesla sammelt über Täglich 1 Million Meilen Fahrdaten (Tesla AI Day, 2021). Im Vergleich zu den Trainingsdatensätzen für große Sprachmodelle (LLM) entspricht dies etwa 25.000 8K-RAW-Spielfilme pro Jahr – das entspricht 32 Jahren moderner Filmproduktion.

Vielfalt und Struktur der Daten

Auch die Struktur und Vielfalt der Daten verdeutlichen deutliche Gegensätze:

LLMs:

  • Durch Tokenisierung und Deduplizierung stark komprimierte Daten.

  • Legt Wert auf Vielfalt in verschiedenen Bereichen (z. B. wissenschaftliche Arbeiten, Belletristik, Programmcode), um die Verallgemeinerbarkeit sicherzustellen.

  • Es wird eine umfangreiche Vorverarbeitung durchgeführt, um Texte von geringer Qualität oder voreingenommene Texte herauszufiltern (OpenAI, 2020).

ADAS:

Daten sind von Natur aus hochdimensional und räumlich, darunter:

  • Video: Hochauflösende Aufnahmen (1080p oder 4K) mit 30–60 Bildern pro Sekunde.

  • LiDAR: Millionen von 3D-Punkten pro Sekunde.

Ein erheblicher Teil der Daten wird für folgende Zwecke verwendet: Simulation und Validierung, insbesondere bei seltenen Sonderfällen.

Rechnerische Herausforderungen

Zwar sind LLM-Datensätze gemessen am Rohspeicherplatz kleiner, doch stehen ihre Trainingskomplexität und ihr Rechenaufwand denen von ADAS in nichts nach:

LLMs:

  • Das Training umfasst Milliarden bis Billionen von Parametern, was eine Hochdurchsatzverarbeitung tokenisierter Datensätze erfordert.

  • Das Trainieren von GPT-3 erforderte ungefähr 3640 Petaflop-Tage Rechenleistung (Brown et al., 2020).

  • Optimierte Datenpipelines (z. B. Tokenisierung, Batching) reduzieren die effektive Größe des Datensatzes während des Trainings.

ADAS:

  • Die Verarbeitung umfasst Zeitreihendaten und räumliche Modellierung, was häufig Echtzeitleistung erfordert.

  • Zur Ergänzung des Trainings werden Simulationsumgebungen (z. B. CARLA, NVIDIA DRIVE) genutzt, was die Rechenkomplexität erhöht.

  • Spezialisierte Hardware wie GPUs oder dedizierte TPUs sowie CISC-CPUs mit großem Kernumfang und einem Sockel verarbeiten große Rohdatensätze für das Training und die Inferenz.

Datenbeständigkeit und -wachstum

LLMs:

  • Die Größe des Datensatzes nimmt mit zunehmender Modellkomplexität schrittweise zu. Das Wachstum verlangsamt sich jedoch aufgrund abnehmender Skaleneffekte (Kaplan et al., 2020).

  • Ältere Datensätze behalten ihre Relevanz, da sich sprachliche Grundlagen nicht schnell ändern.

ADAS:

  • Das Wachstum der Datensätze verläuft exponentiell, was auf folgende Gründe zurückzuführen ist:

    • Wachsende Flottengrößen und steigende Akzeptanzraten.

    • Fortschritte in der Sensortechnologie (höhere Auflösung und Abtastraten).

    • Erweiterung der Abdeckung von Randfällen für eine robuste Verallgemeinerung.

  • Ältere Datensätze können mit der Weiterentwicklung der Fahrzeug- und Sensortechnologien veralten.

Vergleich von Datensätzen

Aspekt: LLMs, ADAS/autonomes Fahren, Datensatzgröße: Terabyte bis zu wenigen Petabyte, Hunderte von Petabyte, Datentyp: Text (Token), Video, LiDAR, Radar, GPS, GIS, Satellitenbilder, Komprimierung: stark komprimiert (Tokenisierung), minimale Komprimierung (Rohdaten)ZweckSprachliches VerständnisRäumliche Entscheidungsfindung in Echtzeit – Rettung von Menschenleben und Verbesserung der VerkehrssicherheitWachstumLangsamere Skalierung mit abnehmenden ErträgenExponentielles Wachstum (Flotte, Sensoren)

Fazit

Die für das Training von LLMs und ADAS-Systemen verwendeten Datensätze sind auf die besonderen Herausforderungen ihrer jeweiligen Anwendungsbereiche zugeschnitten. Während LLMs auf stark komprimierte und kuratierte, vorwiegend textbasierte Daten zurückgreifen, verarbeiten ADAS-Systeme rohe, unkomprimierte Sensordaten, deren Speicherbedarf um Größenordnungen höher ist. Die Rechenkomplexität beim Training von LLMs ist jedoch oft mit der von ADAS vergleichbar, was den riesigen Parameterraum moderner Sprachmodelle widerspiegelt.Da sich diese Bereiche weiterentwickeln, werden Innovationen in der Datenverarbeitung und bei Modellarchitekturen weiterhin entscheidend sein, um die jeweiligen Herausforderungen zu bewältigen. Während ADAS-Systeme mit logistischen Hürden bei der Skalierung von Rohdaten konfrontiert sind, müssen LLMs das Gleichgewicht zwischen Datensatzgröße, Qualität und abnehmenden Erträgen finden.

Entscheidungsfreiheit

Angesichts der aktuellen Herausforderungen bei der Verarbeitung großer Sprachmodelle oder ADAS-Systeme stellt sich eine zentrale Frage: Verfügt mein Rechenzentrum über die erforderlichen Kapazitäten – Platz, Strom und Kühlung –, um die für das Training notwendigen Technologien für beschleunigtes Rechnen zu unterstützen? Ebenso wichtig ist es zu klären, ob ein kontinuierliches Training und eine kontinuierliche Feinabstimmung auf spezialisierter Hardware unerlässlich sind oder ob es ausreicht, diese Ressourcen vorübergehend zu nutzen, um ein bestimmtes Ergebnis zu erzielen, bevor zur Inferenz übergegangen wird.

Dies führt zu einer übergeordneten strategischen Entscheidung: Soll die Infrastruktur für beschleunigtes Rechnen vor Ort aufgebaut werden, oder ist es effizienter, die Skalierbarkeit und Kapazität öffentlicher Cloud-Umgebungen zu nutzen und Datensätze nahtlos über hybride Infrastrukturen hinweg zu verknüpfen? Wir bei Qumulo möchten unsere Kunden in die Lage versetzen, in beiden Szenarien hervorragende Ergebnisse zu erzielen, indem wir technologische Barrieren abbauen, damit sie die besten geschäftlichen, technischen und betrieblichen Entscheidungen für ihre individuellen Anforderungen treffen können. Um mehr über die bahnbrechende Leistung zu erfahren, die Qumulo mithilfe unserer Cloud Data Platform in der öffentlichen Cloud-Umgebung erzielt hat, lesen Sie weiter unter dieses Video.

Literaturverzeichnis

Brown, T. et al. (2020). Sprachmodelle sind „Few-Shot“-Lerner. NeurIPS. Link

Kaplan, J. et al. (2020). Skalierungsgesetze für neuronale Sprachmodelle. OpenAI. Link

Waymo (2023). Überblick über den Datensatz zum autonomen Fahren. Waymo Research. Website

Tesla AI Day (2021). Teslas Flottendatenerfassung. Tesla. Link