Qumulo LogoQumulo Logo

ブログ

AIのチューニングと推論のためのデータセットの比較:大規模言語モデルと自律走行システムの比較

Qumuloでは、Scale Anywhereエンタープライズ規模のプライマリストレージシステムを構築し、真のクラウドデータプラットフォームへと進化させることに長年取り組んできました。当社のテクノロジーで最もインパクトのあるユースケースのひとつは、次のようなサポートです。 自律走行クラスター としても知られている。 先進運転支援システム(ADAS).自律走行車開発の基盤となるこれらのAIクラスターは、大小のファイルが混在する膨大なデータセットの管理にQumulo独自の強みを発揮し、パブリック、ハイブリッド、プライベートクラウド環境において比類のない耐久性、一貫性、拡張性を提供します。

一方 大規模言語モデル(LLM) GPT-4のような選手たちは、ストーリーを書く能力、言葉を洗練させる能力、さらにはまともなジョークを言う能力で、ヘッドラインを独占してきた、 ADASクラスターはよりミッションクリティカルな目的を果たす ドライバーの安全性を高め、燃料使用量を最適化し、最終的には人命を救う。ADASとLLMという計算集約的な領域には、それぞれ微妙な違いがあり、課題と機会の両方をもたらしています。LLMは一般の人々の想像力をかき立てるかもしれませんが、Qumuloでは、世界最大のADASクラスタの多くを支えるデータシステムを支援できることを誇りに思っています。

近年、人工知能の進歩により、OpenAIのGPTシリーズやADASのようなLLMが推進されている。両者とも膨大なデータセットをトレーニングに利用しているが、これらのデータセットの性質、規模、構造は大きく異なっている。これらの対照を技術レベルで検証し、それぞれの課題と機会に光を当ててみよう。

データの目的と性質

LLMとADASデータセットの根本的な違いは、その目的と取り込むデータの種類にある。

大規模言語モデル(LLM):

LLMは人間のようなテキストを処理・生成するように設計されている。そのデータセットは トークン 書籍、記事、ウェブサイト、コードリポジトリなどの自然言語ソースから派生した。これらのデータセットは以下の点を重視している。 言語的一般化 このため、データは多様で、モデルが使用する言語を代表するものでなければならない。トークン化-テキストをサブワード単位または単語に分割するプロセス-により、データを効率的に表現できる。

自律走行/先進運転支援システム(ADAS):

自律走行車は、現実の環境をナビゲートするためにセンサーデータに依存している。これらのデータセットには以下が含まれる。 生の非圧縮出力 カメラ、LiDAR、レーダー、GPS、慣性計測装置(IMU)などから得られる。目標は、空間環境を理解し、物体を認識し、リアルタイムの意思決定を行うモデルを訓練することです。ADASのデータセットは、一般的な運転シナリオだけでなく、悪天候や歩行者の異常行動など、稀なエッジケースも捉える必要があります。

データセットのサイズ:定量的視点

データセットのサイズは、絶対値でも測定方法でも異なる:

LLM:

LLMデータセットの規模は通常、以下の単位で測定される。 トークン.例えば:

  • GPT-3は約30分間トレーニングされた。 3000億トークン 圧縮データで約570GB、非圧縮で数テラバイトに相当する(Brown et al.)

  • GPT-4のような最新のLLMは、おそらくそれを超えるデータセットを利用している。 1~2ペタバイト 特に、マルチモーダルかつ多言語のソースを組み込んだ場合。これは約 8K RAW長編映画.

ADAS:

ADASのデータセットは、以下の単位で測定される。 生データ保存 センサーの出力が非圧縮であるためだ:

  • 1台の自律走行車が生み出すもの 毎日1~10テラバイトのデータ (ウェイモ、2023年)。

  • テスラやウェイモなどの企業が使用しているフリート全体のデータセットは、その規模を上回っている。 年間100~500ペタバイト.ちなみに、テスラが保有する車両には、次のようなものがある。 毎日100万マイルの走行データ (Tesla AI Day、2021年)。LLMトレーニングデータセットと比較すると、これは約 毎年25,000本の8K RAW長編映画、つまり現代映画製作の32年分.

データの多様性と構造

データの構造と多様性もまた、対照的であることを浮き彫りにしている:

LLM:

  • トークン化と重複排除処理により高度に圧縮されたデータ。

  • 汎用性を確保するため、領域(科学論文、小説、コードなど)を超えた多様性を優先。

  • 低品質なテキストや偏ったテキストをフィルタリングするために、かなりの前処理が行われる(OpenAI, 2020)。

ADAS:

データは本質的に高次元で空間的なものである:

  • ビデオ:高解像度(1080pまたは4K)を30~60フレーム/秒で録画。

  • LiDAR:毎秒数百万点の3Dポイント。

データのかなりの部分が シミュレーションと検証 特に稀なエッジケースに対して。

計算上の課題

LLMデータセットは、ストレージ容量が小さいが、トレーニングの複雑さと計算量はADASに匹敵する:

LLM:

  • トレーニングには数十億から数兆のパラメータが含まれるため、トークン化されたデータセットの高スループット処理が必要となる。

  • トレーニングGPT-3の所要時間 3640ペタフロップ日 ブラウンら、2020)。

  • 最適化されたデータパイプライン(トークン化、バッチ化など)により、学習時の有効なデータセットサイズが削減される。

ADAS:

  • 処理には時系列データと空間モデリングが含まれ、しばしばリアルタイム性能が要求される。

  • シミュレーション環境(CARLA、NVIDIA DRIVEなど)はトレーニングを補強するために使用され、計算の複雑さを増す。

  • GPUや専用TPUのような特殊なハードウェアや、コア幅の大きなシングルソケットCISC CPUが、学習と推論のために大規模な生のデータセットを処理する。

データの寿命と成長

LLM:

  • データセットのサイズは、モデルの複雑さに応じて段階的に増加する。しかし、規模が大きくなると収穫が逓減するため、成長は鈍化する(Kaplan et al.)

  • 言語学的な基礎は急激に変化しないため、古いデータセットも依然として適切である。

ADAS:

  • データセットの増加は指数関数的である:

    • フリートサイズの拡大と採用率の向上。

    • センサー技術の進歩(より高い解像度とサンプリングレート)。

    • ロバストな汎化のためにエッジケースのカバレッジを拡大する。

  • 古いデータセットは、車両やセンサーの技術が進化するにつれて陳腐化する可能性がある。

データセットの比較

アスペクトLLMsADAS/自律走行データセットサイズテラバイト~低ペタバイト数百ペタバイトデータタイプテキスト(トークン)ビデオ、LiDAR、レーダー、GPS、GIS、衛星画像圧縮高度に圧縮(トークン化)最小限の圧縮(生データ)目的言語理解リアルタイムの空間的意思決定-人命救助と輸送の安全性向上成長リターンが減少する低スケーリング指数関数的成長(フリート、センサー)

結論

LLMとADASシステムのトレーニングに使用されるデータセットは、それぞれの領域特有の課題に合わせて調整される。LLMが高度に圧縮され、キュレーションされた、主にテキストデータに依存するのに対し、ADASシステムは生の、圧縮されていないセンサーデータを処理する。しかし、LLMのトレーニングの計算複雑さは、最新の言語モデルの膨大なパラメータ空間を反映して、しばしばADASのそれに匹敵します。これらの分野が進化し続けるにつれて、データ処理とモデル・アーキテクチャの革新は、それぞれの課題に対処するために引き続き不可欠です。ADASシステムが生データのスケーリングというロジスティックなハードルに直面する一方で、LLMはデータセットのサイズ、品質、リターンの減少のバランスをうまく調整しなければならない。

選択の自由

大規模な言語モデルやADASシステムの処理という現代的な課題を考えるとき、トレーニングに必要な高速コンピューティング技術をサポートする容量(スペース、電力、冷却)がデータセンターにあるかという重要な疑問が生じます。同様に重要なのは、専用ハードウェア上での継続的なトレーニングとチューニングが不可欠なのか、それとも推論に移行する前に特定の結果を得るために一時的にこれらのリソースを活用すれば十分なのかを判断することです。

これは、より広範な戦略的決断につながります。加速されたコンピューティング・インフラストラクチャをオンプレミスで構築すべきか、それともパブリック・クラウド環境のスケーラビリティとキャパシティを活用し、ハイブリッド・インフラストラクチャ間でデータセットをシームレスに接続する方が効率的なのか。Qumuloは、お客様がどちらのシナリオにおいても優れた能力を発揮できるようにすることを目指し、技術的な障壁を取り除くことで、お客様固有のニーズに対して、ビジネス、エンジニアリング、運用の面で最善の決断を下せるようにします。当社のクラウドデータプラットフォームを使用して、Qumuloがパブリッククラウド環境で実現した画期的なパフォーマンスの詳細については、以下をご覧ください。 このビデオ.

参考文献

Brown, T., et al.言語モデルは数発学習者である。NeurIPS. リンク

Kaplan, J., et al.ニューラル言語モデルのスケーリング則.OpenAI. リンク

ウェイモ(2023年)。自律走行データセットの概要。ウェイモ・リサーチ。 ウェブサイト

テスラAIの日(2021年)。テスラの車両データ収集。テスラ リンク