Qumulo LogoQumulo Logo

블로그

AI 튜닝 및 추론을 위한 데이터 세트 비교: 대규모 언어 모델과 자율 주행 시스템 비교하기

큐뮬로는 고성능 컴퓨팅, 슈퍼컴퓨팅, 인공지능, 콘텐츠 제작, 의료, 생명과학, 국방/지능, 연구 부문에 적합한 Scale Anywhere 엔터프라이즈급 기본 스토리지 시스템을 만들고 이를 진정한 클라우드 데이터 플랫폼으로 발전시키는 데 수년간 헌신해 왔습니다. 저희 기술의 가장 영향력 있는 사용 사례 중 하나는 다음을 지원하는 것입니다 자율 주행 클러스터 로도 알려진 첨단 운전자 보조 시스템(ADAS). 자율 주행 차량 개발의 기반이 되는 이러한 AI 클러스터는 크고 작은 파일이 혼합된 대규모 데이터 세트를 관리하는 Qumulo만의 강점을 활용하여 퍼블릭, 하이브리드, 프라이빗 클라우드 환경 전반에서 탁월한 내구성, 일관성, 확장성을 제공합니다.

동안 대규모 언어 모델(LLM) gPT-4처럼 이야기를 쓰고, 언어를 다듬고, 심지어 괜찮은 농담을 던지는 능력으로 헤드라인을 장악하고 있습니다, 보다 미션 크리티컬한 용도로 사용되는 ADAS 클러스터 운전자 안전을 강화하고, 연료 사용을 최적화하며, 궁극적으로 생명을 구할 수 있습니다. 이러한 연산 집약적인 영역인 ADAS와 LLM은 각각 미묘한 차이점을 가지고 있으며, 이는 도전과 기회를 동시에 가져다줍니다. LLM은 대중의 상상력을 사로잡을 수 있지만, Qumulo는 도로 위 모든 사람의 삶에 영향을 미치고 안전과 효율성을 개선하는 혁신적인 애플리케이션인 세계 최대 규모의 ADAS 클러스터의 데이터 시스템을 지원하는 것을 자랑스럽게 생각합니다.

최근 몇 년 동안 인공지능의 발전으로 인해 OpenAI의 GPT 시리즈와 같은 LLM은 물론 ADAS도 발전해 왔습니다. 둘 다 학습을 위해 상당한 규모의 데이터 세트에 의존하지만, 이러한 데이터 세트의 성격, 규모, 구조는 크게 다릅니다. 이러한 차이를 기술적 수준에서 살펴보고 각각의 과제와 기회를 조명해 보겠습니다.

데이터의 목적과 성격

LLM과 ADAS 데이터 세트의 근본적인 차이점은 그 목적과 수집하는 데이터 유형에 있습니다.

대규모 언어 모델(LLM):

LLM은 사람과 유사한 텍스트를 처리하고 생성하도록 설계되었습니다. 데이터 세트는 다음과 같이 구성됩니다 토큰 책, 기사, 웹사이트, 코드 저장소 등의 자연어 소스에서 파생된 데이터입니다. 이러한 데이터 세트는 다음을 강조합니다 언어 일반화 를 사용하려면 데이터가 다양하고 모델이 지원할 언어를 대표할 수 있어야 합니다. 토큰화(텍스트를 하위 단어 단위 또는 단어로 분할하는 프로세스)는 데이터를 효율적으로 표현할 수 있게 해줍니다.

자율 주행/첨단 운전자 지원 시스템(ADAS):

자율 주행 차량은 센서 데이터에 의존하여 실제 환경을 탐색합니다. 이러한 데이터 세트에는 다음이 포함됩니다 압축되지 않은 원시 출력 카메라, LiDAR, 레이더, GPS, 관성 측정 장치(IMU)로부터 데이터를 수집합니다. 목표는 공간 환경을 이해하고 사물을 인식하며 실시간으로 의사 결정을 내릴 수 있도록 모델을 학습시키는 것입니다. ADAS 데이터 세트는 일반적인 주행 시나리오뿐만 아니라 악천후나 비정상적인 보행자 행동과 같은 드문 엣지 케이스도 캡처해야 합니다.

데이터 집합 크기: 정량적 관점

데이터 세트의 크기는 절대적인 측면과 측정 방식이 모두 다릅니다:

LLM:

LLM 데이터 세트의 규모는 일반적으로 다음과 같은 단위로 측정됩니다 토큰. 예를 들어

  • GPT-3는 약 3,000억 토큰 압축 데이터의 경우 약 570GB, 비압축 데이터의 경우 수 테라바이트에 해당합니다(Brown et al., 2020).

  • GPT-4와 같은 최신 LLM은 다음을 초과하는 데이터 세트를 사용할 가능성이 높습니다 1-2 페타바이트 특히 멀티모달 및 다국어 소스를 통합할 때 더욱 그렇습니다. 이는 약 100분의 1에 해당하는 8K RAW 장편 영화.

ADAS:

ADAS 데이터 세트는 다음에서 측정됩니다 원시 데이터 저장 센서 출력의 비압축 특성으로 인한 것입니다:

  • 자율주행 차량 한 대가 생성하는 매일 1~10테라바이트의 데이터 (Waymo, 2023).

  • Tesla 및 Waymo와 같은 회사에서 사용하는 차량 전체 데이터 세트는 다음을 초과합니다 연간 100-500 페타바이트. 맥락을 위해 Tesla의 차량은 다음과 같이 수집됩니다 매일 1백만 마일의 주행 데이터 (테슬라 AI의 날, 2021). LLM 학습 데이터 세트와 비교하면 대략 다음과 같습니다 매년 25,000편의 8K RAW 장편 영화, 즉 현대 영화 제작 32년 분량.

데이터의 다양성 및 구조

데이터의 구조와 다양성 또한 극명한 대조를 이룹니다:

LLM:

  • 토큰화 및 중복 제거 프로세스로 인해 고도로 압축된 데이터.

  • 일반화를 보장하기 위해 여러 영역(예: 과학 논문, 소설, 코드)에서 다양성을 우선시합니다.

  • 품질이 낮거나 편향된 텍스트를 필터링하기 위해 상당한 전처리가 수행됩니다(OpenAI, 2020).

ADAS:

데이터는 본질적으로 고차원적이고 공간적인 특성을 지니고 있습니다:

  • 비디오: 초당 30~60프레임의 고해상도(1080p 또는 4K) 녹화.

  • LiDAR: 초당 수백만 개의 3D 포인트.

데이터의 상당 부분은 다음 용도로 사용됩니다 시뮬레이션 및 검증 특히 드문 엣지 케이스의 경우 더욱 그렇습니다.

계산 문제

LLM 데이터 세트는 원시 스토리지 측면에서는 더 작지만, 학습 복잡성과 컴퓨팅 요구 사항은 ADAS에 필적하는 수준입니다:

LLM:

  • 학습에는 수십억에서 수조 개의 매개변수가 포함되므로 토큰화된 데이터 세트의 처리량이 높아야 합니다.

  • GPT-3 교육에 필요한 시간은 대략 다음과 같습니다 3640 페타플롭-일 의 계산을 수행합니다(Brown et al., 2020).

  • 최적화된 데이터 파이프라인(예: 토큰화, 일괄 처리)은 학습 중 효과적인 데이터 세트 크기를 줄여줍니다.

ADAS:

  • 처리에는 시계열 데이터와 공간 모델링이 포함되며, 실시간 성능이 필요한 경우가 많습니다.

  • 시뮬레이션 환경(예: CARLA, NVIDIA DRIVE)은 교육을 강화하는 데 사용되므로 계산 복잡성이 증가합니다.

  • GPU 또는 전용 TPU와 같은 특수 하드웨어와 대규모 코어 폭의 단일 소켓 CISC CPU는 학습 및 추론을 위해 대규모 원시 데이터 세트를 처리합니다.

데이터 수명 및 성장

LLM:

  • 데이터 세트 크기는 모델 복잡성에 따라 점진적으로 증가합니다. 그러나 규모에 따른 수익률 감소로 인해 성장이 둔화됩니다(Kaplan et al., 2020).

  • 언어의 기본은 빠르게 변하지 않으므로 오래된 데이터 세트는 여전히 관련성이 있습니다.

ADAS:

  • 데이터 세트가 기하급수적으로 증가하는 이유는 다음과 같습니다:

    • 차량 규모 증가 및 채택률 증가.

    • 센서 기술의 발전(더 높은 해상도 및 샘플링 속도).

    • 강력한 일반화를 위해 엣지 사례의 범위를 확장합니다.

  • 차량 및 센서 기술이 발전함에 따라 오래된 데이터 세트는 쓸모없어질 수 있습니다.

데이터 집합 비교

측면LLMsADAS/자율 주행데이터셋 크기테라바이트에서 낮은 페타바이트수백 페타바이트데이터 유형텍스트(토큰)비디오, 라이다, 레이더, GPS, GIS, 위성 이미지압축고도로 압축(토큰화)최소 압축(로데이터)목적언어적 이해실시간 공간 의사 결정-생명 보호 및 교통 안전 개선성장수익 감소에 따른 확장 속도 감소기하급수적 성장(차량, 센서)차량, 센서)

결론

LLM과 ADAS 시스템 학습에 사용되는 데이터 세트는 각 영역의 고유한 과제에 맞게 조정됩니다. LLM은 고도로 압축되고 선별된, 주로 텍스트 데이터에 의존하는 반면, ADAS 시스템은 스토리지 요구 사항이 훨씬 더 큰 압축되지 않은 원시 센서 데이터를 처리합니다. 그러나 최신 언어 모델의 방대한 매개변수 공간을 반영하듯 LLM 학습의 계산 복잡성은 종종 ADAS에 필적하는 경우가 많으며, 이러한 분야가 계속 발전함에 따라 데이터 처리 및 모델 아키텍처의 혁신은 각각의 과제를 해결하는 데 여전히 중요할 것입니다. ADAS 시스템은 원시 데이터 확장이라는 물류적 장애물에 직면해 있는 반면, LLM은 데이터 세트 크기, 품질, 수익률 감소 사이의 균형을 찾아야 합니다.

선택의 자유

대규모 언어 모델이나 ADAS 시스템을 처리해야 하는 최근의 과제를 고려할 때, 데이터 센터가 학습에 필요한 가속 컴퓨팅 기술을 지원할 수 있는 용량(공간, 전력, 냉각)을 갖추고 있는가라는 핵심적인 질문이 생깁니다 마찬가지로 중요한 것은 특수 하드웨어에 대한 지속적인 훈련과 튜닝이 필수적인지, 아니면 추론으로 전환하기 전에 특정 결과를 얻기 위해 일시적으로 이러한 리소스를 활용하는 것으로 충분한지 판단하는 것입니다.

가속 컴퓨팅 인프라를 온프레미스에 구축해야 할까요, 아니면 퍼블릭 클라우드 환경의 확장성과 용량을 활용하여 하이브리드 인프라 전반에서 데이터 세트를 원활하게 연결하는 것이 더 효율적일까요? Qumulo는 고객이 두 가지 시나리오 모두에서 탁월한 역량을 발휘할 수 있도록 기술 장벽을 허물어 각자의 고유한 요구에 맞는 최고의 비즈니스, 엔지니어링, 운영 결정을 내릴 수 있도록 지원하는 것을 목표로 합니다. 클라우드 데이터 플랫폼을 사용하여 퍼블릭 클라우드 환경에서 Qumulo가 제공한 획기적인 성과에 대해 자세히 알아보려면 다음을 확인하세요 이 비디오.

참조

Brown, T., 외. (2020). 언어 모델은 소수 학습자. NeurIPS. 링크

Kaplan, J., 외. (2020). 신경 언어 모델의 스케일링 법칙. OpenAI. 링크

웨이모(2023). 자율 주행 데이터 세트 개요. 웨이모 리서치. 웹사이트

테슬라 AI의 날 (2021). Tesla의 차량 데이터 수집. Tesla. 링크

조정을 위한 데이터 세트 비교 및...