Na Qumulo, dedicamos anos à criação dos sistemas de armazenamento primário Scale Anywhere para toda a empresa e à sua evolução para uma verdadeira Plataforma de Dados na Nuvem: atendendo aos setores de computação de alto desempenho, supercomputação, inteligência artificial, criação de conteúdo, saúde, ciências da vida, defesa/inteligência e pesquisa. Um dos casos de uso mais impactantes da nossa tecnologia tem sido o suporte a Clusters de direção autônoma, também conhecido como Sistemas Avançados de Assistência ao Motorista (ADAS). Esses clusters de IA, fundamentais para o desenvolvimento de veículos autônomos, aproveitam os pontos fortes exclusivos da Qumulo no gerenciamento de conjuntos de dados massivos com uma combinação de arquivos grandes e pequenos, oferecendo durabilidade, consistência e escalabilidade inigualáveis em ambientes de nuvem pública, híbrida e privada.
Embora grandes modelos de linguagem (LLMs) como o GPT-4 têm sido destaque nas manchetes por sua capacidade de escrever histórias, refinar a linguagem ou até mesmo contar piadas engraçadas, Os clusters ADAS cumprem uma função ainda mais essencial: aumentar a segurança dos motoristas, otimizar o consumo de combustível e, em última instância, salvar vidas. Cada uma dessas áreas que exigem grande capacidade computacional — ADAS e LLMs — apresenta diferenças sutis que trazem tanto desafios quanto oportunidades. Embora os LLMs possam chamar a atenção do público, na Qumulo, temos orgulho de capacitar os sistemas de dados por trás de muitos dos maiores clusters de ADAS do mundo, uma aplicação transformadora que afeta a vida de todos na estrada, melhorando a segurança e a eficiência.
Nos últimos anos, os avanços na inteligência artificial impulsionaram o desenvolvimento de modelos de linguagem de grande escala (LLMs), como a série GPT da OpenAI, bem como os sistemas de assistência ao motorista avançados (ADAS). Embora ambos dependam de conjuntos de dados consideráveis para o treinamento, a natureza, a escala e a estrutura desses conjuntos de dados diferem significativamente. Vamos examinar essas diferenças em um nível técnico, esclarecendo seus respectivos desafios e oportunidades.
Finalidade e natureza dos dados
A diferença fundamental entre os conjuntos de dados de LLMs e de ADAS reside em sua finalidade e no tipo de dados que eles processam.
Modelos de Linguagem de Grande Escala (LLMs):
Os LLMs são projetados para processar e gerar textos semelhantes aos humanos. Seus conjuntos de dados consistem em fichas derivados de fontes de linguagem natural, como livros, artigos, sites e repositórios de código. Esses conjuntos de dados enfatizam generalização linguística, exigindo que os dados sejam diversos e representativos do(s) idioma(s) ao(s) qual(is) o modelo se destina. A tokenização — um processo no qual o texto é dividido em unidades menores que palavras ou em palavras — permite uma representação eficiente dos dados.
Direção autônoma / Sistemas avançados de assistência ao motorista (ADAS):
Os veículos autônomos dependem de dados de sensores para se orientarem em ambientes do mundo real. Esses conjuntos de dados incluem saídas brutas, não compactadas provenientes de câmeras, LiDAR, radar, GPS e unidades de medição inercial (IMUs). O objetivo é treinar modelos para compreender ambientes espaciais, reconhecer objetos e tomar decisões em tempo real. Os conjuntos de dados de ADAS devem capturar não apenas cenários comuns de direção, mas também casos extremos raros, como condições climáticas adversas ou comportamentos incomuns de pedestres.
Tamanhos dos conjuntos de dados: uma perspectiva quantitativa
Os tamanhos dos conjuntos de dados diferem tanto em termos absolutos quanto na forma como são medidos:
LLMs:
A escala dos conjuntos de dados de LLM é normalmente medida em fichas. Por exemplo:
O GPT-3 foi treinado com aproximadamente 300 bilhões de tokens, o que equivale a cerca de 570 GB de dados compactados ou vários terabytes de dados não compactados (Brown et al., 2020).
Os LLMs modernos, como o GPT-4, provavelmente utilizam conjuntos de dados que ultrapassam 1–2 petabytes, especialmente ao incorporar fontes multimodais e multilíngues. Isso equivale a aproximadamente cem Longas-metragens em formato RAW 8K.
ADAS:
Os conjuntos de dados do ADAS são medidos em armazenamento de dados brutos devido ao fato de as saídas dos sensores não serem compactadas:
Um único veículo autônomo gera 1 a 10 terabytes de dados por dia (Waymo, 2023).
Os conjuntos de dados de toda a frota, utilizados por empresas como a Tesla e a Waymo, ultrapassam 100 a 500 petabytes por ano. Para contextualizar, a frota da Tesla coleta mais de 1 milhão de milhas de dados de direção por dia (Tesla AI Day, 2021). Em comparação com os conjuntos de dados de treinamento de LLM, isso equivale a aproximadamente 25.000 longas-metragens em formato RAW 8K por ano, ou 32 anos de produção cinematográfica moderna.
Diversidade e estrutura dos dados
A estrutura e a diversidade dos dados também revelam contrastes marcantes:
LLMs:
Dados altamente compactados devido aos processos de tokenização e deduplicação.
Prioriza a diversidade em diversos domínios (por exemplo, artigos científicos, ficção, código) para garantir a generalização.
É realizado um pré-processamento significativo para filtrar textos de baixa qualidade ou tendenciosos (OpenAI, 2020).
ADAS:
Os dados são, por natureza, de alta dimensão e espaciais, incluindo:
Vídeo: Gravações em alta resolução (1080p ou 4K) a 30–60 quadros por segundo.
LiDAR: Milhões de pontos 3D por segundo.
Uma parte significativa dos dados é utilizada para simulação e validação, especialmente em casos extremos e raros.
Desafios computacionais
Embora os conjuntos de dados de LLM sejam menores em termos de armazenamento bruto, sua complexidade de treinamento e suas demandas computacionais se equiparam às do ADAS:
LLMs:
O treinamento envolve bilhões a trilhões de parâmetros, exigindo um processamento de alto rendimento de conjuntos de dados tokenizados.
O treinamento do GPT-3 exigiu aproximadamente 3.640 petaflop-dias de computação (Brown et al., 2020).
Pipelines de dados otimizados (por exemplo, tokenização, agrupamento em lotes) reduzem o tamanho efetivo do conjunto de dados durante o treinamento.
ADAS:
O processamento envolve dados de séries temporais e modelagem espacial, o que muitas vezes exige desempenho em tempo real.
Ambientes de simulação (por exemplo, CARLA, NVIDIA DRIVE) são utilizados para complementar o treinamento, o que aumenta a complexidade computacional.
Hardware especializado, como GPUs ou TPUs dedicadas, e CPUs CISC de soquete único com grande largura de núcleo processam grandes conjuntos de dados brutos para treinamento e inferência.
Longevidade e crescimento dos dados
LLMs:
O tamanho do conjunto de dados aumenta gradualmente com a complexidade do modelo. No entanto, esse crescimento desacelera devido aos retornos decrescentes em escala (Kaplan et al., 2020).
Conjuntos de dados mais antigos continuam sendo relevantes, já que os fundamentos linguísticos não mudam rapidamente.
ADAS:
O crescimento dos conjuntos de dados é exponencial devido a:
Aumento do tamanho das frotas e taxas de adoção mais elevadas.
Avanços na tecnologia de sensores (maior resolução e taxas de amostragem).
Ampliar a cobertura de casos extremos para uma generalização robusta.
Conjuntos de dados mais antigos podem se tornar obsoletos à medida que as tecnologias de veículos e sensores evoluem.
Comparações entre conjuntos de dados
AspectoLLMsADAS/Dirigir de forma autônomaTamanho do conjunto de dadosDe terabytes a petabytes baixosCentenas de petabytesTipo de dadosTexto (tokens)Vídeo, LiDAR, Radar, GPS, GIS, Imagens de satéliteCompressãoAltamente comprimido (tokenização)Compressão mínima (dados brutos)ObjetivoCompreensão linguísticaTomada de decisão espacial em tempo real — salvando vidas e melhorando a segurança no transporteCrescimentoEscalabilidade mais lenta com retornos decrescentesCrescimento exponencial (frota, sensores)
Conclusão
Os conjuntos de dados utilizados para o treinamento de LLMs e sistemas ADAS são adaptados aos desafios específicos de seus respectivos domínios. Enquanto os LLMs dependem de dados altamente compactados e selecionados, principalmente textuais, os sistemas ADAS processam dados brutos e não compactados de sensores, cujas necessidades de armazenamento são ordens de magnitude maiores. No entanto, a complexidade computacional do treinamento de LLMs frequentemente se equipara à dos sistemas ADAS, refletindo o vasto espaço de parâmetros dos modelos de linguagem modernos.À medida que esses campos continuam a evoluir, as inovações no processamento de dados e nas arquiteturas de modelos continuarão sendo fundamentais para enfrentar seus respectivos desafios. Enquanto os sistemas ADAS enfrentam os obstáculos logísticos do dimensionamento de dados brutos, os LLMs precisam encontrar o equilíbrio entre o tamanho do conjunto de dados, a qualidade e os retornos decrescentes.
Liberdade de escolha
Ao considerar os desafios modernos do processamento de grandes modelos de linguagem ou de sistemas ADAS, surge uma questão fundamental: meu data center possui a capacidade — espaço, energia e refrigeração — para suportar as tecnologias de computação acelerada necessárias para o treinamento? Igualmente importante é determinar se o treinamento e o ajuste contínuos em hardware especializado são essenciais, ou se basta utilizar esses recursos temporariamente para alcançar um resultado específico antes de fazer a transição para a inferência.
Isso leva a uma decisão estratégica mais ampla: a infraestrutura de computação acelerada deve ser implantada no local, ou é mais eficiente utilizar a escalabilidade e a capacidade dos ambientes de nuvem pública, conectando conjuntos de dados de forma integrada em infraestruturas híbridas? Na Qumulo, nosso objetivo é capacitar nossos clientes a se destacarem em ambos os cenários, eliminando barreiras tecnológicas para que possam tomar as melhores decisões comerciais, de engenharia e operacionais de acordo com suas necessidades específicas. Para saber mais sobre o desempenho inovador que a Qumulo tem proporcionado no ambiente de nuvem pública por meio da nossa Cloud Data Platform, confira esse vídeo.
Referências
Brown, T., et al. (2020). Os modelos de linguagem aprendem com poucos exemplos. NeurIPS. Link
Kaplan, J., et al. (2020). Leis de escala para modelos de linguagem neurais. OpenAI. Link
Waymo (2023). Visão geral do conjunto de dados sobre direção autônoma. Waymo Research. Site
Tesla AI Day (2021). Coleta de dados da frota da Tesla. Tesla. Link