Este blog explica os compromissos que os arquitetos de nuvem tiveram que fazer ao utilizar sistemas de arquivos tradicionais na construção de infraestruturas de IA. O blog também explica como o Qumulo nativo do Azure resolve esses compromissos, reduzindo o tempo de uso da GPU e diminuindo significativamente os custos sem sacrificar o desempenho.
Quando se trata de executar operações de IA em grande escala, os serviços de armazenamento de arquivos não conseguiram otimizar o equilíbrio entre desempenho e eficiência de custos. Implantar fluxos de trabalho de IA diretamente na infraestrutura de armazenamento de arquivos tem se mostrado impraticável, complicado e economicamente insustentável.
Hoje, as organizações são obrigadas a desenvolver soluções baseadas em IA, transferindo dados de um armazenamento de objetos de baixo custo para caches de arquivos de alto custo (seja em discos locais ou em sistemas de arquivos centrais), onde as tarefas computacionais de IA são executadas em GPUs muito procuradas. Seja na coleta de dados, no pré-treinamento, no treinamento de produção ou na inferência contínua, a movimentação de dados entre camadas de armazenamento não apenas aumenta a complexidade, mas também acarreta taxas adicionais de transação de API.
Um sistema de dois níveis que utiliza caches de arquivos também significa que as GPUs ficam em espera por até 40% do tempo apenas para carregar os dados do armazenamento de objetos para o cache de arquivos. Isso representa muito tempo desperdiçado para GPUs ociosas. E pior ainda: com caches menores, os conjuntos de dados de treinamento ficam limitados ao tamanho desse cache local, exigindo várias fases de carregamento para processar conjuntos de dados maiores, como imagens e vídeos.
O Azure Native Qumulo (ANQ) atua como um acelerador inteligente de dados para o armazenamento de objetos, executando leituras paralelizadas e pré-carregadas, fornecidas diretamente da infraestrutura primitiva do Azure por meio do sistema de arquivos do Qumulo para GPUs que executam modelos de treinamento de IA. O ANQ acelera o desempenho no lado da GPU, eliminando os tempos de carregamento entre a camada de objetos e o sistema de arquivos. Isso muda a forma como o treinamento de IA dependente de arquivos na nuvem deve ser arquitetado, conforme ilustrado na imagem abaixo.
Como exemplo, citamos nosso mais recente Resultados do Spec Storage AI_IMAGE, demonstrando que a arquitetura da ANQ é a solução de armazenamento nativa da nuvem mais rápida e com melhor custo-benefício do setor.
Alcançamos o melhor resultado com um Tempo de Resposta Geral (ORT) de 0,84 ms e um custo total para o cliente de US$ 400, a preço de tabela, durante um período de pico de 5 horas. Isso é revolucionário porque nosso ciclo de pico foi inteiramente baseado no modelo SaaS PAYGO, em que a medição era interrompida quando o desempenho não era mais necessário. A maioria dos outros fornecedores, incluindo uma proposta anterior com 700 tarefas e ORT de 0,85 ms, não comunica os custos de forma transparente porque:
Isso inclui uma implantação em grande escala e não escalável de máquinas virtuais (VMs) superdimensionadas, que você teria que manter em funcionamento, mesmo após a implantação, para preservar seu conjunto de dados.
Elas exigem uma assinatura de software com duração de 1 a 3 anos, que custa centenas de milhares de dólares, com base em uma licença de software, em vez de um modelo de consumo PAYGO.
Essas afirmações *parecem* difíceis de acreditar, então você deve estar se perguntando:
O que há de tão diferente na arquitetura da ANQ que proporciona resultados tão impressionantes?
Como a Qumulo consegue atingir a velocidade de uma Ferrari, com o preço anunciado publicamente de um Toyota Corolla confiável?
Isso significa que finalmente poderei usar o armazenamento de arquivos na nuvem sem precisar gerenciar o escalonamento para o formato de objeto?
E se minhas necessidades de desempenho variarem muito dependendo do dia da semana ou da semana do mês?
Três fatores simples permitem que a Qumulo responda a todas essas perguntas e reafirme com confiança nossa afirmação de sermos o primeiro serviço moderno de armazenamento de arquivos na nuvem.
Escalabilidade elástica verdadeira permite que os clientes se concentrem em outras questões comerciais e tecnológicas, em vez de se preocuparem com a infraestrutura de armazenamento nativa da nuvem. O desempenho do armazenamento está pronto para ser dimensionado quando a pilha de aplicativos de IA assim exigir, gerando economia de custos quando não houver demanda.
Observação: Outros sistemas de arquivos em nuvem apresentam falhas nessa capacidade essencial, pois operam com “volumes” pré-provisionados de capacidade fixa. Na verdade, não é muito diferente do armazenamento local, mas é bem mais caro!
Preços disruptivos: A Qumulo inovou ao adotar uma estratégia de preços disruptiva, aproveitando a economia da nuvem; estamos repassando essa economia ao cliente. O que há de disruptivo nisso? Você paga apenas pelo que usa.
A estrutura de preços é simples e se baseia em dois fatores: uso de armazenamento (TB) e desempenho necessário (taxa de transferência e IOPs); o ANQ dimensiona o desempenho e a capacidade dinamicamente, de modo que não há necessidade de provisionar recursos antecipadamente para atender à demanda.
Desempenho aumenta linearmente à medida que sua carga de trabalho cresce. O sistema de arquivos Qumulo nativo do Azure é construído sobre a camada de objetos, alcançando uma taxa média de acertos no cache em todos os clusters (locais e na nuvem) superior a 95%! A arquitetura atua como um acelerador que executa leituras paralelizadas, pré-buscadas do objeto e servidas diretamente do sistema de arquivos aos seus clientes, que podem ser GPUs executando aplicativos de IA. Esse “acelerador” gerenciado garante escalabilidade e desempenho do lado da GPU sem a necessidade de aguardar tempos de carregamento entre a camada de objetos e o sistema de arquivos.
Leia O cache é alimentado por um cache L1 na memória e um generoso cache L2 NVMe. O cache global de leitura é ampliado sob demanda, de forma elástica. É por isso que obtivemos um tempo de resposta geral inferior a um milissegundo no benchmark Spec AI_IMAGE; o sistema ampliou temporariamente o cache para atender aos requisitos de desempenho!
Por trás do cache de leitura está o modelo de aprendizado de máquina altamente otimizado da Qumulo, que prevê quais blocos têm maior probabilidade de serem lidos em seguida. Treinado com anos de padrões de acesso a partir de mais de 1 trilhão de solicitações, o modelo pré-busca e fornece dados com precisão a partir do cache NVMe ou L1.Escrever As transações utilizam os discos gerenciados do Azure de alto desempenho, que atuam como um cache protegido de gravação posterior para gravações recebidas, enviando-as continuamente para o Azure Blob Storage. Cada transação é registrada em um diário, garantindo que não haja nenhum ponto único de perda de dados na arquitetura do ANQ. Essa abordagem é fundamental durante falhas nos nós de computação e é mais durável do que a arquitetura de alguns de nossos concorrentes, na qual gravações em andamento podem ser perdidas durante eventos de computação.
Inconcebível? Convidamos você a testar por conta própria. Você pode ativar um teste gratuito de 7 dias do Azure Native Qumulo aqui. A configuração padrão permite que você conheça o funcionamento do serviço, mas possui um limitador de taxa de segurança. Se precisar de mais desempenho, basta entrar em contato com hpc-trial-request@qumulo.com.
Quer saber mais? Baixe nosso resumo da solução abaixo.