Qumulo LogoQumulo Logo

Comment Orca Studios fournit des performances prévisibles pour la production VFX avec Qumulo, un logiciel natif dans le nuage

Évolution des flux de production VFX et virtuels dans AWS grâce à un stockage en nuage cohérent et performant

Orca Studios est un studio indépendant d'effets visuels et de production virtuelle basé en Espagne. La société fournit des services VFX (effets visuels) pour les productions cinématographiques et télévisuelles et opère à Madrid, Barcelone et Las Palmas. Avec une équipe créative répartie sur plusieurs régions et fuseaux horaires, Orca Studios soutient des clients du monde entier dans leurs projets, de la préproduction à la postproduction.

Comme de nombreux studios modernes, Orca Studios s'appuie fortement sur l'infrastructure en nuage pour prendre en charge des flux de production flexibles. Les artistes et les équipes techniques font régulièrement évoluer les postes de travail virtuels et les ressources de rendu en fonction de la demande du projet. Au fur et à mesure que les productions devenaient plus importantes et plus complexes, le maintien d'une performance de stockage cohérente dans le cloud est devenu de plus en plus important pour que les équipes créatives restent productives.

"Nos artistes travaillent dans des délais très courts, de sorte que les performances du stockage ne doivent pas devenir un goulot d'étranglement. Nous avions besoin de performances prévisibles qui s'adaptent à la production"
- Yukio Satoh, directeur technique, Orca Studios

Le défi

Avant d'adopter une nouvelle solution, Orca Studios disposait d'une infrastructure entièrement basée sur le cloud dans AWS, construite autour d'un serveur de stockage ZFS autogéré soutenu par des volumes Amazon EBS. L'utilisation du stockage était en moyenne de 250 To, mais les cycles de production faisaient fluctuer la capacité entre 150 et 600 To environ.

Le studio utilisait généralement entre 40 et 110 postes de travail virtuels, en fonction du nombre de projets actifs. Si l'architecture a bien fonctionné dans les premières phases, il est devenu plus difficile de faire évoluer le système de manière efficace à mesure que la charge de travail augmentait.

Lors de charges de travail exigeantes telles que les simulations et le rendu, les performances de stockage pouvaient devenir incohérentes. Les performances en rafale des volumes soutenus par ST1 fonctionnent bien pendant de courtes périodes, mais une activité soutenue peut épuiser les crédits de rafale. Dans ce cas, le débit et les IOPS chutaient et les opérations sur les métadonnées ralentissaient. Ces fluctuations affectaient les délais d'exécution des versions et interrompaient parfois les flux de travail des artistes.

Le maintien des performances exigeait également une attention opérationnelle accrue de la part de l'équipe informatique. Les architectures basées sur ZFS peuvent offrir de bonnes performances, mais leur mise à l'échelle et leur optimisation nécessitent souvent un travail supplémentaire de surveillance, de réglage et d'ingénierie. Pour la petite équipe d'infrastructure d'Orca Studios, cela a ajouté à la complexité opérationnelle à un moment où les charges de travail de production devenaient plus exigeantes.

En même temps, pour maintenir des performances constantes, il fallait souvent passer à des volumes EBS plus performants et à des instances de calcul plus grandes, ce qui augmentait les coûts d'infrastructure. L'équipe s'est mise à la recherche d'une solution capable de fournir des performances prévisibles tout en simplifiant les opérations.

La difficulté de la mise à l'échelle élastique, les interruptions des flux de travail des artistes et l'augmentation des coûts ont été les catalyseurs de la recherche d'une meilleure solution. 

La solution

Orca Studios a évalué plusieurs options. Celles-ci comprenaient la poursuite de l'extension de leur architecture existante et l'exploration de plateformes de stockage commerciales et gérées telles que Weka, EditShare, Pixit Media, MayaNAS et Amazon FSx pour OpenZFS.

L'équipe s'est concentrée sur trois exigences clés pour son infrastructure de nouvelle génération. Elle avait besoin d'une solution capable de fournir des performances constantes pour les charges de travail exigeantes, de s'adapter facilement à la croissance des projets et de simplifier les opérations pour une petite équipe d'infrastructure. Plus précisément, ils recherchaient

  • Des performances prévisibles avec des IOPS et des débits constants lors de charges de travail de production soutenues

  • Évolutivité élastique d'augmenter la capacité et la performance sans migrations complexes ou changements d'infrastructure

  • Simplicité opérationnelle qui réduirait les frais généraux de gestion pour une petite équipe d'infrastructure

Cloud Native Qumulo (CNQ), la plateforme choisie, a permis d'obtenir des performances constantes tout en simplifiant la gestion du stockage dans AWS. Son architecture utilise Amazon S3 comme couche de stockage sous-jacente, ce qui permet d'adapter la capacité à l'utilisation réelle des données et supprime la nécessité de surprovisionner le stockage.

Le clustering natif permet de faire évoluer les performances en fonction de la demande, tandis que la surveillance intégrée, les outils de gestion et l'accès aux API simplifient les opérations et l'automatisation. L'infrastructure est déployée à l'aide de Terraform, en accord avec les pratiques existantes du studio en matière d'infrastructure en tant que code.

Le parcours du déploiement

Le déploiement s'est fait par étapes afin de minimiser les perturbations.

Une démonstration de faisabilité a débuté en avril et était opérationnelle à la mi-avril. Tout au long du mois de mai, l'équipe a procédé à des tests approfondis afin de valider les performances dans le cadre de charges de travail réelles.

Dans les quatre semaines qui ont suivi le POC, deux projets de production exigeants ont été exécutés sur la nouvelle plate-forme. Le système a maintenu des performances stables même en cas de charges de travail simultanées importantes.

Plutôt que de migrer toutes les données en même temps, Orca Studios a déplacé les projets progressivement. Des ensembles de données et des serveurs individuels ont été migrés étape par étape, ce qui a permis à l'équipe de valider les performances tout en maintenant des opérations de production ininterrompues.

L'architecture résultante comprend un cluster de trois nœuds fonctionnant sur des instances AWS i4i.4xlarge avec Amazon S3 Intelligent Tiering comme couche de stockage sous-jacente. L'accès client est assuré par NFS et SMB, et l'authentification est intégrée à Active Directory.

Le déploiement a été simple et n'a nécessité que des ajustements mineurs de la configuration pendant les tests, tels que l'alignement des autorisations SMB. Aucun obstacle important n'a entravé le déploiement.

Impact sur les entreprises

Une fois en production, la plateforme a fourni des performances constantes pour les charges de travail les plus exigeantes.

La latence, le débit et les IOPS sont restés stables même en cas d'activité soutenue. Deux projets de production intensifs ont pu être exécutés simultanément sans la dégradation des performances que l'on connaissait auparavant.

Les artistes ont rapidement remarqué la différence. Avec moins d'interruptions dues aux performances du stockage, les équipes ont pu maintenir leur concentration créative et travailler plus efficacement.

"Si nos artistes ne se plaignent pas des performances du stockage, nous savons qu'il fait son travail. La plateforme offre des performances constantes, même en cas de charge de travail élevée."
- Orca Studios

Les frais généraux d'exploitation ont également diminué. L'équipe d'infrastructure passe désormais beaucoup moins de temps à résoudre les problèmes de performance ou à régler l'infrastructure de stockage. Au lieu de cela, elle peut se concentrer sur l'amélioration du pipeline et l'automatisation qui soutiennent directement les équipes de production.

L'économie du stockage s'est également améliorée. La capacité évolue désormais en fonction de l'utilisation réelle des données, ce qui élimine la nécessité de payer pour une capacité provisionnée inutilisée et de procéder à des migrations lorsque les environnements de stockage s'agrandissent ou se réduisent.

Bien que les données économiques exactes varient d'un projet à l'autre, Orca a généralement constaté que le CNQ offrait de meilleures performances avec une amélioration indicative du coût par To d'environ 20 % par rapport à l'approche précédente basée sur le ZFS, certains projets affichant une amélioration d'environ 33 %.

Cependant, la valeur réelle allait au-delà des coûts de stockage. En combinant des performances élevées et prévisibles avec des frais généraux opérationnels considérablement réduits, Orca Studios a rapidement obtenu des avantages mesurables et a atteint son seuil de rentabilité financière en l'espace de deux à quatre mois environ.

Secteur

Production médiatique

Cas d'utilisation

Stockage en nuage haute performance pour le rendu VFX, les simulations et les stations de travail virtuelles

Deploiement

Cloud Native Qumulo (CNQ) dans AWS avec S3 Intelligent Tiering

Emplacement

Espagne avec des équipes créatives réparties dans le monde entier

Presentation de l'entreprise

Exigences

Resultats

  • Stabilité de la latence, du débit et de l'IOPS pour les charges de travail exigeantes

  • Capacité à gérer simultanément plusieurs productions intensives

  • Amélioration de la productivité des artistes et de la cohérence du flux de travail

  • Réduction de l'effort de gestion de l'infrastructure

  • Le seuil de rentabilité est atteint en deux à quatre mois

Partenaire

Comment Orca Studios offre un rendement prévisible