Qumulo LogoQumulo Logo

Wie Orca Studios mit dem cloud-nativen Qumulo eine vorhersehbare Leistung für die VFX-Produktion gewährleistet

Skalierung von VFX- und Virtual-Production-Workflows in AWS mit konsistentem, leistungsstarkem Cloud-Speicher

Orca Studios ist ein unabhängiges Studio für visuelle Effekte und virtuelle Produktion mit Sitz in Spanien. Das Unternehmen bietet VFX-Dienstleistungen (Visual Effects) für Film- und Fernsehproduktionen an und ist in Madrid, Barcelona und Las Palmas tätig. Mit einem dezentralen Kreativteam, das über Regionen und Zeitzonen hinweg zusammenarbeitet, unterstützt Orca Studios Kunden weltweit bei Projekten von der Vorproduktion bis zur Postproduktion.

Wie viele moderne Studios setzt auch Orca Studios in hohem Maße auf eine Cloud-Infrastruktur, um flexible Produktionsabläufe zu ermöglichen. Künstler und technische Teams passen die Kapazität der virtuellen Arbeitsplätze und Rendering-Ressourcen regelmäßig an den jeweiligen Projektbedarf an. Da die Produktionen immer umfangreicher und komplexer wurden, gewann die Aufrechterhaltung einer konstanten Speicherleistung in der Cloud zunehmend an Bedeutung, um die Produktivität der Kreativteams zu gewährleisten.

„Unsere Künstler arbeiten unter hohem Zeitdruck, daher darf die Speicherleistung nicht zum Engpass werden. Wir benötigten eine vorhersehbare Leistung, die sich an den Produktionsumfang anpassen lässt.“
— Yukio Satoh, CTO, Orca Studios

Die Herausforderung

Vor der Einführung einer neuen Lösung betrieb Orca Studios eine vollständig cloudbasierte Infrastruktur in AWS, die auf einem selbstverwalteten ZFS-Speicherserver aufbaute, der durch Amazon-EBS-Volumes unterstützt wurde. Die Speichernutzung lag im Durchschnitt bei etwa 250 TB, doch aufgrund der Produktionszyklen schwankte die Kapazität zwischen etwa 150 TB und 600 TB.

Das Studio betrieb in der Regel zwischen 40 und 110 virtuelle Arbeitsplätze, je nach Anzahl der laufenden Projekte. Während die Architektur in früheren Phasen gut funktionierte, wurde es mit steigender Arbeitslast immer schwieriger, das System effizient zu skalieren.

Bei anspruchsvollen Arbeitslasten wie Simulationen und Rendering konnte es zu Schwankungen in der Speicherleistung kommen. Die Burst-Leistung von ST1-basierten Volumes funktionierte über kurze Zeiträume gut, doch bei anhaltender Aktivität konnten die Burst-Guthaben aufgebraucht werden. In solchen Fällen sanken Durchsatz und IOPS, und Metadatenoperationen wurden verlangsamt. Diese Schwankungen wirkten sich auf die Bearbeitungszeiten für Versionen aus und unterbrachen gelegentlich die Arbeitsabläufe der Künstler.

Um die Leistung aufrechtzuerhalten, musste das IT-Team zudem mehr betrieblichen Aufwand aufbringen. ZFS-basierte Architekturen können zwar eine hohe Leistung bieten, doch ihre Skalierung und Optimierung erfordert oft zusätzliche Überwachungs-, Feinabstimmungs- und Entwicklungsarbeiten. Für das kleine Infrastrukturteam von Orca Studios bedeutete dies eine zusätzliche betriebliche Komplexität zu einer Zeit, in der die Produktions-Workloads immer anspruchsvoller wurden.

Gleichzeitig war für die Aufrechterhaltung einer konstanten Leistung häufig der Umstieg auf leistungsstärkere EBS-Volumes und größere Recheninstanzen erforderlich, was zu einem Anstieg der Infrastrukturkosten führte. Das Team machte sich auf die Suche nach einer Lösung, die eine vorhersehbare Leistung gewährleisten und gleichzeitig den Betrieb vereinfachen konnte.

Schwierigkeiten bei der elastischen Skalierung, Unterbrechungen im Arbeitsablauf der Künstler und steigende Kosten waren ausschlaggebend für die Suche nach einer besseren Lösung.

Die Lösung

Orca Studios prüfte verschiedene Optionen. Dazu gehörten der weitere Ausbau der bestehenden Infrastruktur sowie die Prüfung kommerzieller und verwalteter Speicherplattformen wie Weka, EditShare, Pixit Media, MayaNAS und Amazon FSx für OpenZFS.

Das Team konzentrierte sich auf drei zentrale Anforderungen an seine Infrastruktur der nächsten Generation. Es benötigte eine Lösung, die bei anspruchsvollen Workloads eine konstante Leistung bietet, sich bei wachsenden Projekten problemlos skalieren lässt und den Betrieb für ein kleines Infrastrukturteam vereinfacht. Konkret suchte das Team nach:

  • Vorhersehbare Leistung mit konstanten IOPS-Werten und Durchsatzraten bei anhaltenden Produktionsauslastungen

  • Elastische Skalierbarkeit um Kapazität und Leistung zu steigern, ohne komplexe Migrationen oder Änderungen an der Infrastruktur vornehmen zu müssen

  • Einfache Bedienung Das würde den Verwaltungsaufwand für ein kleines Infrastrukturteam verringern.

Die ausgewählte Plattform „Cloud Native Qumulo“ (CNQ) lieferte eine konstante Leistung und vereinfachte gleichzeitig die Speicherverwaltung in AWS. Ihre Architektur nutzt Amazon S3 als zugrunde liegende Speicherschicht, wodurch die Kapazität an die tatsächliche Datennutzung angepasst werden kann und eine Überdimensionierung des Speichers entfällt.

Durch natives Clustering lässt sich die Leistung an den Bedarf anpassen, während integrierte Überwachungs- und Verwaltungstools sowie der API-Zugriff den Betrieb und die Automatisierung vereinfachen. Die Infrastruktur wird mithilfe von Terraform bereitgestellt, was den bestehenden „Infrastructure-as-Code“-Praktiken des Studios entspricht.

Der Weg zur Einführung

Die Einführung erfolgte schrittweise, um Störungen so gering wie möglich zu halten.

Ein Proof of Concept (POC) wurde im April gestartet und war Mitte April betriebsbereit. Im Laufe des Monats Mai führte das Team umfangreiche Tests durch, um die Leistung unter realen Produktionsauslastungen zu überprüfen.

Innerhalb von vier Wochen nach dem POC liefen bereits zwei anspruchsvolle Produktionsprojekte auf der neuen Plattform. Das System zeigte auch bei hoher gleichzeitiger Auslastung eine stabile Leistung.

Anstatt alle Daten auf einmal zu migrieren, führte Orca Studios die Migration der Projekte schrittweise durch. Einzelne Datensätze und Server wurden Schritt für Schritt migriert, sodass das Team die Leistung überprüfen konnte, während der Produktionsbetrieb ohne Unterbrechungen weiterlief.

Die daraus resultierende Architektur umfasst einen Cluster mit drei Knoten, der auf AWS-Instanzen vom Typ i4i.4xlarge läuft und bei dem Amazon S3 Intelligent Tiering als zugrunde liegende Speicherschicht dient. Der Client-Zugriff erfolgt sowohl über NFS als auch über SMB, und die Authentifizierung ist in Active Directory integriert.

Die Bereitstellung verlief reibungslos und erforderte während der Testphase lediglich geringfügige Konfigurationsanpassungen, wie beispielsweise die Anpassung der SMB-Berechtigungen. Es gab keine nennenswerten Hindernisse, die die Einführung beeinträchtigt hätten.

Auswirkungen auf das Geschäft

Nach der Inbetriebnahme lieferte die Plattform bei anspruchsvollen Arbeitslasten eine gleichbleibende Leistung.

Latenz, Durchsatz und IOPS blieben auch bei anhaltender Aktivität stabil. Zwei ressourcenintensive Produktionsprojekte konnten gleichzeitig ausgeführt werden, ohne dass es zu den zuvor beobachteten Leistungseinbußen kam.

Die Künstler bemerkten den Unterschied schnell. Da es weniger Unterbrechungen aufgrund der Speicherleistung gab, konnten die Teams ihre kreative Konzentration aufrechterhalten und effizienter arbeiten.

„Wenn sich unsere Künstler nicht über die Speicherleistung beschweren, wissen wir, dass sie ihren Zweck erfüllt. Die Plattform liefert auch bei hoher Produktionsauslastung eine konstante Leistung.“
— Orca Studios

Auch der operative Aufwand ist zurückgegangen. Das Infrastrukturteam verbringt nun deutlich weniger Zeit mit der Behebung von Leistungsproblemen oder der Optimierung der Speicherinfrastruktur. Stattdessen kann es sich auf die Verbesserung der Pipelines und die Automatisierung konzentrieren, was den Produktionsteams direkt zugutekommt.

Auch die Wirtschaftlichkeit der Speicherkapazitäten hat sich verbessert. Die Kapazität passt sich nun an den tatsächlichen Datenverbrauch an, sodass keine Kosten mehr für ungenutzte, bereits bereitgestellte Kapazitäten anfallen und keine Migrationen mehr erforderlich sind, wenn Speicherumgebungen wachsen oder schrumpfen.

Zwar variieren die genauen wirtschaftlichen Rahmenbedingungen je nach Projekt, doch hat Orca im Allgemeinen festgestellt, dass CNQ eine bessere Leistung erzielt, mit einer indikativen Verbesserung der Kosten pro TB um rund 20 % gegenüber dem bisherigen ZFS-basierten Ansatz, wobei bei einigen Projekten eine Verbesserung von bis zu etwa 33 % zu verzeichnen war.

Der tatsächliche Nutzen ging jedoch über die Speicherkosten hinaus. Durch die Kombination von vorhersehbarer hoher Leistung mit deutlich reduzierten Betriebskosten konnte Orca Studios schnell messbare Vorteile erzielen und innerhalb von etwa zwei bis vier Monaten die Gewinnschwelle erreichen.

Branche

Medienproduktion

Anwendungsfall

Hochleistungsfähiger Cloud-Speicher für VFX-Rendering, Simulationen und virtuelle Workstations

Bereitstellung

Cloud Native Qumulo (CNQ) in AWS mit S3 Intelligent Tiering

Standort

Spanien mit weltweit verteilten Kreativteams

Unternehmensübersicht

Anforderungen

Ergebnisse

  • Stabile Latenz, Durchsatz und IOPS bei anspruchsvollen Workloads

  • Möglichkeit, mehrere ressourcenintensive Produktionen gleichzeitig auszuführen

  • Verbesserte Produktivität der Künstler und ein einheitlicherer Arbeitsablauf

  • Geringerer Aufwand für die Infrastrukturverwaltung

  • Die finanzielle Gewinnschwelle wird innerhalb von zwei bis vier Monaten erreicht

Partner