Orca StudiosがクラウドネイティブのQumuloでVFXプロダクションに予測可能なパフォーマンスを提供する方法
一貫性のある高性能なクラウドストレージを使用したAWSでのVFXおよびバーチャルプロダクションワークフローのスケーリング
オルカ・スタジオは、スペインを拠点とする独立系の視覚効果およびバーチャル・プロダクション・スタジオである。マドリード、バルセロナ、ラス・パルマスに拠点を置き、映画やテレビ作品にVFX(視覚効果)サービスを提供している。地域や時差を超えて協力する分散したクリエイティブ・チームにより、オルカ・スタジオはプリプロダクションからポストプロダクションまで、世界中のクライアントのプロジェクトをサポートしています。
多くの最新スタジオと同様、オルカスタジオも柔軟な制作ワークフローをサポートするため、クラウドインフラに大きく依存しています。アーティストや技術チームは、プロジェクトの需要に応じて仮想ワークステーションやレンダリングリソースを定期的に拡張しています。制作の規模が大きく複雑化するにつれ、クラウドで一貫したストレージ・パフォーマンスを維持することが、クリエイティブ・チームの生産性を維持する上でますます重要になってきました。
「私たちのアーティストは厳しい納期の中で仕事をしているので、ストレージのパフォーマンスがボトルネックになることはありません。そのため、ストレージのパフォーマンスがボトルネックになることは許されません。
- オルカ・スタジオ CTO 佐藤幸雄
挑戦
新しいソリューションを採用する前、Orca StudiosはAmazon EBSボリュームに支えられた自己管理型ZFSストレージサーバーを中心に構築されたAWSの完全クラウドベースのインフラを運用していた。ストレージの使用量は平均250TB程度であったが、生産サイクルによって容量は約150TBから600TBの間で変動していた。
同スタジオでは通常、アクティブなプロジェクトの数に応じて、40台から110台の仮想ワークステーションを運用していた。このアーキテクチャは初期の段階ではうまく機能したが、作業量が増えるにつれて、システムを効率的に拡張することが難しくなった。
シミュレーションやレンダリングなどの負荷の高い作業では、ストレージのパフォーマンスが安定しないことがあった。ST1バッキング・ボリュームからのバースト・パフォーマンスは短時間であればうまく機能しますが、持続的なアクティビティによってバースト・クレジットが枯渇することがありました。これが発生すると、スループットとIOPSが低下し、メタデータ操作が遅くなりました。このような変動はバージョンのターンアラウンドタイムに影響し、時にはアーティストのワークフローを中断させることもありました。
また、パフォーマンスを維持するためには、ITチームによる運用上の注意も必要でした。ZFSベースのアーキテクチャは強力なパフォーマンスを提供できますが、その拡張と最適化には、監視、チューニング、エンジニアリングの追加作業が必要になることがよくあります。Orca Studiosの小規模なインフラストラクチャ・チームにとって、本番ワークロードの要求が厳しくなっているときに、このような複雑な運用が必要になりました。
同時に、一貫したパフォーマンスを維持するには、より高性能なEBSボリュームやより大規模なコンピュート・インスタンスへの移行が必要になることが多く、インフラ・コストが増大しました。チームは、運用を簡素化しながら予測可能なパフォーマンスを提供できるソリューションを探し始めました。
弾力的なスケーリングが難しいこと、アーティストのワークフローに支障をきたすこと、コストが増大することなどが、より良い解決策を見つけるきっかけとなった。
ソリューション
Orca Studiosは、いくつかのオプションを評価しました。その中には、既存のアーキテクチャを拡張し続けることや、Weka、EditShare、Pixit Media、MayaNAS、Amazon FSx for OpenZFSなどの商用およびマネージド・ストレージ・プラットフォームを検討することも含まれていた。
チームは、次世代インフラストラクチャの3つの主要要件に焦点を絞りました。要求の高いワークロードに対して一貫したパフォーマンスを提供し、プロジェクトの規模が拡大しても容易に拡張でき、小規模なインフラストラクチャ・チームでも運用を簡素化できるソリューションが必要だったのです。具体的には、以下のものを求めていました:
予測可能なパフォーマンス 持続的な本番ワークロードにおいて安定したIOPSとスループットを実現
柔軟なスケーラビリティ 複雑な移行やインフラ変更を行うことなく、容量とパフォーマンスを拡張できます。
シンプルな操作性 小規模なインフラチームの管理オーバーヘッドを削減できる
採用されたプラットフォームであるCloud Native Qumulo(CNQ)は、AWSのストレージ管理を簡素化しながら、一貫したパフォーマンスを提供する。そのアーキテクチャは、基礎となるストレージレイヤーとしてAmazon S3を使用するため、実際のデータ使用量に応じて容量を拡張でき、ストレージを過剰にプロビジョニングする必要がなくなります。
ネイティブのクラスタリングにより、需要に応じてパフォーマンスを拡張することができ、組み込みのモニタリング、管理ツール、APIアクセスにより、運用と自動化が簡素化される。インフラストラクチャはTerraformを使用してデプロイされ、スタジオの既存のインフラストラクチャ-アズ-コードのプラクティスと連携している。
配備の旅
導入は、混乱が最小限になるように設計された段階的なロールアウトに従った。
概念実証(POC)は4月に開始され、4月中旬には運用が開始された。5月中、チームは実際の本番作業負荷でのパフォーマンスを検証するため、大規模なテストを実施した。
POCから4週間以内に、要求の厳しい2つの本番プロジェクトが新しいプラットフォーム上で稼働しました。このシステムは、負荷の高い同時作業でも安定したパフォーマンスを維持しました。
すべてのデータを一度に移行するのではなく、オルカスタジオはプロジェクトを徐々に移行していきました。個々のデータセットとサーバーを段階的に移行することで、チームは本番運用を中断することなく、パフォーマンスを検証することができました。
その結果、3ノードのクラスタがAWS i4i.4xlargeインスタンス上で稼働し、ストレージレイヤーとしてAmazon S3 Intelligent Tieringが採用された。クライアントアクセスはNFSとSMBの両方で提供され、認証はActive Directoryと統合されている。
導入は簡単で、テスト中に必要だったのは、SMBパーミッションの調整など、わずかな設定調整だけだった。展開に大きな障害はありませんでした。
ビジネスインパクト
本番稼動後、このプラットフォームは要求の厳しいワークロード全体で一貫したパフォーマンスを提供しました。
レイテンシー、スループット、IOPSは、持続的なアクティビティ中でも安定していました。2つの集中的なプロダクション・プロジェクトを同時に実行しても、以前経験したようなパフォーマンスの低下は見られませんでした。
アーティストはすぐにその違いに気づきました。ストレージのパフォーマンスによる中断が減ったことで、チームはクリエイティブな集中力を維持し、より効率的に作業できるようになりました。
「私たちのアーティストがストレージのパフォーマンスについて文句を言わないということは、ストレージがその役割を果たしているということです。このプラットフォームは、制作の負荷が高いときでも安定したパフォーマンスを提供します"
- オルカ・スタジオ
運用のオーバーヘッドも減少した。インフラストラクチャー・チームは、パフォーマンス問題のトラブルシューティングやストレージ・インフラストラクチャーのチューニングに費やす時間が大幅に減りました。その代わりに、本番チームを直接サポートするパイプラインの改善と自動化に集中できるようになりました。
ストレージの経済性も向上した。容量は実際のデータ使用量に応じて拡張されるため、未使用のプロビジョニング容量に対する支払いが不要になり、ストレージ環境の拡大や縮小に伴う移行の必要性もなくなった。
正確な経済性はプロジェクトによって異なるが、Orcaでは一般的に、CNQが以前のZFSベースのアプローチに比べてTBあたりのコストを約20%改善し、最大で約33%改善したプロジェクトもあるとしている。
しかし、本当の価値はストレージ・コストだけにとどまりませんでした。予測可能なハイパフォーマンスと大幅に削減された運用オーバーヘッドを組み合わせることで、オルカ・スタジオはすぐに測定可能な利益を引き出し、およそ2~4ヶ月で損益分岐点に達しました。