Orca Studios가 클라우드 네이티브 Qumulo를 통해 예측 가능한 VFX 프로덕션 성능을 제공하는 방법
일관된 고성능 클라우드 스토리지로 AWS에서 VFX 및 가상 프로덕션 워크플로 확장하기
오르카 스튜디오는 스페인에 본사를 둔 독립 시각 효과 및 가상 프로덕션 스튜디오입니다. 이 회사는 영화 및 텔레비전 프로덕션에 시각 효과(VFX) 서비스를 제공하며 마드리드, 바르셀로나, 라스 팔마스 전역에서 운영되고 있습니다. 여러 지역과 시간대에 걸쳐 분산된 크리에이티브 팀이 협업하는 Orca Studios는 프리 프로덕션부터 포스트 프로덕션까지 전 세계 고객을 지원합니다.
많은 최신 스튜디오와 마찬가지로 Orca Studios는 유연한 프로덕션 워크플로를 지원하기 위해 클라우드 인프라에 크게 의존하고 있습니다. 아티스트와 기술 팀은 프로젝트 수요에 따라 가상 워크스테이션과 렌더링 리소스를 정기적으로 확장합니다. 프로덕션 규모가 점점 더 커지고 복잡해지면서 클라우드에서 일관된 스토리지 성능을 유지하는 것이 크리에이티브 팀의 생산성을 유지하는 데 점점 더 중요해졌습니다.
"우리 아티스트들은 마감 기한이 촉박하기 때문에 스토리지 성능이 병목 현상이 되어서는 안 됩니다. 프로덕션에 따라 확장할 수 있는 예측 가능한 성능이 필요했습니다."
- 유키오 사토, CTO, Orca Studios
도전 과제
새로운 솔루션을 도입하기 전, Orca Studios는 Amazon EBS 볼륨으로 지원되는 자체 관리형 ZFS 스토리지 서버를 중심으로 구축된 AWS의 완전한 클라우드 기반 인프라를 운영했습니다. 스토리지 사용량은 평균 약 250TB였지만, 제작 주기에 따라 용량이 약 150TB에서 600TB 사이로 변동했습니다.
이 스튜디오는 일반적으로 진행 중인 프로젝트의 수에 따라 40~110대의 가상 워크스테이션을 운영했습니다. 초기 단계에서는 아키텍처의 성능이 좋았지만 워크로드가 증가함에 따라 시스템을 효율적으로 확장하는 것이 점점 더 어려워졌습니다.
시뮬레이션 및 렌더링과 같은 까다로운 워크로드에서는 스토리지 성능이 일관되지 않을 수 있습니다. ST1 지원 볼륨의 버스트 성능은 단기간 동안은 잘 작동했지만, 지속적인 활동으로 인해 버스트 크레딧이 소진될 수 있었습니다. 이런 일이 발생하면 처리량과 IOPS가 떨어지고 메타데이터 작업이 느려졌습니다. 이러한 변동은 버전 처리 시간에 영향을 미치고 때때로 아티스트의 워크플로우를 중단시키기도 했습니다.
성능을 유지하려면 IT 팀의 운영 관심도도 높아져야 했습니다. ZFS 기반 아키텍처는 강력한 성능을 제공할 수 있지만, 이를 확장하고 최적화하려면 추가적인 모니터링, 튜닝, 엔지니어링 작업이 필요한 경우가 많습니다. Orca Studios의 소규모 인프라 팀의 경우, 프로덕션 워크로드가 점점 더 까다로워지고 있는 상황에서 운영 복잡성이 가중되었습니다.
동시에 일관된 성능을 유지하려면 더 높은 성능의 EBS 볼륨과 더 큰 컴퓨팅 인스턴스로 이동해야 하는 경우가 많았고, 이로 인해 인프라 비용이 증가했습니다. 팀은 운영을 간소화하면서 예측 가능한 성능을 제공할 수 있는 솔루션을 찾기 시작했습니다.
탄력적인 확장이 어렵고, 아티스트의 워크플로우가 중단되고, 비용이 증가하면서 더 나은 솔루션을 찾는 데 촉매제가 되었습니다.
솔루션
Orca Studios는 몇 가지 옵션을 평가했습니다. 여기에는 기존 아키텍처를 계속 확장하는 것과 Weka, EditShare, Pixit Media, MayaNAS, OpenZFS용 Amazon FSx와 같은 상용 및 관리형 스토리지 플랫폼을 살펴보는 것이 포함되었습니다.
이 팀은 차세대 인프라를 위한 세 가지 핵심 요구사항에 집중했습니다. 까다로운 워크로드에 일관된 성능을 제공하고, 프로젝트가 성장함에 따라 쉽게 확장하며, 소규모 인프라 팀을 위해 운영을 간소화할 수 있는 솔루션이 필요했습니다. 구체적으로 그들이 찾고 있던 것은
예측 가능한 성능 지속적인 프로덕션 워크로드 동안 일관된 IOPS 및 처리량 제공
탄력적인 확장성 복잡한 마이그레이션이나 인프라 변경 없이 용량과 성능을 확장할 수 있습니다
운영 간소화 소규모 인프라 팀의 관리 오버헤드를 줄일 수 있습니다
선택한 플랫폼인 Cloud Native Qumulo(CNQ)는 일관된 성능을 제공하면서 AWS의 스토리지 관리를 간소화했습니다. 이 아키텍처는 Amazon S3를 기본 스토리지 계층으로 사용하므로 실제 데이터 사용량에 따라 용량을 확장할 수 있고 스토리지를 과도하게 프로비저닝할 필요가 없습니다.
네이티브 클러스터링을 통해 수요에 따라 성능을 확장할 수 있으며, 기본 제공 모니터링, 관리 도구 및 API 액세스가 운영 및 자동화를 간소화합니다. 인프라는 Terraform을 사용하여 배포되며, 스튜디오의 기존 코드형 인프라 관행과 일치합니다.
배포 여정
배포는 중단을 최소화하도록 설계된 단계적 롤아웃에 따라 진행되었습니다.
개념 증명(POC)은 4월에 시작되어 4월 중순까지 운영되었습니다. 5월 내내 팀은 실제 프로덕션 워크로드에서 성능을 검증하기 위해 광범위한 테스트를 수행했습니다.
POC 후 4주 만에 두 개의 까다로운 프로덕션 프로젝트가 새로운 플랫폼에서 실행되었습니다. 이 시스템은 동시 워크로드가 폭주하는 상황에서도 안정적인 성능을 유지했습니다.
Orca Studios는 모든 데이터를 한 번에 마이그레이션하는 대신 프로젝트를 점진적으로 이전했습니다. 개별 데이터 세트와 서버를 단계별로 마이그레이션하여 프로덕션 운영을 중단 없이 유지하면서 성능을 검증할 수 있었습니다.
결과 아키텍처에는 기본 스토리지 계층으로 Amazon S3 인텔리전트 티어링을 사용하는 AWS i4i.4xlarge 인스턴스에서 실행되는 3노드 클러스터가 포함됩니다. 클라이언트 액세스는 NFS와 SMB를 통해 제공되며, 인증은 Active Directory와 통합됩니다.
배포는 간단했으며, 테스트 중에 SMB 권한 조정과 같은 약간의 구성 조정만 필요했습니다. 롤아웃에 영향을 미치는 중대한 장애물은 없었습니다.
비즈니스 영향
프로덕션 환경에 도입된 이 플랫폼은 까다로운 워크로드에서도 일관된 성능을 제공했습니다.
지속적인 활동 중에도 지연 시간, 처리량, IOPS가 안정적으로 유지되었습니다. 이전에 경험했던 성능 저하 없이 두 개의 집중적인 프로덕션 프로젝트를 동시에 실행할 수 있었습니다.
아티스트들은 그 차이를 금방 알아차렸습니다. 스토리지 성능으로 인한 중단이 줄어들면서 팀들은 창의적인 집중력을 유지하고 더 효율적으로 작업할 수 있었습니다.
"아티스트들이 스토리지 성능에 대해 불평하지 않는다면 스토리지가 제 역할을 하고 있다는 뜻입니다. 이 플랫폼은 워크로드가 많은 프로덕션 작업 중에도 일관된 성능을 제공합니다."
- 오르카 스튜디오
운영 오버헤드도 감소했습니다. 인프라 팀은 이제 성능 문제를 해결하거나 스토리지 인프라를 조정하는 데 훨씬 적은 시간을 할애할 수 있습니다. 대신 프로덕션 팀을 직접 지원하는 파이프라인 개선 및 자동화에 집중할 수 있습니다.
스토리지 경제성도 개선되었습니다. 이제 실제 데이터 사용량에 따라 용량이 확장되므로 사용하지 않는 프로비저닝 용량에 대한 비용을 지불할 필요가 없으며 스토리지 환경이 확장 또는 축소될 때 마이그레이션할 필요가 없습니다.
정확한 경제성은 프로젝트마다 다르지만, Orca는 일반적으로 CNQ가 이전 ZFS 기반 접근 방식에 비해 TB당 비용이 약 20% 개선되어 성능이 향상되었으며, 일부 프로젝트에서는 최대 약 33%까지 개선된 것으로 나타났습니다.
하지만 실질적인 가치는 스토리지 비용을 넘어서는 것이었습니다. 예측 가능한 고성능과 현저히 줄어든 운영 오버헤드를 결합함으로써 Orca Studios는 측정 가능한 이점을 빠르게 실현하고 약 2~4개월 만에 재정적 손익분기점에 도달했습니다.