Cómo Orca Studios ofrece un rendimiento predecible para la producción de efectos visuales con Qumulo nativo de la nube
Escalado de flujos de trabajo de producción virtual y de efectos visuales en AWS con almacenamiento en la nube coherente y de alto rendimiento
Orca Studios es un estudio independiente de efectos visuales y producción virtual con sede en España. La empresa ofrece servicios de VFX (efectos visuales) para producciones de cine y televisión y opera en Madrid, Barcelona y Las Palmas. Con un equipo creativo distribuido que colabora a través de regiones y zonas horarias, Orca Studios apoya a clientes de todo el mundo con proyectos desde la preproducción hasta la postproducción.
Como muchos estudios modernos, Orca Studios depende en gran medida de la infraestructura en la nube para soportar flujos de trabajo de producción flexibles. Los artistas y los equipos técnicos amplían regularmente las estaciones de trabajo virtuales y los recursos de renderización en función de la demanda del proyecto. A medida que las producciones se hacían más grandes y complejas, mantener un rendimiento de almacenamiento constante en la nube se volvía cada vez más importante para mantener la productividad de los equipos creativos.
"Nuestros artistas trabajan con plazos muy ajustados, por lo que el rendimiento del almacenamiento no puede convertirse en un cuello de botella. Necesitábamos un rendimiento predecible que se escalara con la producción"
- Yukio Satoh, Director Técnico, Orca Studios
El desafío
Antes de adoptar una nueva solución, Orca Studios ejecutaba una infraestructura totalmente basada en la nube en AWS construida en torno a un servidor de almacenamiento ZFS autogestionado respaldado por volúmenes de Amazon EBS. El uso del almacenamiento rondaba los 250 TB de media, pero los ciclos de producción hacían que la capacidad fluctuara entre 150 TB y 600 TB aproximadamente.
El estudio operaba normalmente entre 40 y 110 estaciones de trabajo virtuales, dependiendo del número de proyectos activos. Aunque la arquitectura funcionó bien en las primeras fases, el escalado eficiente del sistema se hizo más difícil a medida que aumentaba la carga de trabajo.
Durante las cargas de trabajo exigentes, como las simulaciones y el renderizado, el rendimiento del almacenamiento podía volverse incoherente. El rendimiento en ráfaga de los volúmenes respaldados por ST1 funcionaba bien durante breves periodos, pero la actividad sostenida podía agotar los créditos de ráfaga. Cuando esto ocurría, el rendimiento y las IOPS caían, y las operaciones de metadatos se ralentizaban. Estas fluctuaciones afectaban a los tiempos de entrega de las versiones y, en ocasiones, interrumpían el flujo de trabajo de los artistas.
Mantener el rendimiento también requería una mayor atención operativa por parte del equipo de TI. Las arquitecturas basadas en ZFS pueden ofrecer un gran rendimiento, pero escalarlas y optimizarlas a menudo requiere un trabajo adicional de supervisión, ajuste e ingeniería. Para el pequeño equipo de infraestructura de Orca Studios, esto añadía complejidad operativa en un momento en el que las cargas de trabajo de producción eran cada vez más exigentes.
Al mismo tiempo, mantener un rendimiento constante a menudo requería pasar a volúmenes de EBS de mayor rendimiento e instancias informáticas más grandes, lo que aumentaba los costes de infraestructura. El equipo comenzó a buscar una solución que pudiera ofrecer un rendimiento predecible a la vez que simplificaba las operaciones.
El difícil escalado elástico, las interrupciones en los flujos de trabajo de los artistas y el aumento de los costes fueron los catalizadores para encontrar una solución mejor.
La solución
Orca Studios evaluó varias opciones. Entre ellas, seguir ampliando su arquitectura actual y explorar plataformas de almacenamiento comerciales y gestionadas como Weka, EditShare, Pixit Media, MayaNAS y Amazon FSx para OpenZFS.
El equipo se centró en tres requisitos clave para su infraestructura de nueva generación. Necesitaban una solución que pudiera ofrecer un rendimiento constante para cargas de trabajo exigentes, escalar fácilmente a medida que crecieran los proyectos y simplificar las operaciones para un equipo de infraestructura pequeño. En concreto, buscaban
Rendimiento previsible con IOPS y rendimiento constantes durante cargas de trabajo de producción sostenidas
Escalabilidad elástica aumentar la capacidad y el rendimiento sin migraciones complejas ni cambios en la infraestructura
Simplicidad operativa que reduciría la sobrecarga de gestión de un pequeño equipo de infraestructura
Cloud Native Qumulo (CNQ), la plataforma elegida, ofrecía un rendimiento constante a la vez que simplificaba la gestión del almacenamiento en AWS. Su arquitectura utiliza Amazon S3 como capa de almacenamiento subyacente, lo que permite escalar la capacidad en función del uso real de los datos y elimina la necesidad de sobreaprovisionar almacenamiento.
La agrupación en clústeres nativa permite escalar el rendimiento en función de la demanda, mientras que la supervisión integrada, las herramientas de gestión y el acceso a la API simplifican las operaciones y la automatización. La infraestructura se despliega mediante Terraform, en consonancia con las prácticas de infraestructura como código del estudio.
El viaje de la implantación
El despliegue se realizó por fases para minimizar las interrupciones.
En abril se puso en marcha una prueba de concepto (POC) que estuvo operativa a mediados de abril. A lo largo de mayo, el equipo realizó pruebas exhaustivas para validar el rendimiento con cargas de trabajo de producción reales.
A las 4 semanas del POC, dos exigentes proyectos de producción funcionaban en la nueva plataforma. El sistema mantuvo un rendimiento estable incluso con grandes cargas de trabajo simultáneas.
En lugar de migrar todos los datos a la vez, Orca Studios trasladó los proyectos gradualmente. Los conjuntos de datos y servidores individuales se migraron paso a paso, lo que permitió al equipo validar el rendimiento mientras se mantenían las operaciones de producción ininterrumpidas.
La arquitectura resultante incluye un clúster de tres nodos que se ejecuta en instancias i4i.4xlarge de AWS con Amazon S3 Intelligent Tiering como capa de almacenamiento subyacente. El acceso del cliente se proporciona a través de NFS y SMB, y la autenticación se integra con Active Directory.
La implantación fue sencilla y sólo requirió pequeños ajustes de configuración durante las pruebas, como la alineación de los permisos SMB. La implantación no se vio afectada por ningún obstáculo importante.
Impacto empresarial
Una vez en producción, la plataforma ofreció un rendimiento constante en las cargas de trabajo más exigentes.
La latencia, el rendimiento y las IOPS se mantuvieron estables incluso durante una actividad sostenida. Dos proyectos de producción intensiva podían ejecutarse simultáneamente sin la degradación del rendimiento experimentada anteriormente.
Los artistas notaron la diferencia rápidamente. Con menos interrupciones causadas por el rendimiento del almacenamiento, los equipos pudieron mantener la concentración creativa y trabajar de forma más eficiente.
"Si nuestros artistas no se quejan del rendimiento del almacenamiento, sabemos que está haciendo su trabajo. La plataforma ofrece un rendimiento constante incluso durante cargas de trabajo de producción intensas."
- Orca Studios
Los gastos operativos también han disminuido. El equipo de infraestructura dedica ahora mucho menos tiempo a solucionar problemas de rendimiento o a ajustar la infraestructura de almacenamiento. En su lugar, pueden centrarse en mejoras de canalización y automatización que apoyan directamente a los equipos de producción.
La economía del almacenamiento también ha mejorado. Ahora la capacidad se adapta al uso real de los datos, lo que elimina la necesidad de pagar por la capacidad provisionada no utilizada y de realizar migraciones a medida que los entornos de almacenamiento crecen o se reducen.
Aunque los datos económicos exactos varían en función del proyecto, Orca ha observado que, en general, CNQ ofrece un mejor rendimiento con una mejora indicativa del coste por TB de alrededor del 20% con respecto a su enfoque anterior basado en ZFS, y algunos proyectos muestran una mejora de hasta el 33% aproximadamente.
Sin embargo, el valor real iba más allá de los costes de almacenamiento. Al combinar un alto rendimiento predecible con una reducción significativa de los gastos operativos, Orca Studios obtuvo rápidamente beneficios cuantificables y alcanzó el punto de equilibrio financiero en un plazo aproximado de dos a cuatro meses.