에이전트 AI는 정적인 모델 중심의 워크플로우에서 사람의 지속적인 감독 없이 계획하고 행동하며 적응하는 지속적인 추론 시스템으로의 전환을 의미합니다. RAG를 사용하는 LLM은 쿼리 시점에 새로운 정보를 가져올 수 있지만, 에이전트 시스템은 추론 중에 검색 및 컨텍스트 적응이 지속적으로 이루어지므로 실시간 데이터 요구 사항이 증가했습니다. 이로 인해 각각 고유한 작업을 수행하는 여러 에이전트가 서로의 상태를 밟지 않고 동일한 진화하는 컨텍스트에 액세스하고 공유해야 한다는 근본적인 데이터 과제가 생깁니다. 그렇지 않으면 추론이 단편화되고, 출력이 분산되며, 다운스트림 워크플로우가 실패합니다.
에이전트 AI는 일회성 프롬프트를 지속적인 추론으로 대체합니다. 에이전트는 환경을 감지하고 관련 컨텍스트를 기억하며 반복적으로 계획, 행동, 평가하여 보상 기능을 극대화합니다. 에이전트가 대규모로 작동하려면 새로운 신호를 수집, 큐레이션 및 버전 관리하고 인덱싱(임베딩 포함)한 다음 에이전트가 생각할 때마다 불변의 슬라이스로 검색하는 등 지속적인 데이터 루프가 일사불란하게 움직여야 합니다. 데이터 루프는 텍스트, 이미지, 비디오, 센서 스트림 등 방대한 양의 비정형 데이터로 구동됩니다. 이러한 데이터 세트는 클라우드, 데이터 센터, 엣지 환경 전반에 걸쳐 점점 더 지리적으로 분산되고 있습니다. 작업과 결과는 출처를 통해 체크포인트되고 큐레이션에 피드백되므로 다음 추론 단계는 일관되고 감사 가능한 상태에서 시작됩니다. 단일 에이전트 흐름에서는 단순한 검색 및 컨텍스트 패턴이지만, 다중 에이전트 시스템에서는 지속적인 체크포인트, 스냅샷 고정 읽기, 동시 검색, 정책 인식 액세스, 계보 등이 필요합니다. 이 두 루프의 긴밀한 연결이 없으면 에이전트는 오래된 컨텍스트에서 멈추고, 변화하는 데이터에서 충돌하며, 재현성에 실패하기 때문에 데이터 아키텍처는 이러한 차세대 AI 시스템이 엔터프라이즈 규모에 도달할 수 있는지 여부를 결정하는 결정적인 요소가 됩니다.
"많은 애플리케이션의 병목 현상은 소프트웨어에 공급할 올바른 데이터를 확보하는 것"이며, "오늘날의 AI를 구동하는 것은 모델이 아니라 이를 공급하는 데이터 계층"이라고 Snowflake의 CEO인 Andrew Ng가 깔끔하게 표현한 것처럼, "오늘날의 AI를 지원하는 것은 모델에 관한 것이 아니라 데이터 계층에 관한 것"입니다.
주요 과제
사일로화된 인프라 전반의 비정형 데이터 관리
에이전트 AI의 다중 에이전트 모델은 다양한 데이터 세트에 대한 원활한 액세스를 요구합니다. 고객 기록, IoT 원격 측정 또는 운영 규칙과 같은 정보가 사일로화되면 파이프라인의 복잡성과 성능 병목 현상이 발생합니다. 데이터 액세스가 지연되면 GPU의 효율성이 떨어지고, AI 애플리케이션의 성능 저하로 인해 컴퓨팅 비용이 증가합니다. 민첩성을 유지하려면 지연 시간을 최소화하면서 사전 학습, 미세 조정 및 보강을 위해 관련 데이터 세트를 오케스트레이션해야 합니다.
리더의 61%가 AI 에이전트를 배포하고 있습니다 Gartner 는 2028년까지 자동화가 15%에 불과할 것으로 예상하며, 파편화된 데이터 사일로가 에이전트의 ROI를 저해한다고 강조합니다.
적응형 워크플로우를 위한 데이터 큐레이션 및 제공
지속적인 학습 워크플로에는 신속하고 타깃화된 데이터 전달이 필요합니다. 복잡한 큐레이션은 프로젝트 시간의 30~50%를 소비합니다 특히 소셜 미디어 감정 스트림과 같은 동적 소스의 경우 더욱 그렇습니다. 멀티 에이전트 CI/CD 파이프라인은 수많은 학습 모델을 동시에 공급해야 하므로 사소한 데이터 지연으로도 에이전트 전반의 처리가 지연될 수 있습니다.
Forbes에 따르면 데이터 실무자의 시간 중 최대 79%가 데이터 집합을 준비하는 데 소비된다고 하는데, 이는 자동화된 버전 관리가 가능한 전달 파이프라인이 중요한 이유를 강조합니다.
안전, 윤리 및 규정 준수를 위한 데이터 관리
자율 시스템은 특히 일부 업계 사례에서 볼 수 있듯이 데이터 계보의 35% 이상이 추적할 수 없는 경우 규정 준수 위험이 높아집니다. 데이터 출처, 변환 및 사용에 대한 완전한 투명성이 없으면 조직은 법적, 평판 및 운영상의 위험에 직면하게 됩니다. 추적성이 부족하면 규제 대상 부문에서 중요한 설명 가능성, 편향성 탐지, 개인정보 보호가 약화됩니다.
데이터 불일치로 인해 AI 이니셔티브의 75%가 실패하고 69%는 프로덕션에 적용되지 않는 것으로 나타났습니다 기술 레이더 깨끗한 데이터와 추적성은 선택 사항이 아니라 에이전트 시스템에서 필수적인 요소입니다.
아키텍처 요구 사항
튜링상 수상자인 얀 르쿤은 "더 많은 데이터와 더 많은 컴퓨팅"이 더 똑똑한 AI를 마술처럼 만들어내는 것이 아니라 시스템에 무엇을 공급하고, 입력이 얼마나 일관성이 있는지, 정보가 어떻게 구조화되고 관리되는지가 가장 중요하다는 점을 상기시킵니다. 결국, '고양이 수준'의 지능에 도달하는 것은 여전히 어려운 일이며, 이는 에이전트 AI에 단순한 규모 이상의 것이 요구되는 이유를 강조합니다.
통합 데이터 액세스
하이브리드/멀티 클라우드 글로벌 네임스페이스(GNS)는 클라우드, 엣지, 온프레미스 전반의 모든 데이터 세트를 단일 논리적 보기로 통합합니다. 따라서 수동 위치 관리, 데이터 중복, 버전 불일치가 제거되어 에이전트가 완전하고 일관된 정보 세트를 가지고 작업할 수 있습니다.
교차 프로토콜 지원
데이터 루프의 다양한 단계는 컨테이너에 배포된 서로 다른 라이브러리를 활용하며 POSIX/객체 인터페이스의 이점을 서로 다르게 활용합니다. ETL 및 교육 워크로드는 POSIX의 이점을, 라벨링은 객체 인터페이스의 이점을 활용합니다. 파일(SMB, NFS), 개체(S3), API(REST) 액세스를 지원하는 플랫폼은 비용이 많이 드는 재플랫폼화를 방지하여 에이전트가 데이터 마이그레이션 지연 없이 여러 환경에서 기본적으로 작동할 수 있게 해줍니다.
최적화된 성능
히트맵 또는 프리페칭을 사용하는 지능형 캐싱은 단일 클러스터 또는 지리적으로 분산된 클러스터 집합에서 지연 시간이 짧은 액세스를 보장합니다. 어디에 있든 원격 데이터에 유연하고 지연 시간이 짧은 액세스가 가능하므로 에이전트는 자율 진단과 같은 영역에서 실시간으로 의사 결정을 내릴 수 있습니다.
확장성, 성능, 동시성
에이전트 AI는 병목 현상이나 상태 변경 없이 선별된 데이터 세트를 여러 에이전트에게 동시에 고속으로 제공해야 합니다. 기본 제공 버전 관리, 변경 불가능한 스냅샷 및 인덱싱을 통해 모든 에이전트가 일관된 데이터 세트로 작업할 수 있습니다. CI/CD 파이프라인과의 통합으로 교육, 검증, RAG 및 미세 조정 전반에 걸쳐 업데이트, 테스트 및 배포를 자동화합니다. 이러한 기능이 없으면 멀티 에이전트 시스템에서는 데이터 드리프트, 중복 처리 및 연쇄적인 속도 저하가 발생합니다.
강력한 거버넌스 및 출처 추적
자동화된 데이터 출처 증명은 모든 데이터 변환, 이동, 액세스 이벤트에 대한 상세한 시간순 기록을 캡처합니다. 이를 통해 규정 준수 보고를 용이하게 하고, 감사를 지원하며, 오용을 감지하고, 설명 가능성과 편견 완화를 위해 의사 결정 상황을 재구성할 수 있습니다.
요약
요컨대, 에이전트 AI를 확장하는 것은 데이터 아키텍처 과제 aI 과제를 해결해야 합니다. 성공하려면 안전하고 효과적인 자율 시스템에 필수적인 투명성, 보안, 민첩성을 유지하면서 페타바이트 규모의 분산된 비정형 데이터를 오케스트레이션할 수 있는 통합된 고성능의 거버넌스 지원 데이터 플랫폼이 필요합니다. Qumulo의 클라우드 데이터 플랫폼은 이와 같은 문제를 해결하기 위해 설계되었습니다. 자세히 알아보기 여기.