성능 격차는 중요합니다. 정형 데이터베이스는 최적화된 환경에서 매우 높은 트랜잭션 속도를 유지할 수 있는 반면, 레거시 스토리지 아키텍처는 AI 데이터 파이프라인을 충분히 빠르게 공급할 수 없어 GPU가 유휴 상태로 유지됩니다.
JSON 및 XML과 같은 반정형 데이터는 이러한 세계를 조직 마커와 연결하지만 엄격한 스키마는 없으므로 JSON은 가장 일반적인 최신 API 중 하나입니다.
비정형 데이터의 유형 및 예
기업의 모든 부서는 비정형 데이터를 생성하며, 이러한 유형을 이해하면 효과적인 스토리지 전략을 계획하는 데 도움이 됩니다. 비정형 데이터의 몇 가지 유형을 살펴보겠습니다.
풍부한 미디어가 용량을 지배합니다. 예를 들어, 4K 보안 카메라는 시간당 약 6.75GB의 스토리지를 연속 녹화로 사용할 수 있습니다. 단일 MRI 스캔으로 500MB~1GB의 데이터를 생성할 수 있습니다. 매일 수천 건의 스캔을 처리하는 헬스케어 시스템은 기존 스토리지로는 처리할 수 없는 대규모 대역폭 요구 사항에 직면해 있습니다.
계약, 연구 및 재무 보고서와 같은 비즈니스 문서에는 지적 재산이 포함되어 있습니다. 문제는 단순히 데이터를 저장하는 것이 아니라, 수백만 개의 파일에 걸쳐 즉각적인 검색을 가능하게 하는 동시에 컴플라이언스를 유지하는 것입니다.
IoT 및 센서 데이터는 지속적으로 스트리밍되어 방대한 양의 데이터를 생성합니다. IoT 장치는 2025년에 약 90제타바이트의 데이터를 생성할 것으로 예상되었습니다. 자율주행 자동차는 카메라, LIDAR 및 레이더에서 차량당 매일 4TB를 생성합니다.
AI 트레이닝 데이터 세트는 방대한 비정형 데이터와 전례 없는 성능을 요구합니다. 대형 언어 모델은 수백 테라바이트로 트레이닝됩니다. 컴퓨터 비전은 기존 스토리지가 제공할 수 없는 속도로 수백만 개의 이미지를 무작위로 액세스해야 할 수 있습니다.
비정형 데이터 관리가 어려운 이유
스케일은 기존의 접근 방식을 깨뜨립니다. 페타바이트에 도달하면 수백만 개의 파일이 있는 디렉터리 구조를 관리할 수 없게 됩니다. 백업 창은 24시간 이상 연장될 수 있으며, 검색 작업 시간이 초과될 수 있습니다. 기가바이트 규모로 작동하는 것은 페타바이트 규모로 실패하는 경우가 많습니다.
볼륨과 다양성. 비정형 데이터는 다양한 형식과 여러 소스에서 제공되므로 효과적으로 관리하고 분석하기가 어렵습니다. 기업들은 비정형 데이터를 처리하기 위해 구축된 Everpure™ 플래시블레이드(FlashBlade)®와 같은 강력한 데이터 스토리지와 방대한 양의 비정형 데이터를 처리하기 위한 분석 인프라에 투자해야 합니다.
더 까다로운 성능 요구 사항 기존 가정은 비정형 데이터가 차갑게 유지되었다는 것입니다. 거의 액세스되지 않아 저렴하고 느린 스토리지에 적합합니다. 사실, “콜드” 데이터는 자주 액세스됩니다. AI 워크로드는 전체 데이터 세트에 무작위로 액세스해야 합니다. 규정 준수 감사에서 7년 된 이메일을 즉시 요구하는 경우, 2GB/s와 75GB/s의 차이가 몇 시간 또는 며칠이 걸리는지 여부를 결정할 수 있습니다.
다중 프로토콜 액세스. 오늘날 대부분의 조직에서 데이터 과학자들은 S3을 사용하여 데이터 세트를 작성하고, 엔지니어는 NFS를 통해 처리하며, 분석가는 SMB를 사용하기 때문에 다중 프로토콜 액세스는 더 이상 선택 사항이 아닙니다. 각 용량에 대해 별도의 복사본을 생성하면 용량이 낭비되고 동기화 문제가 발생합니다. 모든 프로토콜을 통해 동일한 데이터를 동시에 제공하는 플랫폼은 매우 중요합니다.
편견과 공정성. 비정형 데이터 분석은 데이터에 존재하는 편견을 무심코 영구화하여 불공정하거나 차별적인 결과를 초래할 수 있습니다. 이러한 이유로, 공정성과 형평성을 보장하기 위해 데이터 수집, 전처리 및 알고리즘적 의사 결정의 편향을 해결하는 것이 매우 중요합니다.
데이터 품질 및 정확성. 비정형 데이터는 본질적으로 노이즈가 많으며 오류, 불일치 또는 오해의 소지가 있는 정보가 포함될 수 있습니다. 데이터 품질과 정확성을 보장하는 것은 신뢰할 수 있는 인사이트를 확보하고 정보에 입각한 결정을 내리는 데 매우 중요합니다. 이를 위해서는 데이터의 부정확성을 식별하고 수정하기 위한 신중한 데이터 정리, 검증 및 검증 프로세스가 필요합니다.
규제 준수. GDPR, CCPA 및 HIPAA와 같은 데이터 프라이버시 및 보호 규정에 대한 관심이 높아짐에 따라 조직은 비정형 데이터를 수집, 저장 및 처리할 때 엄격한 규정 준수 요건을 준수해야 합니다. 이러한 규정을 준수하지 않으면 막대한 벌금, 평판 손상 및 법적 결과를 초래할 수 있습니다.
“콜드 데이터” 가정은 값비싼 트레이드 오프로 이어질 수 있습니다. 많은 조직이 성능 수준 간에 데이터를 지속적으로 이동하는 복잡한 계층화 전략을 구현합니다. AI 트레이닝에 과거 데이터가 필요하거나 Ransomware 복구가 이전 백업에 따라 달라지는 경우, 콜드 계층에서 검색하면 상당한 지연이 발생할 수 있습니다. 일부 환경에서는 정책, 마이그레이션 및 문제 해결과 같은 계층을 관리하려는 노력이 더 많은 데이터를 고성능 스토리지에 유지하는 비용을 초과할 수 있습니다.
비정형 데이터를 위한 현대적인 솔루션
스토리지는 '스토어'에서 '스토어 및 가속화'로 진화했습니다. 현대적인 플랫폼은 용량과 성능을 동시에 제공해야 합니다.
오브젝트 스토리지는 더 이상 아카이브만을 위한 것이 아닙니다. 기존 오브젝트 스토어는 수 밀리초에서 수백 밀리초 안에 지연이 발생했지만, 현대적인 플랫폼은 많은 1차 스토리지 워크로드에 충분히 빠르게 밀리초 미만의 지연과 훨씬 더 높은 처리량을 제공하여 복잡한 캐싱 레이어의 필요성을 줄일 수 있습니다.
파일 시스템과 오브젝트 스토어는 통합 플랫폼으로 통합되고 있습니다. NFS를 통해 글을 쓰고 S3를 통해 즉시 읽을 수 있습니다. 마이그레이션, 사본, 대기 시간이 필요 없습니다.
티어링이 작동하지 않는 이유
스토리지 업계의 온난화한 모델은 예측 가능한 액세스 패턴을 가정합니다. AI 모델에는 5년 된 이미지가 필요할 수 있습니다. 규정 준수 감사에는 보관된 이메일에 대한 즉각적인 액세스가 필요합니다. 데이터 온도가 낮지 않습니다.
계층 간 100TB를 이동하려면 몇 시간, 때로는 며칠이 걸릴 수 있습니다. 관리자는 정책을 관리하는 데 상당한 시간을 소비합니다. 인프라 비용을 추가하고, 티어링은 통합 고속 스토리지보다 비용이 많이 듭니다.
플래시 경제성은 극적으로 변화했습니다. 최신 올플래시 어레이는 디스크 기반 시스템보다 처리량이 10배나 높으며, 플래시 $/GB는 많은 워크로드에 대해 동일한 야구장에 용량 비용이 들어갈 만큼 충분히 떨어졌습니다. 낮은 전력, 공간 및 계층화 복잡성을 고려하면, 올플래시는 하이브리드 또는 디스크 전용 설계보다 Total Cost of Ownership 낮은 경우가 많습니다.
AI 및 Machine Learning의 비정형 데이터
AI는 비정형 데이터에서 상당한 가치를 추출할 수 있지만, 기본 스토리지 및 데이터 파이프라인이 GPU에 데이터를 지속적으로 공급할 수 있는 경우에만 가능합니다. 많은 조직들이 30% 미만의 GPU 활용률을 달성하여 값비싼 GPU를 유휴 상태로 두고 데이터를 기다리고 있습니다.
대규모 모델을 트레이닝하려면 매우 큰 데이터 세트를 반복적으로 스트리밍하고 리셔플링해야 합니다. 이를 위해서는 많은 레거시 스토리지 아키텍처가 제공하지 않는 높은 처리량이 지속적으로 필요합니다. 효과적인 GPU 활용을 개선하면 고정 클러스터에서 훨씬 더 유용한 컴퓨팅을 구현하여 추가 GPU의 필요성을 줄이고, 교육 주기를 수주에서 수일로 단축하며, 출시 기간과 전반적인 경제성을 개선할 수 있습니다.
비정형 데이터 관리를 위한 모범 사례
다음은 고려해야 할 몇 가지 모범 사례입니다.
- 용량뿐만 아니라 성능부터 시작하세요. 비정형 데이터를 “파일”이 아닌 중요한 워크로드로 취급하세요. 필요한 유입 속도, 처리량 및 지연 시간을 미리 정의하세요. 50GB/s가 필요한 유전체학 파이프라인은 장기 이메일 아카이브와는 근본적으로 다른 아키텍처를 요구합니다.
- 티어를 최소화하세요. 복잡한 티어링 전략은 운영 오버헤드를 정당화하는 절감 효과를 거의 제공하지 않습니다. 단일의 일관된 고성능 계층은 운영을 간소화하고, 예측 가능성을 개선하며, 팀이 정책 및 계층 관리 대신 애플리케이션에 집중할 수 있도록 합니다.
- AI 준비를 위한 설계. AI가 현재 요구 사항이 아니라고 가정해 보세요. GPU당 초당 수십 기가바이트를 제공할 수 없는 스토리지는 대규모 트레이닝 또는 높은 처리량의 추론을 도입할 때 제약이 됩니다. 지금 계획하면 비용이 많이 드는 레트로피트를 방지할 수 있습니다.
- 지속적인 성장을 위한 엔지니어 비정형 데이터에서 연간 최소 60%의 성장을 가정하세요. 오늘날의 100TB에서 내년 160TB 이상으로 무중단 마이그레이션 또는 지게차 업그레이드 없이 원활하게 확장할 수 있도록 설계하세요.
- 보안을 설계에 따라 통합하세요. 암호화, 세분화된 액세스 제어, 불변 스냅샷 및 포괄적인 감사 로깅은 볼트-온 구성 요소가 아닌 플랫폼의 기본 기능이어야 합니다. 이를 통해 위험을 줄이고, 규정 준수를 간소화하며, 전반적인 보안 태세를 강화할 수 있습니다.
구현 로드맵
비정형 데이터 관리를 혁신하려면 구현 로드맵이 필요합니다.
- 평가: 공급업체 사양이 아닌 실제 처리량을 측정합니다. 백업, 분석 및 교육이 얼마나 오래 걸리는지 문서화하세요. 시스템 간에 이동하는 데이터를 매핑합니다. 전력 및 직원 시간을 포함한 실제 비용을 계산합니다.
- 파일럿: AI 교육, 분석 또는 유전체학 등 가장 까다로운 워크로드부터 시작하세요. 통합 플랫폼으로 마이그레이션하세요. 비즈니스 사례를 구축하기 위해 GPU 활용 또는 쿼리 속도의 개선을 측정하세요.
- 통합: 별도의 NAS와 오브젝트 사일로를 제거합니다. 여러 프로토콜을 통해 액세스되는 데이터 세트에 집중하세요. 중복제거를 통해 스토리지를 줄이고 동기화 지연을 없앨 수 있습니다.
- 확장: 아카이브 및 백업을 포함한 더 많은 워크로드로 고성능을 확장하세요. 모든 데이터가 일관된 속도로 작동하면 인공적인 차이가 사라집니다. 애플리케이션은 예측 가능하게 실행됩니다. 사용자는 더 행복합니다. IT는 마이그레이션 관리를 중단합니다.
Everpure가 비정형 데이터 문제를 해결하는 방법
비정형 데이터를 관리할 때 조직은 통합 멀티 프로토콜 액세스, 일관된 고성능 및 원활한 확장성이라는 세 가지 중요한 요구 사항에 직면합니다. 플래시블레이드(FlashBlade)는 특별히 설계된 아키텍처를 통해 이러한 요구 사항을 각각 해결합니다.
통합 멀티 프로토콜 액세스
플래시블레이드(FlashBlade)는 여러 프로토콜, 즉NFS, SMB, S3 및 HTTP를 통해 데이터에 대한 공유 액세스를 동시에 지원하여 스토리지 용량 요구를 줄이고 별도의 스토리지 사일로 및 프로토콜 변환을 제거합니다.
일관된 고성능
용량과 성능을 강제로 선택하는 기존 스토리지 시스템과 달리, 플래시블레이드(FlashBlade)는 “핫” 작업 세트부터 대규모 이력 데이터 세트에 이르기까지 다양한 비정형 워크로드에 높은 처리량과 낮은 지연 시간을 제공하도록 설계되었습니다. DirectFlash® 모듈은 GPU 클러스터 성능을 향상시켜 GPU 활용도를 향상시킵니다.
원활한 확장성
플래시블레이드(FlashBlade)는 다운타임 없이 단일 네임스페이스에서 수 테라바이트에서 수 페타바이트로 확장됩니다. 블레이드를 추가하면 용량과 성능이 모두 선형적으로 향상되고, 디렉터리 제한 없이 수십억 개의 파일을 효율적으로 지원하며, 많은 레거시 NAS 아키텍처의 문제를 재정의할 수 있습니다.