パフォーマンスの差は重要です。構造化データベースは、最適化された環境で非常に高いトランザクション率を維持できます。一方、従来のストレージ・アーキテクチャでは、AI データ・パイプラインに十分な速度で供給できないことが多く、GPU がアイドル状態になります。
JSON や XML のような半構造化データは、これらの世界を組織マーカーでつなぎますが、厳密なスキーマがないため、JSON は最も一般的なモダン API の 1 つです。
非構造化データの種類と例
企業の各部門は非構造化データを生成し、これらのタイプを理解することで、効果的なストレージ戦略を計画できます。非構造化データの種類を見てみましょう。
リッチ・メディアが容量を支配しています。例えば、4 K セキュリティ・カメラは、1 時間あたり 6.75 GB のストレージを連続録画で消費できます。1 回の MRI スキャンで 500 MB~1 GB のデータを生成できます。毎日何千ものスキャンを処理する医療・ヘルスケア・システムは、従来のストレージでは処理できない膨大な帯域幅要件に直面しています。
契約書、リサーチ、財務レポートなどのビジネス文書には、知的財産が含まれています。問題は、単にファイルを保存するだけでなく、コンプライアンスを維持しながら、数百万のファイル間で即時検索を可能にすることです。
IoT とセンサー・データは継続的にストリーミングされ、膨大な量のデータを生成します。IoT デバイスは、2025 年に約 90 ゼタバイトのデータを生成すると予測されています。自律走行車は、カメラ、LIDAR、レーダーから 1 台当たり 1 日 4 TB のデータを生成します。
AI トレーニング・データセットには、大規模な非構造化データと前例のない性能が必要です。大規模言語モデルは、数百テラバイトでトレーニングします。コンピュータ・ビジョンでは、従来のストレージでは実現できない速度で、何百万もの画像をランダムにアクセスする必要があります。
非構造化データの管理が困難な理由
スケールは従来のアプローチを打ち破ります。ペタバイトに達すると、数百万のファイルを持つディレクトリ構造が管理不能になる可能性があります。バックアップ・ウィンドウは 24 時間を超えて拡張し、検索操作がタイムアウトする場合があります。ギガバイト規模で機能したものは、ペタバイト規模でしばしば失敗します。
ボリュームと多様性:非構造化データは、さまざまな形式や複数のソースから提供されるため、効果的な管理と分析が困難です。企業は、非構造化データを処理するために構築された Everpure の FlashBlade などの堅牢なデータ・ストレージや膨大な量の非構造化データを処理する分析インフラに投資する必要があります。
より厳しい性能要件:従来の想定では、非構造化データはコールドなままでした。アクセスは稀で、安価で低速なストレージに適しています。実際のところ、「コールド・データ」であっても頻繁にアクセスされることがあります。AI ワークロードには、データセット全体へのランダムなアクセスが必要です。コンプライアンス監査で 7 年前の電子メールが直ちに要求されると、2 GB/s と 75 GB/s の違いによって、何時間もかかるか、何日もかかるかが決まります。
マルチプロトコル・アクセス:今日のほとんどの組織では、データ・サイエンティストが S3 を使用してデータセットを作成し、エンジニアが NFS を処理し、アナリストが SMB を使用するため、マルチプロトコル・アクセスはもはやオプションではありません。それぞれに別々のコピーを作成すると、容量が無駄になり、同期の問題が発生します。全てのプロトコルを通じて同じデータに同時にアクセスできるプラットフォームが不可欠です。
バイアスと公平性:非構造化データ分析は、データに存在するバイアス(偏見)を不注意で永続させ、不公平または差別的な結果をもたらす可能性があります。このため、データ収集、前処理、アルゴリズムによる意思決定におけるバイアスに対処し、公平性と公平性を確保することが非常に重要です。
データの品質と正確性:非構造化データは本質的にノイズが多く、エラー、矛盾、誤解を招く情報を含む場合があります。データの品質と正確性を確保することは、信頼できるインサイトを得て、十分な情報に基づいた意思決定を行う上で非常に重要です。そのため、データの誤検出と修正のために、データ・クリーニング、検証、検証を慎重に行う必要があります。
規制コンプライアンス:GDPR、CCPA、HIPAA などのデータ・プライバシーと保護規制への注目が高まっている中、非構造化データの収集、保存、処理を行う際には、厳格なコンプライアンス要件に従う必要があります。これらの規制を遵守しない場合、多額の罰金、評判の失墜、法的結果を招く可能性があります。
「コールド・データ」という前提は、コストのかかるトレードオフにつながる可能性があります。多くの組織は、パフォーマンス・レベル間でデータを常に移動させる複雑な階層化戦略を導入しています。AI トレーニングで履歴データが必要な場合やランサムウェアのリカバリが古いバックアップに依存する場合は、コールド・ティアからの取得に大幅な遅延が生じる可能性があります。一部の環境では、ポリシー、移行、トラブルシューティングなど、これらの階層を管理するための努力が、高性能ストレージにより多くのデータを維持するコストを超えることがあります。
非構造化データのためのモダンなソリューション
ストレージは、「保存して忘れる」ものから「保存して高速化する」ものへと進化しています。最新のプラットフォームは、容量と性能の両方を提供する必要があります。
オブジェクト・ストレージは、もはや単なるアーカイブではありません。従来のオブジェクト・ストアでは、多くの場合、数十~数百ミリ秒のレイテンシーがありましたが、最新のプラットフォームでは、ミリ秒未満のレイテンシーと、多くのプライマリ・ストレージのワークロードに十分な高速性を提供し、複雑なキャッシュ・レイヤーの必要性を低減できます。
ファイル・システムとオブジェクト・ストアは、統合プラットフォームに統合されています。NFS 経由で書き込み、S3 経由ですぐに読み取ることができます。移行もコピーも待ち時間もありません。
階層化が機能しない理由
ストレージ業界のホット/ウォーム/コールド・モデルは、予測可能なアクセス・パターンを想定しています。しかし、AI モデルには、5 年前のイメージが必要になる場合があります。コンプライアンス監査では、アーカイブされた電子メールに直ちにアクセスする必要があります。コールド・データは、実際にはコールドではありません。
ティア間で 100 TB を移動するには、数時間、場合によっては数日かかることもあります。管理者は、ポリシーの管理に多大な時間を費やしています。インフラのコストを追加し、多くの場合、階層化は統合高速ストレージよりも高価です。
フラッシュ・ストレージの経済性は大きく変化しました。最新のオールフラッシュ・アレイは、ディスクベースのシステムよりも桁違いのスループットを提供し、フラッシュ $/GB は、多くのワークロードで容量コストが同じボールパーク内にあるほど十分に低下しています。パワー、スペース、階層化の複雑さを考慮すると、オールフラッシュはハイブリッドやディスクのみの構成よりも総所有コストを抑えられます。
AI と機械学習における非構造化データ
AI は非構造化データから大きな価値を引き出すことができますが、基盤となるストレージとデータ・パイプラインが GPU にデータを常に供給できる場合にのみ可能です。多くの組織が GPU 使用率を 30% 未満に抑えており、高価な GPU はデータ待ちの状態です。
大規模なモデルのトレーニングには、非常に大規模なデータセットのストリーミングと再シャフリングが繰り返し行われます。そのため、従来のストレージ・アーキテクチャでは実現できない、高い持続的なスループットが求められます。効果的な GPU 使用率を向上させることで、固定クラスタからコンピューティングの有用性が大幅に高まり、追加の GPU の必要性が低減し、トレーニング・サイクルが数週間から数日に短縮され、市場投入までの時間と全体的な経済性が向上します。
非構造化データ管理のベストプラクティス
以下に、考慮すべきベストプラクティスをいくつか示します。
- 容量だけでなく、性能から始めましょう:非構造化データは、単なるファイルではなく、重要なワークロードとして扱います。必要な取り込み速度、スループット、レイテンシーを事前に定義します。50 GB/s を必要とするゲノミクス・パイプラインでは、長期的な電子メール・アーカイブとは根本的に異なるアーキテクチャが必要です。
- ティアを最小化:複雑な階層化戦略は、運用オーバーヘッドを正当化するコスト削減をめったに実現しません。単一の高性能ティアは、運用を簡素化し、予測可能性を向上させ、ポリシーやティアの管理ではなくアプリケーションに集中できるようにします。
- AI 対応設計:現時点で AI が要件に含まれていなくても、将来的には必要になることを前提にしてください。GPU あたり 1 秒あたり数十ギガバイトを配信できないストレージは、大規模なトレーニングやハイスループットの推論を導入すると制約を受けます。今すぐ計画することで、コストのかかる後日の導入を回避できます。
- 継続的な成長を見据えた設計:非構造化データの年間成長率を少なくとも 60% と仮定します。今日の 100 TB から来年の 160 TB、さらにその先まで、システムを停止させる移行や大規模な機器更改を行うことなく、シームレスに拡張できるように設計してください。
- セキュリティを設計に統合:暗号化、きめ細かなアクセス制御、不変スナップショット、包括的な監査ログは、プラットフォームのネイティブな機能であり、固定コンポーネントではありません。これにより、リスクを軽減し、コンプライアンスを簡素化し、全体的なセキュリティ体制を強化できます。
実装ロードマップ
非構造化データ管理を変革するには、実装ロードマップが必要です。
- 評価:ベンダーの仕様ではなく、実際のスループットを測定します。バックアップ、分析、トレーニングにかかる時間を記録します。システム間を移動するデータをマッピングします。電力とスタッフの時間を含む実際のコストを計算します。
- パイロット:AI トレーニング、分析、ゲノミクスなど、最も要求の厳しいワークロードから始めましょう。統合プラットフォームに移行します。GPU の利用率やクエリの速度の向上を測定し、ビジネス・ケースを構築します。
- 統合:NAS とオブジェクトのサイロを解消します。複数のプロトコルを通じてアクセスするデータセットに焦点を当てます。重複排除によりストレージを削減し、同期の遅延を排除します。
- 展開:アーカイブやバックアップなど、より多くのワークロードに高性能を拡張します。全てのデータが一貫した速度で動作すると、人工的な区別は消えます。アプリケーションは予測可能に実行されます。ユーザー満足度が向上します。IT 部門は移行の管理を停止します。
Everpure が非構造化データの課題にどのように対処するか
非構造化データの管理には、統合マルチプロトコル・アクセス、一貫した高性能、シームレスなスケーラビリティという 3 つの重要な要件があります。FlashBlade は、これらの要件を、専用のアーキテクチャで解決します。
統合マルチプロトコル・アクセス
FlashBlade は、NFS、SMB、S3、HTTP などの複数のプロトコルを介してデータへの共有アクセスを可能にし、同時にストレージ容量のニーズを削減し、個別のストレージ・サイロやプロトコル変換の必要性を排除します。
一貫した高性能
FlashBlade は、容量と性能の選択を強制する従来のストレージ・システムとは異なり、ホット・ワーキング・セットから大規模なヒストリカル・データセットまで、幅広い非構造化ワークロードにわたって高スループットと低レイテンシーを提供するように設計されています。DirectFlash モジュールは、GPU クラスタの性能を向上させ、GPU 使用率を向上させます。
シームレスなスケーラビリティ
FlashBlade は、ダウンタイムなしで、1 つの名前空間で数十テラバイトから数ペタバイトに拡張できます。ブレードを追加すると、容量と性能の両方がリニアに増加し、ディレクトリの制限なしに数十億のファイルを効果的にサポートし、多くの従来の NAS アーキテクチャの課題を再調整します。