根據一項估計,全球資料建立預計在 2025 年將達到驚人的 181 ZB。全球約有 80%–90% 的資料被歸類為非結構化資料。與資料庫內整齊儲存的結構化資料不同,非結構化資料如電子郵件、影片、文件、感測器輸出和 AI 訓練資料集,需要專門的儲存和管理架構。
非結構化資料包含大多數企業資訊,每年成長 55%。然而,大多數組織只能以現代工作負載所需的一小部分速度來處理。大量的電子郵件、影片、文件、感測器資料和 AI 訓練集,都成為 IT 團隊所面臨的最大機會和挑戰。
非結構化資料是指任何與預先定義的資料模型或架構不符的資訊。它不生活在整理整齊的資料庫列和欄內,而是維持其原生格式:PDF、社群媒體貼文、IoT 感測器串流、醫療影像等。
然而,傳統儲存系統通常只需要提供現代 AI 工作負載所需輸送量的一小部分,讓 GPU 不須處理有用的工作,而是仰賴資料。因為大多數的「冷資料是非結構化的,存取頻率比規劃更頻繁,所以可以快速暴露分層儲存策略的低效率和隱藏成本。
非結構化資料儲存始於 1990 年代,當時組織將無法融入傳統資料庫的文件、影像和媒體數位化。早期的檔案伺服器和 NAS 系統在資料量增加方面遇到了困難。
在 2000 年代,物件式資料儲存出現了,特別是在 2006 年 Amazon S3 的協助下,它使用平面命名空間和中繼資料引進了新的架構,從而允許了數十億個檔案。這項創新讓雲端儲存變得可行,並改變資料保留策略。最初,物件式資料儲存會犧牲容量的效能,導致組織使用獨立的高效能檔案系統處理活躍的工作負載,以及物件式資料儲存處理歸檔。
AI 和機器學習在 2010 年代的崛起揭露了這種方法的限制,推動了統一、高效能平台的開發,以解決效能容量的權衡。
這些資料類型之間的區別從根本上塑造了Oracle架構。結構化資料符合預先定義的架構,例如 CRM 中的客戶記錄,每個項目都有特定的欄位。這種可預測性使 SQL 查詢能夠在幾毫秒內擷取精確資訊。
非結構化資料不遵循這些規則。影片檔案包含無法放入資料庫欄位的畫面、音軌和中繼資料。電子郵件執行緒結合了文字、附件和格式等複雜模式,需要不同的方法。
效能差距很重要:結構化資料庫在最佳化環境中可維持極高的交易率,而傳統儲存架構通常無法以足夠快的速度提供 AI 資料管道,因此讓 GPU 處於閒置狀態。
JSON 和 XML 等半結構化資料將這些世界與組織標記連結在一起,但沒有僵化的架構,使 JSON 成為最常見的現代 API。
企業內的每個部門都會產生非結構化資料,而了解這類資料有助於您規劃有效的儲存策略。我們來看看非結構化資料的一些類型。
豐富的媒體主宰了容量。舉例來說,4K 安全攝影機每小時可連續錄影約消耗 6.75GB 的儲存空間。一次 MRI 掃描可產生 500MB 至 1GB 的資料。每天處理數千次掃描的醫療系統面臨傳統儲存無法處理的龐大頻寬需求。
合約、研究和財務報告等商業文件包含您的智慧財產權。挑戰不僅在於儲存檔案,還能在數百萬個檔案中進行即時搜尋,同時維持合規性。
IoT和感測器資料持續串流,產生大量資料。預計 IoT 裝置在 2025 年將產生約 90 ZB 的資料。自駕車每天每輛車產生 4TB 的容量,包括攝影機、LIDAR 和雷達。
AI 訓練資料集需要大量非結構化資料和前所未見的效能。大型語言模型在數百 TB 上進行訓練。電腦視覺可能需要以傳統儲存設備無法交付的速度隨機存取數百萬張影像。
規模打破傳統方法。達到 PB 後,數百萬個檔案的目錄結構就無法管理。備份視窗可延長超過 24 小時,搜尋操作可能會逾時。以 GB 規模運作的事物,往往在 PB 規模下失敗。
容量與多樣性。非結構化資料有各種格式及多種來源,因此難以有效管理和分析。企業必須投資強大的資料儲存設備,例如 Everpure FlashBlade®,它是為了處理非結構化資料而打造的,以及用來處理龐大容量和各種非結構化資料的分析基礎架構。
更嚴苛的效能需求。舊的假設是非結構化資料保持冷靜,很少被存取,適合便宜、緩慢的儲存。事實上,「冷」資料經常經常被存取。AI 工作負載需要隨機存取整個資料集。當法規遵循稽核立即需要七年期的電子郵件時,2GB/s 和 75GB/s 之間的差別可以判斷它需要數小時或數天的時間。
多重協定存取。現今大多數組織都不再選擇多重協定存取,因為資料科學家使用 S3 編寫資料集、透過 NFS 進行工程師流程,以及分析師使用 SMB。為每個廢棄物容量建立個別副本,並造成同步問題。同時透過所有協定呈現相同資料的平台至關重要。
偏見與公平。非結構化資料分析可能會不慎使資料中的偏見永久存在,導致不公平或歧視性的結果。因此,解決資料收集、預先處理和演算法決策方面的偏見,以確保公平公正非常重要。
資料品質與真實性。非結構化資料本質上是吵雜的,可能包含錯誤、不一致或誤導性資訊。確保資料品質和真實性對於獲得可靠的深度資訊及做出明智的決策至關重要。這需要仔細清理、驗證和驗證資料,以識別和更正資料中的不準確之處。
遵循法規。隨著越來越重視資料隱私和保護法規,如 GDPR、CCPA 和 HIPAA,組織在收集、儲存和處理非結構化資料時必須遵守嚴格的合規性要求。未能遵守這些規定可能導致高額罰款、聲譽受損和法律後果。
「冷資料」的假設可能導致代價高昂的權衡。許多組織都採用複雜的分層策略,持續在效能等級之間移動資料。當 AI 訓練需要歷史資料,或勒索軟體復原取決於較舊的備份時,從冷層擷取資料可能會增加嚴重的延遲。在某些環境中,管理這些層級—政策、搬移和故障排除—可能會超出在高效能儲存上保留更多資料的成本。
儲存不再只是"封存",而是為業務"加速"的引擎 現代平台必須同時提供容量與效能,而非單一平台。
物件式資料儲存已不再僅作為封存之用。傳統物件式資料儲存的延遲時間通常為幾十到幾百毫秒,但現代平台可提供毫秒以下的延遲,以及更高的傳輸量,足以處理許多主要儲存工作負載,並減少對複雜快取層的需求。
檔案系統和物件式資料儲存正在整合到統一平台中。您可以透過 NFS 寫入並立即透過 S3 讀取。無需遷移、無需副本、無需等待。
儲存產業的熱冷模式採用可預測的存取模式。但舉例來說,AI 模型可能需要五年前的影像。法規遵循稽核需要立即存取歸檔的電子郵件。您的"冷"資料不冷。
在各層之間移動 100TB 可能需要數小時,有時甚至數天。管理員花大量時間管理政策。增加基礎架構成本,分層的成本通常高於整合式高速儲存。
快閃經濟已經大幅改變。現代全快閃陣列的傳輸量比磁碟式系統高出許多,而快閃式 $/GB 容量成本也已經下降到與許多工作負載相同的球場。當您考慮更低的電力、空間和分層複雜性時,全快閃總體擁有成本通常比混合式或僅磁碟的設計更低。
AI 可以從非結構化資料中擷取大量價值,但前提是底層儲存和資料管道能夠讓 GPU 持續提供資料。許多組織都達成不到 30% 的 GPU 使用率,讓昂貴的 GPU 閒置,等待資料。
訓練大型模型需要重複串流並重新處理非常大的資料集,這需要高、持續的輸送量,許多傳統儲存架構並非設計來提供。提升 GPU 使用率,從固定叢集解鎖了更實用的運算功能,減少額外 GPU 的需求,將訓練週期從數週縮短至數天,並縮短上市時間及整體經濟效益。
以下是一些需要考慮的最佳做法:
非結構化資料管理的轉型需要實作藍圖:
組織在管理非結構化資料時,必須面對三項關鍵要求:整合式多重協定存取、一致的高效能,以及流暢的擴充性。FlashBlade 利用專用基礎架構來滿足上述各項需求。
FlashBlade 允許透過多種協定,如NFS、SMB、S3 和 HTTP,同時共享資料存取,從而減少儲存容量需求,並消除個別儲存孤島和協定轉換的需求。
與傳統儲存系統在容量和效能之間做出選擇不同,FlashBlade 旨在為各種非結構化工作負載提供高傳輸量和低延遲,從熱工作集到大型歷史資料集。DirectFlash® 模組可強化 GPU 叢集效能,並提升 GPU 使用率。
FlashBlade 可在單一命名空間中,從數十 TB 擴展到多個 PB,而且不需停機。當您新增刀鋒時,容量和效能會線性增加,並有效率地支援數十億個檔案,而不必再限制目錄,也不必重新平衡許多傳統 NAS 架構的挑戰。
非結構化資料已從儲存挑戰演變為創新驅動力,現在包含大部分的組織資料。當 AI 需要高傳輸量,以及當大部分的 "冷" 資料被存取比計劃更頻繁時,傳統方法就會失敗。
現代化基礎架構能整合檔案與物件存取,同時提供一致的高效能,可將非結構化資料從負擔轉變為優勢。當儲存設備提供高效能和低延遲時,GPU 使用率就會增加,而 AI 訓練也會加速。
前進的道路很清楚:評估您目前的效能、以嚴苛的工作負載試行、合併協定孤島,然後將高效能擴展到更多工作負載。採用統一、高效能架構的組織,可以利用 AI 來取代談論它。
Everpure 運用整合式高速檔案暨高速物件平台 FlashBlade 協助企業達成轉型,達成現代化非結構化資料所需的效能、規模與簡易性。