Volgens een schatting zou de wereldwijde datacreatie in 2025 maar liefst 181 zettabytes bereiken. Ongeveer 80%–90% van de data in de wereld is geclassificeerd als ongestructureerd. In tegenstelling tot gestructureerde data die netjes in databases zijn opgeslagen, vereisen ongestructureerde data zoals e-mails, video's, documenten, sensoroutputs en AI-trainingsgegevenssets gespecialiseerde opslag- en beheerarchitecturen.
Ongestructureerde data omvatten het grootste deel van de bedrijfsinformatie en groeien jaarlijks met 55%. Toch kunnen de meeste organisaties het slechts verwerken met een fractie van de snelheid die moderne workloads vereisen. Deze enorme hoeveelheid e-mails, video's, documenten, sensordata en AI-trainingen is zowel de grootste kans als de uitdaging voor IT-teams geworden.
Ongestructureerde data is alle informatie die niet in een vooraf gedefinieerd datamodel of -schema past. In plaats van te leven in netjes georganiseerde databaserijen en -kolommen, blijft het in zijn native formaten - PDF's, berichten op sociale media, IoT-sensorstreams, medische beelden en meer.
Traditionele opslagsystemen leveren echter vaak slechts een fractie van de verwerkingscapaciteit die moderne AI-workloads vereisen, waardoor GPU's hongerig zijn naar data in plaats van nuttig werk te doen. Omdat de meeste "koude" data ongestructureerd zijn en vaker toegankelijk zijn dan gepland, kan het snel de inefficiënties en verborgen kosten van gelaagde opslagstrategieën blootleggen.
Ongestructureerde dataopslag begon in de jaren negentig toen organisaties documenten, afbeeldingen en media digitaliseerden die niet in traditionele databases konden passen. Vroege bestandsservers en NAS-systemen worstelden met toenemende datavolumes.
In de jaren 2000 kwam objectopslag op de markt, met name met Amazon S3 in 2006, dat een nieuwe architectuur introduceerde met platte namespaces en Metadata, waardoor miljarden bestanden mogelijk waren. Deze innovatie maakte cloudopslag haalbaar en veranderde strategieën voor dataretentie. Aanvankelijk deed objectopslag afbreuk aan de prestaties voor capaciteit, waardoor organisaties afzonderlijke high-performance bestandssystemen gebruikten voor actieve workloads en objectopslag voor archieven.
De opkomst van AI en Machine Learning in de jaren 2010 onthulde de beperkingen van deze aanpak en duwde de ontwikkeling van uniforme, high-performance platforms die de afweging tussen prestatiecapaciteit aanpakken.
Het onderscheid tussen deze datatypes vormt de opslagarchitectuur fundamenteel. Gestructureerde data passen in vooraf gedefinieerde schema's, zoals klantdossiers in een CRM, waar elke invoer specifieke velden heeft. Deze voorspelbaarheid stelt SQL-query's in staat om exacte informatie in milliseconden op te halen.
Ongestructureerde data volgen deze regels niet. Videobestanden bevatten frames, audiotracks en Metadata die niet in databasevelden passen. E-mailthreads combineren tekst, bijlagen en opmaak in complexe patronen die verschillende benaderingen vereisen.
De prestatiekloof is belangrijk: Gestructureerde databases kunnen zeer hoge transactiesnelheden in geoptimaliseerde omgevingen aan, terwijl legacy-opslagarchitecturen vaak niet snel genoeg AI-datapipelines kunnen voeden, waardoor GPU's stil blijven liggen.
Semi-gestructureerde data zoals JSON en XML overbruggen deze werelden met organisatorische markers, maar zonder rigide schema's, waardoor JSON een van de meest voorkomende moderne API's is.
Elke afdeling in een onderneming genereert ongestructureerde data, en het begrijpen van deze soorten helpt u effectieve opslagstrategieën te plannen. Laten we eens kijken naar sommige soorten ongestructureerde data.
Rijke media domineren de capaciteit. Een 4K-beveiligingscamera kan bijvoorbeeld ongeveer 6,75 GB opslag per uur aan continue opname verbruiken. Een enkele MRI-scan kan 500MB tot 1GB aan data genereren. Gezondheidszorgsystemen die dagelijks duizenden scans verwerken, worden geconfronteerd met enorme bandbreedtevereisten die traditionele opslag niet aankan.
Bedrijfsdocumenten zoals contracten, onderzoek en financiële rapporten bevatten uw intellectuele eigendom. De uitdaging is niet alleen om ze op te slaan, maar ook om direct te kunnen zoeken in miljoenen bestanden met behoud van compliance.
IoT- en sensordatastromen continu, waardoor enorme hoeveelheden data ontstaan. Naar verwachting zullen IoT-apparaten in 2025 ongeveer 90 zettabytes aan data genereren. Autonome voertuigen genereren 4TB per voertuig per dag van camera's, LIDAR en radar.
AI-trainingsgegevenssets vereisen enorme ongestructureerde data en ongekende prestaties. Grote taalmodellen trainen op honderden terabytes. Computervisie vereist misschien miljoenen beelden die willekeurig toegankelijk zijn met snelheden die traditionele opslag niet kan leveren.
Schaal breekt traditionele benaderingen. Zodra u petabytes bereikt, kunnen directorystructuren met miljoenen bestanden onbeheersbaar worden. Back-upvensters kunnen langer duren dan 24 uur en er kan een time-out optreden bij zoekbewerkingen. Dingen die op gigabyte-schaal werkten, mislukken vaak op petabyte-schaal.
Volume en variatie. Ongestructureerde data zijn er in verschillende formaten en uit meerdere bronnen, waardoor het een uitdaging is om effectief te beheren en te analyseren. Bedrijven moeten investeren in robuuste dataopslag, zoals Everpure™ FLASHBLADE®, dat is gebouwd om ongestructureerde data te verwerken, en analyse-infrastructuur om het enorme volume en de verscheidenheid aan ongestructureerde data te verwerken.
Meer veeleisende prestatievereisten. De oude aanname was dat ongestructureerde data koud bleven - zelden toegankelijk, geschikt voor goedkope, langzame opslag. De realiteit is dat "koude" data vaak vaak vaak toegankelijk zijn. AI-workloads hebben willekeurige toegang tot volledige datasets nodig. Wanneer nalevingsaudits onmiddellijk e-mails van zeven jaar oud vereisen, kan het verschil tussen 2GB/s en 75GB/s bepalen of het uren of dagen duurt.
Multi-protocol toegang. In de meeste organisaties is multiprotocoltoegang tegenwoordig niet langer optioneel, aangezien datawetenschappers datasets schrijven met behulp van S3, engineers verwerken via NFS en analisten het MKB gebruiken. Het maken van afzonderlijke kopieën voor elke verspilde capaciteit en creëert synchronisatieproblemen. Platforms die dezelfde data tegelijkertijd presenteren via alle protocollen zijn cruciaal.
Vooroordelen en eerlijkheid. Ongestructureerde data-analyse kan per ongeluk vooroordelen in de data in stand houden, wat leidt tot oneerlijke of discriminerende resultaten. Om deze reden is het uiterst belangrijk om vooroordelen in de verzameling, voorverwerking en algoritmische besluitvorming van gegevens aan te pakken om eerlijkheid en gelijkheid te garanderen.
Datakwaliteit en -waarheid. Ongestructureerde data is inherent luidruchtig en kan fouten, inconsistenties of misleidende informatie bevatten. Het garanderen van datakwaliteit en -waarheid is cruciaal voor het verkrijgen van betrouwbare inzichten en het nemen van geïnformeerde beslissingen. Dit vereist zorgvuldige processen voor het opschonen, valideren en verifiëren van data om onnauwkeurigheden in de data te identificeren en te corrigeren.
Naleving van de regelgeving. Met de toenemende focus op regelgeving inzake dataprivacy en -bescherming zoals AVG, CCPA en HIPAA, moeten organisaties zich houden aan strenge nalevingsvereisten bij het verzamelen, opslaan en verwerken van ongestructureerde data. Het niet naleven van deze voorschriften kan leiden tot hoge boetes, reputatieschade en juridische gevolgen.
De aanname van "koude data" kan leiden tot kostbare afwegingen. Veel organisaties implementeren complexe tieringstrategieën die data voortdurend verplaatsen tussen prestatieniveaus. Wanneer AI-training historische data vereist of Ransomware herstelafhankelijk is van oudere back-ups, kan het ophalen uit cold tiers aanzienlijke vertraging veroorzaken. In sommige omgevingen kan de inspanning om deze niveaus te beheren - beleidslijnen, migraties en probleemoplossing - de kosten van het bewaren van meer data op opslag met hogere prestaties overschrijden.
Storage is geëvolueerd van "store and forget" naar "store and accelerate". Moderne platforms moeten zowel capaciteit als prestaties leveren - niet de een of de ander.
Objectopslag is niet meer alleen voor archieven. Traditionele object stores hadden vaak in de tientallen tot honderden milliseconden latency, maar moderne platforms kunnen een latency van minder dan een milliseconde en een veel hogere verwerkingscapaciteit leveren - snel genoeg voor veel primaire opslagworkloads en om de noodzaak van complexe cachinglagen te verminderen.
File systems en object stores komen samen in unified platforms. U kunt schrijven via NFS en direct lezen via S3. Geen migratie, geen kopieën, niet wachten.
Het hot-warm-koude model van de opslagindustrie gaat uit van voorspelbare toegangspatronen. Maar AI-modellen hebben bijvoorbeeld mogelijk beelden van vijf jaar nodig. Nalevingsaudits vereisen onmiddellijke toegang tot gearchiveerde e-mails. Uw "koude" data zijn niet koud.
Het verplaatsen van 100TB tussen tiers kan uren duren, soms zelfs dagen. Beheerders besteden veel tijd aan het beheren van beleid. Voeg de infrastructuurkosten toe, en tiering kost vaak meer dan uniforme snelle opslag.
De economie van Flash is drastisch veranderd. Moderne all-flash arrays leveren een orde van grootte meer verwerkingscapaciteit dan schijfgebaseerde systemen, en flash $/GB is genoeg gedaald dat de capaciteitskosten voor veel workloads in hetzelfde ballpark liggen. Wanneer u rekening houdt met minder vermogen, ruimte en complexiteit van tiering, heeft all-flash vaak lagere Total Cost of Ownership dan hybride of disk-only ontwerpen.
AI kan aanzienlijke waarde halen uit ongestructureerde data, maar alleen als de onderliggende opslag- en datapipelines GPU's consistent kunnen voeden met data. Veel organisaties bereiken minder dan 30% GPU-gebruik, waardoor dure GPU's inactief blijven en wachten op data.
Bij het trainen van grote modellen moeten zeer grote datasets herhaaldelijk worden gestreamd en geshuffeld, wat een hoge, duurzame verwerkingscapaciteit vereist waarvoor veel legacy-opslagarchitecturen niet zijn ontworpen. Het verbeteren van het effectieve GPU-gebruik ontsluit aanzienlijk nuttigere berekeningen uit een vast cluster, waardoor de noodzaak voor extra GPU's wordt verminderd, de trainingscycli van weken naar dagen worden verkort en de time-to-market en de algehele economie worden verbeterd.
Hier zijn enkele best practices om te overwegen:
Het transformeren van ongestructureerd datamanagement vereist een implementatieroadmap:
Organisaties worden geconfronteerd met drie kritieke vereisten bij het beheer van ongestructureerde data: uniforme toegang tot meerdere protocollen, consistente hoge prestaties en naadloze schaalbaarheid. FLASHBLADE voldoet aan elk van deze vereisten met een speciaal gebouwde architectuur.
FLASHBLADE maakt gedeelde toegang tot data mogelijk via meerdere protocollen -NFS, SMB, S3 en HTTP - tegelijkertijd, waardoor de behoefte aan opslagcapaciteit wordt verminderd en de noodzaak van afzonderlijke opslagsilo's en protocolconversies wordt geëlimineerd.
In tegenstelling tot traditionele opslagsystemen die een keuze maken tussen capaciteit en prestaties, is FLASHBLADE ontworpen om een hoge verwerkingscapaciteit en lage latency te leveren voor een breed scala aan ongestructureerde workloads, van "hot"-worksets tot grote historische datasets. DirectFlash®-modules verbeteren de prestaties van het GPU-cluster en verhogen het GPU-gebruik.
FLASHBLADE schaalt van tientallen terabytes naar meerdere petabytes in één naamruimte zonder downtime. Naarmate u blades toevoegt, nemen zowel de capaciteit als de prestaties lineair toe, waardoor miljarden bestanden efficiënt worden ondersteund zonder de directorybeperkingen en de uitdagingen van veel legacy NAS-architecturen opnieuw in evenwicht worden gebracht.
Ongestructureerde data is geëvolueerd van een opslaguitdaging naar een innovatiefactor en omvat nu het grootste deel van de organisatorische data. Traditionele benaderingen mislukken wanneer AI een hoge verwerkingscapaciteit vereist en wanneer het merendeel van "koude" data vaker wordt benaderd dan gepland.
Moderne architecturen die bestands- en objecttoegang verenigen en tegelijkertijd consistente hoge prestaties leveren, kunnen ongestructureerde data transformeren van een last in een voordeel. Wanneer opslag hoge prestaties en lage latency levert, neemt het GPU-gebruik toe en versnelt AI-training.
Het pad voorwaarts is duidelijk: Beoordeel uw huidige prestaties, test met veeleisende workloads, consolideer protocolsilo's en breid vervolgens hoge prestaties uit naar meer workloads. Organisaties die uniforme, high-performance architecturen omarmen, stellen zich in staat om te profiteren van AI in plaats van er alleen maar over te praten.
Everpure heeft organisaties geholpen deze transformatie te bereiken met FLASHBLADE, een uniform fast file- en objectplatform dat de prestaties, schaal en eenvoud levert die moderne ongestructureerde data vereisen.
Krijg toegang tot on-demand video's en demo's om te zien wat Everpure kan doen.
Charlie Giancarlo over waarom het beheren van data en niet opslag de toekomst zal zijn. Ontdek hoe een uniforme aanpak de IT-activiteiten van bedrijven transformeert.
2025 Gartner® Magic Quadrant™ voor Enterprise opslag-platformen