Die Performancelücke ist wichtig: Strukturierte Datenbanken können in optimierten Umgebungen sehr hohe Transaktionsraten aufrechterhalten, während herkömmliche Storage-Architekturen AIDatenpipelines oft nicht schnell genug versorgen können, sodass GPUs inaktiv bleiben.
Halbstrukturierte Daten wie JSON und XML verbinden diese Welten mit organisatorischen Markern, aber ohne starre Schemata, was JSON zu einer der gängigsten modernen APIs macht.
Arten und Beispiele für unstrukturierte Daten
Jede Abteilung in einem Unternehmen generiert unstrukturierte Daten, und das Verständnis dieser Arten hilft Ihnen, effektive Storage-Strategien zu planen. Sehen wir uns einige Arten von unstrukturierten Daten an.
Rich Media dominieren die Kapazität. Beispielsweise kann eine 4K-Sicherheitskamera etwa 6,75 GB Storage pro Stunde kontinuierlicher Aufzeichnung verbrauchen. Ein einziger MRT-Scan kann Daten von 500MB bis 1GB generieren. Gesundheitssysteme, die täglich Tausende von Scans verarbeiten, stehen vor enormen Bandbreitenanforderungen, die herkömmlicher Storage nicht bewältigen kann.
Geschäftsdokumente wie Verträge, Forschung und Finanzberichte enthalten Ihr geistiges Eigentum. Die Herausforderung besteht nicht nur darin, sie zu speichern, sondern eine sofortige Suche nach Millionen von Dateien zu ermöglichen und gleichzeitig die Compliance zu wahren.
IoT- und Sensordatenströme werden kontinuierlich gestreamt, wodurch riesige Datenmengen entstehen. IoT-Geräte sollen im Jahr 2025 etwa 90 Zettabyte an Daten generieren. Autonome Fahrzeuge erzeugen 4TB pro Fahrzeug und Tag von Kameras, LIDAR und Radar.
KIAITrainingsdatensätze erfordern massive unstrukturierte Daten und beispiellose Performance. Große Sprachmodelle trainieren auf Hunderten von Terabytes. Computer Vision benötigt möglicherweise Millionen von Bildern, auf die zufällig mit Geschwindigkeiten zugegriffen werden kann, die herkömmlicher Storage nicht liefern kann.
Warum die Verwaltung unstrukturierter Daten eine Herausforderung darstellt
Scale überwindet herkömmliche Ansätze. Sobald Sie Petabyte erreichen, können Verzeichnisstrukturen mit Millionen von Dateien nicht mehr verwaltet werden. Backup-Fenster können länger als 24 Stunden dauern und Suchvorgänge können ausfallen. Dinge, die im Gigabyte-Bereich funktioniert haben, scheitern oft im Petabyte-Bereich.
Volumen und Vielfalt. Unstrukturierte Daten sind in verschiedenen Formaten und aus mehreren Quellen erhältlich, was die effektive Verwaltung und Analyse erschwert. Unternehmen müssen in robusten Daten-Storage investieren, wie Everpure™ FlashBlade®, das für die Verarbeitung unstrukturierter Daten entwickelt wurde, und in eine Analyseinfrastruktur, um das schiere Volumen und die Vielzahl unstrukturierter Daten zu verarbeiten.
Anspruchsvollere Performance-Anforderungen. Die alte Annahme war, dass unstrukturierte Daten kalt blieben – selten zugänglich, geeignet für billigen, langsamen Storage. In der Realität wird häufig auf „kalte“ Daten zugegriffen. AIWorkloads benötigen einen direkten Zugriff auf ganze Datensätze. Wenn Compliance-Prüfungen sofort sieben Jahre alte E-Mails erfordern, kann der Unterschied zwischen 2GB/s und 75GB/s bestimmen, ob es Stunden oder Tage dauert.
Zugriff auf mehrere Protokolle. In den meisten Unternehmen ist der Zugriff auf mehrere Protokolle heute nicht mehr optional, da Datenwissenschaftler Datensätze mit S3 schreiben, Ingenieure über NFS verarbeiten und Analysten KMU verwenden. Das Erstellen separater Kopien für jede Kapazität verschwendet und verursacht Synchronisationsprobleme. Plattformen, die dieselben Daten über alle Protokolle gleichzeitig darstellen, sind von entscheidender Bedeutung.
Voreingenommenheit und Fairness. Unstrukturierte Datenanalysen können unbeabsichtigt Verzerrungen in den Daten beibehalten und zu unfairen oder diskriminierenden Ergebnissen führen. Aus diesem Grund ist es äußerst wichtig, Verzerrungen bei der Datenerfassung, der Vorverarbeitung und der algorithmischen Entscheidungsfindung anzugehen, um Fairness und Gerechtigkeit zu gewährleisten.
Datenqualität und -echtheit. Unstrukturierte Daten sind von Natur aus laut und können Fehler, Inkonsistenzen oder irreführende Informationen enthalten. Die Sicherstellung von Datenqualität und -echtheit ist entscheidend, um zuverlässige Erkenntnisse zu gewinnen und fundierte Entscheidungen zu treffen. Dies erfordert sorgfältige Datenbereinigungs-, Validierungs- und Verifizierungsprozesse, um Ungenauigkeiten in den Daten zu erkennen und zu korrigieren.
Einhaltung von Vorschriften. Angesichts des zunehmenden Fokus auf Datenschutz- und Schutzvorschriften wie DSGVO, CCPA und HIPAA müssen Unternehmen bei der Erfassung, Speicherung und Verarbeitung unstrukturierter Daten strenge Compliance-Anforderungen einhalten. Die Nichteinhaltung dieser Vorschriften kann zu hohen Geldstrafen, Reputationsschäden und rechtlichen Folgen führen.
Die Annahme von „kalten Daten“ kann zu kostspieligen Kompromissen führen. Viele Unternehmen implementieren komplexe Tiering-Strategien, die Daten ständig zwischen den Performance-Levels verschieben. Wenn AITraining historische Daten erfordert oder eine Ransomware-Wiederherstellung von älteren Backups abhängt, kann das Abrufen von Cold Tiers erhebliche Verzögerungen verursachen. In einigen Umgebungen können die Bemühungen, diese Tiers zu verwalten – Richtlinien, Migrationen und Fehlerbehebung – die Kosten für die Aufbewahrung von mehr Daten auf leistungsfähigerem Storage übersteigen.
Moderne Lösungen für unstrukturierte Daten
Storage hat sich von „Store and forget“ zu „Storage and Accelerate“ entwickelt. Moderne Plattformen müssen sowohl Kapazität als auch Performance bieten – nicht die eine oder die andere.
Objekt-Storage ist nicht mehr nur für Archive gedacht. Herkömmliche Object Stores hatten oft Latenzzeiten im Zehn- bis Hunderten von Millisekunden, aber moderne Plattformen können Latenzzeiten im Millisekundenbereich und einen viel höheren Durchsatz bieten – schnell genug für viele primäre Storage-Workloads und um die Notwendigkeit komplexer Caching-Ebenen zu reduzieren.
Dateisysteme und Object Stores konvergieren zu einheitlichen Plattformen. Sie können über NFS schreiben und sofort über S3 lesen. Keine Migration, keine Kopien, keine Wartezeit.
Warum Tiering nicht funktioniert
Das Warm-Kalt-Modell der Storage-Branche geht von vorhersehbaren Zugriffsmustern aus. KI-AI Modelle benötigen jedoch möglicherweise fünf Jahre alte Bilder. Compliance-Audits erfordern sofortigen Zugriff auf archivierte E-Mails. Ihre „kalten“ Daten sind nicht kalt.
Das Verschieben von 100TB zwischen den Tiers kann Stunden dauern, manchmal sogar Tage. Administratoren verbringen viel Zeit mit der Verwaltung von Richtlinien. Fügen Sie die Infrastrukturkosten hinzu, und das Tiering kostet oft mehr als nur einheitlichen schnellen Storage.
Die Flash-Wirtschaftlichkeit hat sich drastisch verändert. Moderne All-Flash-Arrays bieten einen um ein Vielfaches höheren Durchsatz als festplattenbasierte Systeme, und Flash/GB ist so gefallen, dass die Kapazitätskosten für viele Workloads im selben Ballpark liegen. Wenn Sie die Komplexität von Strom, Platz und Tiering berücksichtigen, hat All-Flash oft niedrigere Gesamtbetriebskosten als Hybrid- oder Disk-only-Designs.
Unstrukturierte Daten in AI und maschinellem Lernen
AI kann einen erheblichen Mehrwert aus unstrukturierten Daten ziehen, aber nur, wenn die zugrunde liegenden Storage- und Datenpipelines GPUs konsistent mit Daten versorgen können. Viele Unternehmen erreichen eine GPU-Auslastung von weniger als 30 %, sodass teure GPUs im Leerlauf bleiben und auf Daten warten.
Beim Training großer Modelle werden immer wieder sehr große Datensätze gestreamt und neu gemischt, was einen hohen, nachhaltigen Durchsatz erfordert, den viele herkömmliche Storage-Architekturen nicht bieten sollten. Die Verbesserung der effektiven GPU-Auslastung ermöglicht eine wesentlich nützlichere Rechenleistung aus einem festen Cluster, wodurch der Bedarf an zusätzlichen GPUs verringert, die Trainingszyklen von Wochen auf Tage verkürzt und die Markteinführungszeit und die Gesamtökonomie verkürzt werden.
Best Practices für das Management unstrukturierter Daten
Hier sind einige Best Practices, die zu beachten sind:
- Beginnen Sie mit Performance, nicht nur mit Kapazität. Behandeln Sie unstrukturierte Daten als kritische Workload und nicht als „nur Dateien“. Definieren Sie die erforderlichen Aufnahmeraten, den Durchsatz und die Latenz im Voraus. Eine Genomik-Pipeline, die 50GB/s benötigt, erfordert eine grundlegend andere Architektur als langfristige E-Mail-Archive.
- Minimieren Sie Tiers. Komplexe Tiering-Strategien bringen nur selten Einsparungen, die ihren operativen Overhead rechtfertigen. Eine einzige, konsistent leistungsstarke Ebene vereinfacht den Betrieb, verbessert die Vorhersehbarkeit und ermöglicht es Teams, sich auf Anwendungen anstatt auf Richtlinien und Tier Management zu konzentrieren.
- Design für AIBereitschaft. Selbst wenn AI keine aktuelle Anforderung ist, gehen Sie davon aus, dass dies der Fall ist. Storage, der keine zehn Gigabyte pro Sekunde pro GPU liefern kann, wird zu einer Einschränkung, wenn Sie umfangreiches Training oder Inferenz mit hohem Durchsatz einführen. Die Planung hilft Ihnen, später kostspielige Nachrüstungen zu vermeiden.
- Entwicklung für nachhaltiges Wachstum. Nehmen Sie ein jährliches Wachstum von mindestens 60 % bei unstrukturierten Daten an. Entwickeln Sie eine nahtlose Erweiterung – von den heutigen 100TB auf die nächsten 160TB und darüber hinaus – ohne störende Migrationen oder Komplett-Upgrades.
- Integrieren Sie Sicherheit durch Design. Verschlüsselung, granulare Zugriffskontrolle, unveränderliche Snapshots und umfassende Audit-Protokollierung sollten native Funktionen der Plattform sein und keine verschraubten Komponenten. Dies trägt dazu bei, Risiken zu reduzieren, die Compliance zu vereinfachen und Ihre allgemeine Sicherheitslage zu stärken.
Implementierungs-Roadmap
Die Transformation des unstrukturierten Datenmanagements erfordert eine Implementierungs-Roadmap:
- Bewertung: Messen Sie den tatsächlichen Durchsatz, nicht die Herstellerspezifikationen. Dokumentieren Sie, wie lange Backups, Analysen und Schulungen dauern. Zuordnen, welche Daten zwischen Systemen verschoben werden. Berechnen Sie die tatsächlichen Kosten, einschließlich Strom und Personalzeit.
- Pilot: Beginnen Sie mit Ihrer anspruchsvollsten Workload – AI-Training, Analysen oder Genomik. Migrieren Sie es auf eine einheitliche Plattform. Messen Sie die Verbesserung der GPU-Auslastung oder Abfragegeschwindigkeit, um Ihren Geschäftsfall zu erstellen.
- Konsolidierung: Eliminieren Sie separate NAS- und Objektsilos. Konzentrieren Sie sich auf Datensätze, auf die über mehrere Protokolle zugegriffen wird. Sie reduzieren Storage durch Deduplizierung und eliminieren gleichzeitig Synchronisationsverzögerungen.
- Erweitern: Erweitern Sie die hohe Performance auf mehr Workloads, einschließlich Archive und Backups. Wenn alle Daten mit einer konsistenten Geschwindigkeit arbeiten, verschwinden die künstlichen Unterscheidungen. Anwendungen laufen vorhersehbar. Benutzer sind zufriedener. IT hört auf, Migrationen zu verwalten.
Wie Everpure Herausforderungen bei unstrukturierten Daten angeht
Unternehmen stehen bei der Verwaltung unstrukturierter Daten vor drei kritischen Anforderungen: einheitlicher Multiprotokollzugriff, konsistente hohe Performance und nahtlose Skalierbarkeit. FlashBlade erfüllt jede dieser Anforderungen mit einer speziell entwickelten Architektur.
Einheitlicher Zugriff auf mehrere Protokolle
FlashBlade ermöglicht den gemeinsamen Zugriff auf Daten über mehrere Protokolle – NFS, SMB, S3 und HTTP – gleichzeitig, wodurch der Storage-Kapazitätsbedarf reduziert und separate Storage-Silos und Protokollkonvertierungen überflüssig werden.
Konsistente hohe Performance
Im Gegensatz zu herkömmlichen Storage-Systemen, die eine Wahl zwischen Kapazität und Performance erzwingen, ist FlashBlade so konzipiert, dass es einen hohen Durchsatz und eine geringe Latenz für eine Vielzahl von unstrukturierten Workloads bietet, von „heißen“ Arbeitssätzen bis hin zu großen historischen Datensätzen. DirectFlash®-Module verbessern die GPU-Cluster-Performance und steigern die GPU-Auslastung.
Nahtlose Skalierbarkeit
FlashBlade lässt sich ohne Ausfallzeiten von Zehn-Terabytes auf mehrere Petabytes in einem einzigen Namespace skalieren. Wenn Sie Blades hinzufügen, steigen sowohl Kapazität als auch Performance linear an, wodurch Milliarden von Dateien effizient unterstützt werden, ohne die Verzeichnisbeschränkungen zu überschreiten und die Herausforderungen vieler herkömmlicher NAS-Architekturen neu auszugleichen.