De acuerdo con una estimación, se proyectó que la creación de datos globales alcanzaría los asombrosos 181 zettabytes en 2025. Aproximadamente entre el 80 % y el 90 % de los datos del mundo se clasifican como no estructurados. A diferencia de los datos estructurados almacenados de forma ordenada en bases de datos, los datos no estructurados, como correos electrónicos, videos, documentos, resultados de sensores y conjuntos de datos de capacitación de AI, requieren arquitecturas de administración y almacenamiento especializadas.
Los datos no estructurados comprenden la mayor parte de la información empresarial y crecen un 55 % anual. Sin embargo, la mayoría de las organizaciones solo pueden procesarlo a una fracción de la velocidad que exigen las cargas de trabajo modernas. Este volumen masivo de correos electrónicos, videos, documentos, datos de sensores y conjuntos de entrenamiento de AI se ha convertido en la mayor oportunidad y desafío que enfrentan los equipos de TI.
Los datos no estructurados son cualquier información que no se ajusta a un modelo o esquema de datos predefinido. En lugar de vivir en filas y columnas de bases de datos ordenadamente organizadas, permanece en sus formatos nativos: PDF, publicaciones en redes sociales, flujos de sensores de IoT, imágenes médicas y más.
Sin embargo, los sistemas de almacenamiento tradicionales a menudo ofrecen solo una fracción del rendimiento que requieren las cargas de trabajo de AI modernas, lo que deja a las GPU sin datos en lugar de hacer un trabajo útil. Debido a que la mayoría de los datos “fríos” no están estructurados y se accede a ellos con más frecuencia de lo planificado, pueden exponer rápidamente las ineficiencias y los costos ocultos de las estrategias de almacenamiento por niveles.
El almacenamiento de datos no estructurados comenzó en la década de 1990, cuando las organizaciones digitalizaron documentos, imágenes y medios que no podían adaptarse a las bases de datos tradicionales. Los primeros servidores de archivos y sistemas NAS lucharon con el aumento de los volúmenes de datos.
La década del 2000 vio la llegada del almacenamiento de objetos, especialmente con Amazon S3 en 2006, que introdujo una nueva arquitectura que utilizaba espacios de nombres y metadatos planos, lo que permitió miles de millones de archivos. Esta innovación hizo posible el almacenamiento en la nube y cambió las estrategias de retención de datos. Inicialmente, el almacenamiento de objetos sacrificó el rendimiento por capacidad, lo que llevó a las organizaciones a usar sistemas de archivos de alto rendimiento separados para cargas de trabajo activas y almacenamiento de objetos para archivos.
El auge de la AI y el aprendizaje automático en la década de 2010 reveló las limitaciones de este enfoque, lo que impulsó el desarrollo de plataformas unificadas de alto rendimiento que abordan la compensación de capacidad de rendimiento.
La distinción entre este tipo de datos da forma fundamentalmente a la arquitectura de almacenamiento. Los datos estructurados encajan en esquemas predefinidos, como registros de clientes en un CRM, donde cada entrada tiene campos específicos. Esta previsibilidad permite que las consultas SQL recuperen información exacta en milisegundos.
Los datos no estructurados no siguen estas reglas. Los videos contienen tramas, pistas de audio y metadatos que no caben en los campos de bases de datos. Los hilos de correo electrónico combinan texto, archivos adjuntos y formato en patrones complejos que requieren diferentes enfoques.
La brecha de rendimiento es importante: Las bases de datos estructuradas pueden sostener tasas de transacción muy altas en entornos optimizados, mientras que las arquitecturas de almacenamiento heredadas a menudo no pueden alimentar los procesos de datos de AI lo suficientemente rápido, lo que deja las GPU inactivas.
Los datos semiestructurados como JSON y XML unen estos mundos con marcadores organizativos, pero sin esquemas rígidos, lo que hace que JSON sea una de las API modernas más comunes.
Cada departamento de una empresa genera datos no estructurados, y comprender estos tipos lo ayuda a planificar estrategias de almacenamiento eficaces. Veamos algunos tipos de datos no estructurados.
Los medios ricos dominan la capacidad. Por ejemplo, una cámara de seguridad 4K puede consumir aproximadamente 6,75 GB de almacenamiento por hora de grabación continua. Una sola exploración por MRI puede generar de 500MB a 1GB de datos. Los sistemas de atención de la salud que procesan miles de escaneos diarios se enfrentan a requisitos masivos de ancho de banda que el almacenamiento tradicional no puede manejar.
Los documentos comerciales, como contratos, investigaciones e informes financieros, contienen su propiedad intelectual. El desafío no es solo almacenarlos, sino permitir la búsqueda instantánea en millones de archivos mientras se mantiene el cumplimiento.
Flujos de datos de IoT y sensores de forma continua, lo que crea volúmenes masivos de datos. Se proyectó que los dispositivos IoT generarían alrededor de 90 zettabytes de datos en 2025. Los vehículos autónomos generan 4TB por vehículo por día a partir de cámaras, LIDAR y radar.
Los conjuntos de datos de entrenamiento de AI exigen datos no estructurados masivos y un rendimiento sin precedentes. Los modelos de idiomas grandes se entrenan en cientos de terabytes. La visión por computadora puede necesitar millones de imágenes a las que se accede aleatoriamente a velocidades que el almacenamiento tradicional no puede ofrecer.
La escalabilidad rompe los enfoques tradicionales. Una vez que alcanza petabytes, las estructuras de directorio con millones de archivos pueden volverse incontrolables. Las ventanas de copia de seguridad pueden extenderse más allá de las 24 horas, y las operaciones de búsqueda pueden agotarse. Las cosas que funcionaban a escala de gigabytes a menudo fallan a escala de petabytes.
Volumen y variedad. Los datos no estructurados vienen en varios formatos y de varias fuentes, lo que dificulta la administración y el análisis efectivos. Las empresas deben invertir en un almacenamiento de datos robusto, como Everpure ™ FlashBlade®, que se diseñó para manejar datos no estructurados, e infraestructura de análisis para manejar el volumen puro y la variedad de datos no estructurados.
Requisitos de rendimiento más exigentes. La vieja suposición era que los datos no estructurados se mantenían fríos, a los que rara vez se accedía, adecuados para un almacenamiento económico y lento. La realidad es que a menudo se accede a los datos “fríos”. Las cargas de trabajo de AI necesitan acceso aleatorio a conjuntos de datos completos. Cuando las auditorías de cumplimiento exigen correos electrónicos de siete años de antigüedad de inmediato, la diferencia entre 2GB/s y 75GB/s puede determinar si lleva horas o días.
Acceso multiprotocolo. En la mayoría de las organizaciones actuales, el acceso multiprotocolo ya no es opcional, ya que los científicos de datos escriben conjuntos de datos utilizando S3, los ingenieros procesan a través de NFS y los analistas utilizan SMB. Crear copias separadas para cada capacidad de desperdicio y crear problemas de sincronización. Las plataformas que presentan los mismos datos a través de todos los protocolos simultáneamente son cruciales.
Sesgo e imparcialidad. El análisis de datos no estructurados puede perpetuar inadvertidamente los sesgos presentes en los datos, lo que conduce a resultados injustos o discriminatorios. Por este motivo, es extremadamente importante abordar los sesgos en la recopilación de datos, el preprocesamiento y la toma de decisiones algorítmicas para garantizar la equidad y la equidad.
Veracidad y calidad de datos. Los datos no estructurados son inherentemente ruidosos y pueden contener errores, inconsistencias o información engañosa. Garantizar la calidad y veracidad de los datos es fundamental para obtener resultados confiables y tomar decisiones informadas. Esto requiere procesos cuidadosos de limpieza, validación y verificación de datos para identificar y corregir imprecisiones en los datos.
Cumplimiento regulatorio. Con el creciente enfoque en las regulaciones de privacidad y protección de datos, como GDPR, CCPA y HIPAA, las organizaciones deben cumplir con estrictos requisitos de cumplimiento al recopilar, almacenar y procesar datos no estructurados. El incumplimiento de estas regulaciones puede dar lugar a multas considerables, daños a la reputación y consecuencias legales.
La suposición de “datos fríos” puede llevar a costosas compensaciones. Muchas organizaciones implementan estrategias complejas de niveles que mueven datos constantemente entre los niveles de rendimiento. Cuando el entrenamiento de AI requiere datos históricos o una recuperación de ransomware depende de copias de seguridad más antiguas, recuperarse de los niveles fríos puede agregar una demora significativa. En algunos entornos, el esfuerzo por administrar estos niveles, políticas, migraciones y resolución de problemas, puede superar el costo de mantener más datos en un almacenamiento de mayor rendimiento.
El almacenamiento ha evolucionado de “almacenar y olvidar” a “almacenar y acelerar”. Las plataformas modernas deben ofrecer capacidad y rendimiento, no uno u otro.
El almacenamiento de objetos ya no es solo para archivos. Los almacenamientos de objetos tradicionales a menudo tenían una latencia de decenas a cientos de milisegundos, pero las plataformas modernas pueden ofrecer una latencia de submilisegundos y un rendimiento mucho mayor, lo suficientemente rápido para muchas cargas de trabajo de almacenamiento primario y para reducir la necesidad de capas de almacenamiento en caché complejas.
Los sistemas de archivos y el almacenamiento de objetos convergen en plataformas unificadas. Puede escribir a través de NFS e inmediatamente leer a través de S3. Sin migración, sin copias, sin esperas.
El modelo de frío caliente/caliente de la industria del almacenamiento supone patrones de acceso predecibles. Pero los modelos de AI, por ejemplo, pueden necesitar imágenes de cinco años. Las auditorías de cumplimiento requieren acceso inmediato a correos electrónicos archivados. Sus datos “fríos” no están fríos.
Mover 100TB entre niveles puede tomar horas, a veces incluso días. Los administradores pasan mucho tiempo administrando las políticas. Agregue los costos de infraestructura, y la estratificación a menudo cuesta más que el almacenamiento rápido unificado.
La economía flash ha cambiado radicalmente. Las matrices modernas basadas íntegramente en tecnología flash ofrecen un orden de magnitud de mayor rendimiento que los sistemas basados en disco, y flash $/GB ha disminuido lo suficiente como para que los costos de capacidad estén en el mismo estadio para muchas cargas de trabajo. Cuando tiene en cuenta una menor potencia, espacio y complejidad de niveles, el flash completo a menudo tiene un costo total de propiedad más bajo que los diseños híbridos o solo en disco.
AI puede extraer un valor significativo de los datos no estructurados, pero solo si el almacenamiento subyacente y los procesos de datos pueden mantener las GPU alimentadas de forma consistente con los datos. Muchas organizaciones logran menos del 30 % de utilización de GPU, lo que deja inactivas las GPU costosas, esperando datos.
Entrenar modelos grandes implica transmitir y reorganizar repetidamente conjuntos de datos muy grandes, lo que exige un rendimiento alto y sostenido que muchas arquitecturas de almacenamiento heredadas no estaban diseñadas para proporcionar. La mejora de la utilización efectiva de GPU desbloquea un procesamiento sustancialmente más útil de un clúster fijo, lo que reduce la necesidad de GPU adicionales, acorta los ciclos de entrenamiento de semanas a días y mejora el tiempo de lanzamiento al mercado y la economía general.
Estas son algunas de las mejores prácticas a considerar:
Transformar la administración de datos no estructurados requiere una hoja de ruta de implementación:
Las organizaciones enfrentan tres requisitos críticos al administrar datos no estructurados: acceso unificado multiprotocolo, alto rendimiento consistente y escalabilidad sin interrupciones. FlashBlade aborda cada uno de estos requisitos con una arquitectura diseñada específicamente.
FlashBlade permite el acceso compartido a los datos a través de varios protocolos, NFS, SMB, S3 y HTTP, de forma simultánea, lo que reduce las necesidades de capacidad de almacenamiento y elimina la necesidad de silos de almacenamiento separados y conversiones de protocolo.
A diferencia de los sistemas de almacenamiento tradicionales que obligan a elegir entre capacidad y rendimiento, FlashBlade está diseñado para ofrecer un alto rendimiento y baja latencia en una amplia gama de cargas de trabajo no estructuradas, desde conjuntos de trabajo “calientes” hasta grandes conjuntos de datos históricos. Los módulos DirectFlash® mejoran el rendimiento del clúster de GPU, lo que aumenta la utilización de GPU.
FlashBlade escala de decenas de terabytes a varios petabytes en un solo espacio de nombres sin tiempo de inactividad. A medida que agrega cuchillas, tanto la capacidad como el rendimiento aumentan de manera lineal, lo que permite admitir de manera eficiente miles de millones de archivos sin las limitaciones de directorio y reequilibrar los desafíos de muchas arquitecturas NAS heredadas.
Los datos no estructurados han evolucionado de un desafío de almacenamiento a un impulsor de innovación y ahora comprenden la mayoría de los datos organizacionales. Los enfoques tradicionales fallan cuando la AI exige un alto rendimiento y cuando se accede a la mayoría de los datos “fríos” con más frecuencia de lo planificado.
Las arquitecturas modernas que unifican el acceso a archivos y objetos mientras ofrecen un alto rendimiento consistente pueden transformar los datos no estructurados de una carga a una ventaja. Cuando el almacenamiento ofrece alto rendimiento y baja latencia, aumenta la utilización de GPU y se acelera el entrenamiento de AI.
El camino a seguir es claro: Evalúe su rendimiento actual, realice una prueba piloto con cargas de trabajo exigentes, consolide silos de protocolo y luego extienda el alto rendimiento a más cargas de trabajo. Las organizaciones que adoptan arquitecturas unificadas de alto rendimiento se posicionan para aprovechar la AI en lugar de solo hablar de ella.
Everpure ha ayudado a las organizaciones a lograr esta transformación con FlashBlade, una plataforma de objetos y archivos rápidos unificados que ofrece el rendimiento, la escalabilidad y la sencillez de las demandas de datos no estructurados modernos.
Acceda a videos y demostraciones según demanda para ver lo que Everpure puede hacer.
Charlie Giancarlo explica por qué la administración de datos, no el almacenamiento, es el futuro. Descubra cómo un enfoque unificado transforma las operaciones de TI de una empresa.
Cuadrante Mágico™ de Gartner® 2025 para plataformas de almacenamiento empresarial.