Los datos se crean constantemente y a un ritmo cada vez mayor. Teléfonos móviles, redes sociales, imágenes para determinar un diagnóstico médico, etc.. todos creando nuevos datos, y almacenados en algún lugar con algún propósito. Dispositivos y sensores generan automáticamente información de diagnóstico que necesitan ser almacenados y procesados en tiempo real. Simplemente mantenerse al día con esta gran afluencia de datos es difícil, pero sustancialmente más desafiante es analizar su gran magnitud, especialmente cuando esta no se ajusta a las nociones tradicionales de estructura de datos e identifica patrones significativos. Estos gran masa de datos presenta la oportunidad de transformar los negocios, los gobiernos, la ciencia y la vida cotidiana. Algunos ejemplos los podemos ver en: Las compañías de tarjetas de crédito monitoreando cada compra que se hace e identificar fraudes en las compras con un alto grado de precisión utilizando reglas derivadas del procesamiento de miles de millones de transacciones o en las compañías de telefonía móvil analizando suscriptores, patrones de llamadas para determinar, por ejemplo, si los contactos frecuentes de una persona que llama están en alguna otra red. Si la competencia ofrece un promoción atractiva que podría causar la suscripción, la compañía puede ofrecer por adelantado y de manera proactiva un incentivo para la permanencia en su contrato. Para empresas como LinkedIn y Facebook, los datos en sí mismos son su producto principal. Las valoraciones de estas empresas se derivan en gran medida de los datos que recopilan y alojan, contieniendo cada vez más y más valor intrínseco a medida que crecen los volúmenes de datos. Se pueden destacar tres atributos como definitorios en las características para trabajar con Big Data:
La ciencia de datos gira en torno a la obtención, procesamiento y análisis de datos para obtener información diversa. Su objetivo es establecer patrones dentro de los datos, derivando predicciones y decisiones futuras. Al analizar los datos históricos, la ciencia de datos crea modelos y entrena algoritmos que pronostican los resultados. Abarca estadísticas, análisis de datos, informática y métodos relacionados para comprender los fenómenos a través de los datos. Los científicos de datos extraen, analizan e interpretan grandes conjuntos de datos de diversas fuentes utilizando principios algorítmicos, minería de datos e inteligencia artificial. Las funciones clave R como apply(), lapply() y sapply() facilitan el resumen de datos mediante la aplicación de funciones sobre conjuntos de datos. Cuatro aspectos importantes de resumir los números incluyen Centralidad (promedio), Dispersión (difusión), Replicación (tamaño de muestra) y la necesidad de sintetizar datos grandes en valores de resumen clave. Las guías de resumen incluyen el cálculo de promedios, dispersión (por ejemplo, desviación estándar) y estadísticas de forma (como curtosis y aseduría). El resumen de datos es típicamente numérico, visual o una combinación de ambos, crucial para ofrecer información.
La introducción de hojas de cálculo habilitó a los negocios, usuarios especializados para crear lógica simple en datos estructurados en filas y columnas, creando sus propios análisis de negocio. La capacitación del administrador de bases de datos no es necesario para crear hojas de cálculo: Puede emplear métodos para hacer muchas cosas de forma rápida e independiente del equipo TIc. Las hojas de cálculo son fácil de compartir, y los usuarios finales pueden llegar a tener control sobre la lógica involucrada. Además, si se pierde una equipo portátil o un archivo se corrompe, los datos y la lógica dentro la hoja de cálculo se podrían preservar - pero, eso lo veremos en otro apartado. Este es un proceso continuo y desafíante, porque los programas de hoja de cálculo como los de Microsoft Excel aún es utilizado en todo el mundo. Con la proliferación de islas de datos (o spreadmarts), la necesidad de centralizar los datos es más apremiante que nunca. A pesar de los beneficios del Almacenamiento de Bases a nivel Empresarial (EDWs) y la Inteligencia de Negocios (BI), estos sistemas tienden a restringir la flexibilidad necesaria para realizar un trabajo robusto o análisis exploratorio de datos. Podríamos mencionar como desventaja del uso de modelos EDW, es que los los datos son administrados y controlados por grupos TIc mientras que los administradores de bases de datos (DBA) y los analistas de datos deben depender de estos para acceder y modificar los esquemas. Esto impone plazos de entrega más largos para que los analistas puedan obtener datos; Además, muchas veces las reglas de EDW restringen análisis para la creación de conjuntos de datos. En consecuencia, es común que surjan sistemas adicionales que contengan datos críticos para la construcción de conjuntos de datos analíticos.
Una forma de evaluar el tipo de análisis es realizar exámenes de horizonte temporal y el tipo de enfoque analítico que se está utilizando. El BI tiende a proporcionar informes, paneles y consultas sobre negocios preguntas del período actual o del pasado. Los sistemas de BI facilitan la respuesta a preguntas relacionadas con ingresos periódicos y progresivos, para comprender ¿cuánto de un producto determinado se vendió en un tiempo determinado? Estas preguntas tienden a ser cerradas, pero explicando el presente o el pasado. El comportamiento, generalmente de datos históricos y agrupádos puede proporcionar retrospectiva y algunas ideas respondiendo preguntas relacionadas a ¿cuándo? ó ¿dónde? ocurrieron los eventos. En comparación, la Ciencia de datos tiende a utilizar datos desglosados con una visión más prospectiva, de manera exploratoria, centrándose en analizar el presente y permitiendo tomar decisiones informadas sobre el futuro. En lugar de agregar datos históricos para ver como por ejemplo un producto determinado se comporta, se pueden emplear técnicas de Ciencia de Datos como análisis de series temporales - discutido más adelante con más detalle - usado para pronosticar ventas e ingresos futuros de productos con mayor precisión, en lugar de extender una simple línea de tendencia. En general la Ciencia de datos tiende a ser más exploratoria en naturaleza y puede usar la optimización de escenarios para lidiar con más preguntas abiertas. Este enfoque proporciona visión de la actividad y previsión de eventos futuros. El BI tiende a requerir una estructura altamente estructurada de datos organizados en filas y columnas para una precisión, sin embargo, los proyectos de informes y Ciencia de datos tienden a utilizar una variedad de tipos de fuentes de datos, incluidas fuentes grandes o pequeñas. Dependiendo de los objetivos de la organización, se puede optar por embarcarse en un proyecto de BI realizando informes, paneles y visualizaciones, o elegir Proyectos de Ciencia de datos para análisis más sofisticados con desagregados o variados conjuntos de datos.
Las organizaciones y los recopiladores de datos se están dando cuenta de que los datos que pueden recopilar contienen información intrínseca de valor y, como resultado, está surgiendo una nueva economía. Como esta nueva economía digital continúa evolucionando, el mercado ve la introducción de proveedores que limpien y utilicen el crowd-sourcing para probar los resultados de machine learning. Otros proveedores ofrecen valor agregado re-empaquetando herramientas de código abierto de una manera más simple y llevarlas al mercado tecnológico. Proveedores como Cloudera, Hortonworks y Pivotal le han proporcionado valor agregado al código abierto Hadoop, como por citar un ejemplo
La llegada del Big Data marcó una transformación profunda en la forma en que las organizaciones capturan, almacenan, procesan y extraen valor de la información. A diferencia de las fases previas en las que los datos estructurados y predictibles dominaban los procesos de negocio, la era del Big Data introduce volúmenes masivos de datos heterogéneos generados a gran velocidad: logs de sensores, transacciones, clics web, imágenes, audio, vídeo y conversacionales. Esta revolución ha sido impulsada por tres fuerzas convergentes: la reducción del coste de almacenamiento y computación, el despliegue masivo de sensores y dispositivos conectados (IoT) y la madurez de algoritmos de aprendizaje automático capaces de trabajar con datos no estructurados. Para entender y gobernar el fenómeno del Big Data se popularizó el marco de las 7V: Volumen, Velocidad, Variedad, Veracidad, Valor, Variabilidad y Visualización. Estas dimensiones ofrecen una lente multidimensional para diagnosticar retos técnicos, de gestión y de negocio. No son elementos aislados: interactúan entre sí y condicionan las arquitecturas, los procesos y las decisiones estratégicas. Aquí algunas definiciones:
A lo largo de este documento exploraremos la evolución histórica del Big Data, los componentes técnicos (infraestructura, arquitecturas Lambda/Kappa, almacenamiento, procesamiento, orquestación), criterios de diseño, regulaciones y consideraciones éticas (privacidad, sesgo algorítmico). También revisaremos algunos estudios de caso en salud, finanzas, retail, telecomunicaciones, industria 4.0 y administración pública, mostrando cómo las 7V se manifiestan y se priorizan de forma distinta según el dominio. Se pueden resumir frameworks prácticos para gobernanza, seguridad y compliance, un plan de adopción empresarial y una hoja de ruta tecnológica para los próximos 5–10 años, integrando tendencias como MLOps, Data Mesh, privacidad diferencial y arquitecturas edge-cloud híbridas.