En el entorno digital actual, una amplia variedad de fuentes, ya sean documentos, medios electrónicos, plataformas sociales, organizaciones o individuos generan cantidades masivas de materiales no estructurados o datos crudos. Analizar sistemáticamente los datos, y extrayendo información procesable a partir de ello, es en los últimos tiempos es imperativo que las empresas modernas fortalezcan sus capacidades de toma de decisiones para que puedan mantener su competitividad. Esto es donde entra en juego el análisis de datos. El análisis de datos implica múltiples procesos y aplicaciones que observan transforman, limpian y modelan datos para obtener una significada información de grandes conjuntos de datos. Los profesionales con la tarea de recolectar, analizar, limpiar son los analistas de datos, que también son responsables de las pruebas y el desarrollo de modelos analíticos centrados sobre los datos obtenidos y analizados. Se utilizan matemáticas, estadísticas, técnicas de modelado predictivo y aprendizaje automático para encontrar patrones significativos y conocimiento en datos registrados. Análisis es un término que a menudo se usa indistintamente con ciencia de datos, minería de datos, descubrimiento de conocimiento, y otros. La distinción entre todos ellos no es clara, pero lo cierto es que todos estos términos se refieren esencialmente a extraer patrones comerciales útiles o matemáticos creando modelos de decisión a partir de un conjunto de datos preprocesados. Diferentes técnicas subyacentes pueden ser utilizado para este propósito, derivado de una variedad de disciplinas diferentes, tales como:
Básicamente, se puede hacer una distinción entre análisis predictivo y descriptivo. Para el análisis predictivo, normalmente se encuentra disponible una variable objetivo, que puede ser categórica o continua. En el análisis descriptivo, dicha variable objetivo no está disponible - lo veremos más adelante en profundidad. Más que nunca, los modelos analíticos dirigen las decisiones estratégicas de riesgo de las empresas. Por ejemplo, en un entorno bancario, el capital mínimo y las provisiones de una institución financiera. Es debido a ello que el análisis de datos es esencial para el cumplimiento de los objetivos de todos los organismos, ya que permite obtener resultados más efectivos y de una manera más eficiente.
La evolución de las bases de datos ha pasado de los sistemas jerárquicos y de red de los años 60 (por ejemplo, IBM IMS y IDS) al modelo relacional introducido en 1970, que usa tablas y el lenguaje SQL de entidad - relacion. En los años 90 y 2000, el auge de Internet y el manejo de datos masivos condujo al surgimiento de las bases de datos NoSQL, diseñadas para datos flexibles y gran escalabilidad, por ejemplo, MongoDB y Cassandra para datos no estructurados. Hoy coexisten sistemas relacionales clásicos con nuevas soluciones NoSQL (documentales, grafos, en memoria, series temporales, etc.) para distintos requerimientos. Algunos Sistemas de Gestión son MySQL, MariaDB, SQLite, PostgreSQL, Microsoft SQL Server u Oracle Database entre los más populares. Por ejemplo, MySQL es muy popular en aplicaciones web, PostgreSQL destaca por su extensibilidad, y Oracle y SQL Server suelen usarse en grandes empresas. Estas tecnologías se pueden encontrar donde la consistencia es crítica: ERP, finanzas (bancos), contabilidad, CRM, sistemas de gestión de inventarios, gestión sanitaria, etc. También es estándar en back-end de aplicaciones donde se requieren consultas complejas (JOINS, agregaciones avanzadas) sobre datos estructurados.
Las bases de datos NoSQL (“Not Only SQL”) usan modelos no tabulares y esquemas flexibles. Incluyen varias categorías: clave-valor, columnas anchas, documentales y grafos. Se diseñaron para alta escalabilidad horizontal y grandes volúmenes de datos semi/no estructurados. Por ejemplo, clave-valor almacena pares simples; columnar almacena filas con muchas columnas. Estas bases suelen renunciar a parte de la consistencia ACID por mayor rendimiento y flexibilidad. El modelado de datos al carecer de esquemas fijos, es más informal. Por ejemplo, en bases de datos de documentos se usan objetos JSON anidados en lugar de tablas; en columnas anchas se modela por rangos de clave/valor; en grafos se usan nodos y aristas. A menudo se emplean JSON Schema o validaciones parciales, y el modelado se adapta según la aplicación. El modelado suele ser - intuitivo - para el desarrollador, ya que muchos datos se guardan en la misma estructura en código
El modelo relacional organiza la información en tablas con filas y columnas. El modelado de datos relacionales suele hacerse mediante diagramas entidad - relación (modelo de Chen o notación Merise) y normalización de esquemas. Existen también herramientas gráficas de modelado como (ERWin, PowerDesigner u Oracle SQL Data Modeler, entre otros) que ayudan a diseñar los esquemas lógicos y físicos de base de datos. El lenguaje estándar es SQL (Structured Query Language) y se aplican reglas ACID para garantizar la integridad y transacciones seguras.
La estadística es la ciencia que proporciona los métodos para recopilar, organizar, analizar e interpretar datos que permiten la obtención, organización, síntesis, descripción e interpretación de los datos para la toma de decisiones en condiciones de incertidumbre, mientras que el análisis de datos es el proceso de inspeccionar, limpiar, transformar y modelar datos para descubrir información útil. En esencia, la estadística es una herramienta fundamental para realizar un análisis de datos riguroso que permita identificar patrones, validar hipótesis y tomar decisiones informadas. La Estadística, en general, trata con información basada en ciertos datos de interés. La palabra “estadística”, ha sido referida ya sea a la información misma como a los métodos que tratan con la información. Para evitar confusiones, los estadísticos prefieren llamar a la información: los datos estadísticos y a los métodos que tratan con la información: los métodos estadísticos. No toda información es considerada como dato estadístico. Los valores que forman un conjunto de datos estadísticos deben ser tales que se puedan analizar relaciones significativas, es decir, deben ser capaces de ser comparados, analizados e interpretados. Es frecuente que la Estadística se identifique con una tabla o colección de datos, pero no cabe dudas de que la Estadística no debe entenderse como una mera colección de datos, aunque los mismos se presenten de forma ordenada y sistemática.
Podemos describir dos formas principales de describir un fenómeno interesante en términos estadísticos: se puede usar la población o usar una muestra de esa población. Las muestras se utilizan principalmente por razones económicas o para ahorrar tiempo. Es importante extraer una muestra aleatoria, es decir, cada elemento de la población puede tener la misma oportunidad. La estadística se utiliza para describir las propiedades estadísticas de las muestras. La estadística de muestra se utilizan para respaldar diversas decisiones. En aplicaciones, la media estimada se trata como si fuera la verdadera media de la población y se derivada de una muestra sujeta a un error de estimación. Uno de los principales objetivos de la estadística es utilizar muestras para dibujar conclusiones sobre las propiedades de la población. Esto se hace en el contexto de cálculo de intervalos de confianza y pruebas de hipótesis..
Al tomar el control se podrán extraer diversos tipos patrones, entre los más utilizados encontramos los Cluster, Minería, Detección y Predicción, pudiendo impactar en sectores de Ventas, Marketing, Instituciones Gubernamentales, No Gubernamentales y hasta en los deportes. La mejora de la calidad en la toma de decisiones es uno de los logros cruciales en el procesamiento de los datos y su empoderamiento en las empresas. Con la amplia aplicación del big data la tecnología y el proceso de toma de decisiones de las empresas han pasado de ser dominados por la experiencia basada en datos científicos. Esta transformación no sólo mejora el carácter científico y la racionalidad de la toma de decisiones, sino que también reduce de manera efectiva los sesgos traído por factores subjetivos en el proceso de toma de decisiones, mejorando así significativamente la calidad.
Las aplicaciones tecnológicas de análisis predictivo ha mejorado enormemente la capacidad de las empresas para evaluar las tendencias futuras a través de la historia, promoviendo aún más la mejora de la calidad de la toma de decisiones. El análisis predictivo explora profundamente las relaciones entre los datos históricos y los datos en tiempo real, utilizando métodos como aprendizaje automático y minería de datos para ayudar a las empresas a identificar las tendencias del mercado, cambios en comportamiento del consumidor o fluctuaciones en el entorno macroeconómico, etc... Algunos ejemplos soportan la predección de las demandas futuras en los consumidores, optimización de inventarios, gestión, estrategias de promociones, etc., reduciendo así los riesgos causados por las fluctuaciones del mercado.
Las fuentes de datos que utiliza el Big Data van desde la información producida por medios de comunicación, pasando por los datos generados por sensores, hasta los registros de la navegación de los clientes y la información generada en redes sociales. Dentro de las fuentes de datos utilizadas están los datos estructurados, mismos que se encuentran en un formato bien definido; en estos se encuentran en las bases de datos relacionales y hojas de cálculo. Por otro lado, se encuentran los datos no estructurados, dentro de los cuales no existen campos definidos como en los datos estructurados. Dentro de éstos se encuentran las imágenes, videos, audios, formatos de texto, mensajes, artículos, correos electrónicos, entre otros.
La llegada del Big Data marcó una transformación profunda en la forma en que las organizaciones capturan, almacenan, procesan y extraen valor de la información. A diferencia de las fases previas en las que los datos estructurados y predictibles dominaban los procesos de negocio, la era del Big Data introduce volúmenes masivos de datos heterogéneos generados a gran velocidad: logs de sensores, transacciones, clics web, imágenes, audio, vídeo y conversacionales. Esta revolución ha sido impulsada por tres fuerzas convergentes: la reducción del coste de almacenamiento y computación, el despliegue masivo de sensores y dispositivos conectados (IoT) y la madurez de algoritmos de aprendizaje automático capaces de trabajar con datos no estructurados. Para entender y gobernar el fenómeno del Big Data se popularizó el marco de las 7V: Volumen, Velocidad, Variedad, Veracidad, Valor, Variabilidad y Visualización. Estas dimensiones ofrecen una lente multidimensional para diagnosticar retos técnicos, de gestión y de negocio. No son elementos aislados: interactúan entre sí y condicionan las arquitecturas, los procesos y las decisiones estratégicas. Aquí algunas definiciones:
A lo largo de este documento exploraremos la evolución histórica del Big Data, los componentes técnicos (infraestructura, arquitecturas Lambda/Kappa, almacenamiento, procesamiento, orquestación), criterios de diseño, regulaciones y consideraciones éticas (privacidad, sesgo algorítmico). También revisaremos algunos estudios de caso en salud, finanzas, retail, telecomunicaciones, industria 4.0 y administración pública, mostrando cómo las 7V se manifiestan y se priorizan de forma distinta según el dominio. Se pueden resumir frameworks prácticos para gobernanza, seguridad y compliance, un plan de adopción empresarial y una hoja de ruta tecnológica para los próximos 5–10 años, integrando tendencias como MLOps, Data Mesh, privacidad diferencial y arquitecturas edge-cloud híbridas.