Breve prologo del Exploratory Data Analysis

Ilustración para: Breve prologo del Exploratory Data Analysis

Para hablar sobre el Análisis Exploratorio de Datos (EDA) primero debemos entender en qué contexto se encuentra y en qué momento es protagonista en el proceso de transformación de grandes volúmenes de datos en decisiones y predicciones útiles para el proceso de producción que las requiere.

La Ciencia de Datos, el ciclo en donde es partícipe EDA, es el campo de estudio que combina la programación y las matemáticas estadísticas para la elaboración de información significativa utilizando como medio de producción representaciones simbólicas de la realidad (datos). Este proceso contiene 5 fases principales: Collection, Cleaning, Exploratory Data Analysis, Model Building y Model Deployment.

Collection es el módulo al que se le asigna mayormente al Data Engineer y se encarga de primero entender qué es lo que requiere el proceso de producción en el que estamos trabajando. Por ejemplo: Una agroexportadora peruana de arándanos quiere predecir el rendimiento de sus próximas cosechas y anticipar problemas de calidad antes de que la fruta llegue a mercados como Estados Unidos o Europa. En la fase de Collection, el Data Engineer tiene el trabajo de identificar de dónde deben venir los datos relevantes y construir los pipelines que los centralicen: sensores de humedad y temperatura instalados en los campos de cultivo (IoT agrícola), reportes de los ingenieros agrónomos sobre plagas y fertilización, datos climáticos del SENAMHI, historiales de cosechas anteriores, y registros de control de calidad en planta de empaque. El resultado de esta fase no es obtener información lista para analizar, en cambio sirve para obtener datos crudos, centralizados y disponibles para la siguiente etapa.

Cleaning es el módulo en el que lo comparte el Data Engineer y el Data Analyst donde se comprende más acerca de los datos y los preparamos para un análisis posterior. Esto con la finalidad de tener la seguridad de que los datos obtenidos sean útiles para el problema a resolver. Siguiendo el ejemplo anterior podremos hacer la siguiente pregunta: “¿Los datos de hace casi dos décadas me siguen siendo útiles contando que el clima y el tipo de arándano son completamente diferentes que a los actuales?”.

Exploratory Data Analysis es la parte que nos interesa y donde el encargado es el Data Analyst. Aquí no encontraremos ni reglas, ni atajos o diagramas de flujo fijos para abordar los datos, sino los examinaremos para ver qué parecen indicar (no qué confirman indicar). Por ejemplo: al explorar los datos ya centralizados y limpios, el Data Analyst podría notar que los lotes de arándanos con mayor tasa de rechazo en planta de empaque parecen coincidir con semanas de alta humedad relativa registradas por los sensores de campo. Esto no significa que la humedad cause el rechazo —para eso haría falta un análisis más riguroso—, pero es una pista que vale la pena investigar más a fondo, quizás cruzándola con los reportes de los agrónomos sobre presencia de hongos en esos mismos periodos. Notemos que la calidad de sus entradas decide la calidad de su salida. Por lo tanto, una vez que se tenga una hipótesis tiene sentido dedicar mucho tiempo y esfuerzo aquí.

Model Building es la fase a la que se le encarga al Machine Learning Engineer. En los últimos años esta es la etapa más interesante para la mayoría de científicos e informáticos en este ciclo. Mucha gente lo llama “un escenario donde ocurre la magia”. Pero recordemos que la magia no existe, solo son técnicas correctas con los accesorios correctos. Entonces, antes de saltar a este paso, debemos asegurarnos de pasar suficiente tiempo en los pasos anteriores para encontrar patrones o comportamientos en los datos más próximos a la realidad.

Model Deployment es donde el Machine Learning Engineer se implementa en un entorno de preproducción o prueba antes de implementarlos en producción. Cualquiera que sea la forma en que se implemente su modelo de datos, debe exponerse al mundo real. Una vez que los humanos reales lo usen, seguramente recibirás comentarios. Capturar esta retroalimentación se traduce directamente en la vida o la muerte para cualquier proyecto.

Podremos decir que el Analista Exploratorio de Datos debe de tener una base matemática e informática sólida y un nivel de conocimiento elevado en el proceso de producción en donde se encuentra trabajando al igual que un buen análisis crítico.

Con todo esto dicho sabemos en qué parte del ciclo de la Ciencia de Datos se encuentra EDA, ahora hablaremos sobre qué es y qué hace EDA a más profundidad.

Para definir esta área utilizaré como base el libro Exploratory Data Analysis del autor Tukey. Él dice que EDA es, en pocas palabras, investigación: investigación numérica, investigación de conteo o investigación gráfica. Por ejemplo, un detective que investiga un crimen necesita tanto herramientas como conocimiento. Si no dispone de polvo para huellas dactilares, no encontrará huellas en la mayoría de las superficies. Si no comprende dónde es probable que el delincuente haya puesto los dedos, no buscará en los lugares adecuados. Del mismo modo, el analista de datos necesita tanto herramientas como conocimiento.

En un caso criminalístico los detectives son los encargados de reunir suposiciones de lo que podría ser, el analista de datos se encarga de examinar la data para ver que parecen indicar. De igual manera siguiendo el ejemplo de un crimen, el encargado de la confirmación sobre lo que ha sucedido no es el detective, sino el juez. En EDA, el analista solo se encarga de la apariencia mas no de la confirmación de lo que pasa o vaya a pasar.

Podremos ver que el rol de EDA en el proceso de producción es el de proveer evidencia e indicios que sustenten una decisión posterior. En pocas palabras, EDA tiene el papel de soporte e inteligencia. Un buen EDA no le dice a la agroexportadora “la humedad causa el rechazo de arándanos”; le dice “aquí hay una relación que vale la pena investigar antes de invertir tiempo y dinero en confirmarla o descartarla”.

Ahora bien, entonces si debemos hacer las preguntas idóneas respecto a los datos que tenemos y para esto debemos manipularlos, ¿Cómo alistamos los datos para su manipulación? Para esto los datos deben estar simplificados —para facilitar su comprensión— y condensados —ya que todo aquello que profundiza más allá de la superficie hace que la descripción sea más eficaz—. Por ejemplo, es mucho mejor poder afirmar que un conjunto de valores está distribuido de forma aproximadamente simétrica en una escala logarítmica que decir que los valores brutos tienen una distribución muy asimétrica. Para ser exactos (cortos y correctos) en una realidad compleja, hace falta describirla con conceptos complejos.

Aquí pasa algo, ya que valoramos la simplificación de los datos, llegamos un punto en el que solo podemos abstraerlos a números. El EDA deposita una gran fe al conocimiento cuantitativo, se tiene la creencia que la mayoría de las preguntas clave de nuestro mundo, tarde o temprano, exigen respuestas a “¿cuánto?” en lugar de simplemente “¿en qué dirección?”.