Por Amadeus Latam La analogía que me gusta utilizar para describir lo que hago para mis amigos científicos es el proceso de convertir carbón en diamantes. Los datos desordenados y fragmentados son el ‘carbón’ y los ‘diamantes’ son los aportes significativos a partir de datos que pueden ayudar a las empresas a tomar decisiones fundamentadas. Después de mucho tiempo y presión, convertimos datos, que no son nada más que hechos y cifras, en información con relevancia y propósito. Pero durante este proceso, se debe seguir un número etapas antes de que se puedan tomar decisiones fundamentadas. A continuación, una lista de las 10 cosas que me gustaría que la mayoría de la gente entendiera sobre el proceso de extracción de datos:
  1. Cosecha: En primer lugar, tiene que recuperar los datos. Si tiene suerte, puede ser algo simple como sincronizar archivos o llamar API web (in)documentadas. En otros casos, tiene que desarrollar un scraper web (raspado de páginas web) dedicado para cada fuente de datos y mantenerla para lidiar con la página web en evolución.
  2. Almacenamiento: Hay pocas posibilidades de que el servicio remoto permanezca disponible, por lo que debe almacenar los datos descargados en el llamado ‘lago de datos’. El lago de datos acepta todo tipo de formatos de datos, incluyendo los más raros, y también muestra una ruta fácil (pero controlada) de datos en bruto. Es importante almacenar los datos en bruto y no sólo algunas formas derivadas, siempre y cuando nuestro conocimiento sobre los datos en bruto crezca con el paso del tiempo.
  3. Munging (Alteración): Es un proceso fundamental pero olvidado a menudo que unifica los conjuntos de datos desordenados y diferentes en un formato común y limpio. A menudo se dice que la limpieza de datos consume más del 80% del tiempo de un científico de datos. Los errores siempre se introducen en grandes conjuntos de datos, especialmente cuando están repartidos en un largo intervalo de tiempo. Debido a la naturaleza de los errores, munging es un proceso semiautomático que siempre necesitará la intervención humana.
  4. Calidad de Datos: Debido a la constante evolución de los datos y de las fuentes de datos, la supervisión de calidad es una parte del procesamiento de datos que va de la mano con la búsqueda de las causas fundamentales de las alertas de calidad. Por ejemplo, si la capacidad de un aeropuerto cae repentinamente, ¿podría haber un error en los datos de origen, o puede que se produjera una interrupción importante en el aeropuerto? Es necesaria una revisión de la realidad combinada con una continua manipulación de datos.
  5. Intuición: Como un científico de datos, es necesario comprender los conjuntos de datos. Lo más probable es que calculé algunas estadísticas básicas (totales, promedios, y de propagación) y diseñar muchos gráficos (de dispersión, líneas de tendencia, etc.) para tener una idea de lo que es interesante. Durante esta exploración, el científico de datos comienza elaborando una historia y explicando los datos en un contexto empresarial. Herramientas interactivas como IPython, R y Excel son comúnmente utilizadas, pero las herramientas de línea de comandos como awk o gnuplot también son igualmente efectivas.
  6. Análisis & Modelado: Este proceso abarca desde la extracción KPI simple hasta el modelado de datos altamente avanzados y el aprendizaje automático. Las técnicas requieren habilidades matemáticas y teóricas, pero son sólo un aspecto del modelo de ciclo de vida. ¿Cómo reacciona un modelo de tráfico aéreo para corregir datos excepcionales como por ejemplo una caída repentina de pasajeros durante la erupción del volcán Eyjafjallajökull? ¿El modelo puede ser actualizado fácilmente? Algunos modelos son en tiempo real y requieren una rápida implantación, para lo cual es indispensable una estrecha integración con DevOps.
  7. Big Data: No asuma automáticamente que necesita un grupo de Big Data para su trabajo de datos. Algunos pequeños problemas encajan perfectamente en el map-reduce o en el paradigma Spark, mientras que algunos grandes problemas no funcionarían con un enfoque distribuido. Las agrupaciones vienen con los gastos generales y bajos precios para las unidades RAM y SSD, lo que permite trabajos de datos ejecutados en una única máquina. Incluso Excel combinado con PowerPivot recorre un largo camino.
  8. Conocimiento de Campo: Datos sin experiencia de campo continúan siendo nada más que hechos y cifras. El conocimiento de campo se adquiere realizando muchas preguntas, que es por lo que la curiosidad y pasión a menudo se dice que son cualidades necesarias en un científico de datos. Por ejemplo, no debería aceptar valores extremos como meras excepciones. En la mayoría de los casos hay una historia detrás de los valores extremos, lo que eventualmente contribuye a su conocimiento de campo.
  9. Comunicación: Al final, sus descubrimientos tienen que ser comunicados en términos no técnicos y claros para que todo el mundo pueda entender las ideas. Los resultados del modelado continúan siendo una serie de números que tienen que traducirse en un gráfico. La visualización es una etapa crucial en el procesamiento de datos. La construcción de visualizaciones convincentes requiere un conjunto especial de habilidades interpersonales que son difíciles de precisar; se asientan entre el arte, la ciencia y la narración.
  10. Contexto Humano: Existen algunos recursos interesantes que utilizan datos en servicio de la humanidad.DataKind organiza ‘inmersiones de datos’ en los que los científicos de datos pro bono colaboran con ONG para abordar problemas humanitarios. La Fundación Openknowledge se esfuerza por liberar la mayor cantidad de datos posible y reúne herramientas de código abierto que ayudan a los datos del proceso. Estas organizaciones tratan de desbloquear información y crear un acceso fácil a datos abiertos. Esto impulsa a todo el mundo para ayudar a exponer las desigualdades. En el mismo espíritu de datos abiertos, los científicos de datos de Amadeus mantienen con mucho cuidado una colección de datos de viajes y ocio relacionados.