Aplicar la ciencia de datos para mejorar la experiencia de los usuarios de la movilidad
Los datos arrojan luz sobre los deseos de los consumidores, y esa es la principal razón por la que muchas empresas consideran la ciencia de datos un factor clave en sus planes estratégicos de negocio.

Seguramente no te sorprenderá que alguien te diga que, te guste o no, estamos constantemente rodeados de datos. Los avances tecnológicos de las últimas décadas han llevado internet a dispositivos portátiles que mucha gente usa a diario. En abril de 2020, unos 4.570 millones de personas (el 59 % de la población mundial) tenían acceso a internet, y se calcula que cada persona genera unos 1,7 MB de datos por segundo [1]. Si comparamos esta cifra con la capacidad de almacenamiento de nuestros dispositivos electrónicos cotidianos, no es de extrañar que haya quien crea que vivimos en la era del big data. Allá donde vamos, todo lo que compramos puede quedar registrado. En este sentido, los datos han arrojado luz sobre los deseos de los consumidores, y esa es la principal razón por la que muchas empresas consideran la ciencia de datos un factor clave en sus planes estratégicos de negocio.
Ante el reto de trabajar con grandes conjuntos de datos empíricos, la estadística desempeña un papel importante. En el primer paso preliminar del proceso de análisis de datos, los algoritmos de minería de datos aportan técnicas para tratar adecuadamente estos grandes conjuntos. Aunque las cifras mencionadas son realmente asombrosas, hay que tener en cuenta que no es posible explorar todo el «universo de datos»: los datos que aún no se han recogido se pierden, y los datos que están por llegar simplemente se desconocen. Por eso, el análisis estadístico siempre se limita a un conjunto de datos o muestra concreta que abarca un número limitado de sucesos. El siguiente paso del análisis consiste en describir esta muestra para extraer los indicadores clave de rendimiento (KPI) fundamentales para cualquier negocio. Pero ¿hasta qué punto es fiable la información obtenida de esta muestra para caracterizar todo el «universo de datos»?
Uno de los pasos más importantes del análisis estadístico consiste en inferir las propiedades del conjunto (la población, en términos estadísticos) a partir de la información disponible en una muestra. A diferencia de los enunciados lógicos de las matemáticas, del tipo «A implica B», los enunciados genéricos que se formulan en la inferencia estadística se caracterizan por una probabilidad de ocurrencia: «con una probabilidad del 60 %, A implica B». La falta de información, junto con la complejidad inherente al sistema con el que se trabaja, hace imposible afirmar algo sin vacilar. En este contexto, las distribuciones de probabilidad son herramientas matemáticas esenciales que relacionan las probabilidades de ocurrencia con distintos sucesos.
El cuerpo principal de la distribución de probabilidad corresponde a los sucesos más comunes, que tienen una probabilidad de ocurrencia relativamente alta. Sin embargo, puede interesarnos estudiar los sucesos extremos, cuya aparición podría tener consecuencias graves para el rendimiento de un negocio. Por ejemplo, en el ámbito de la movilidad, es muy poco probable que un usuario tenga que esperar más de tres horas a que le recoja un autobús. Pero, si ocurre, su experiencia será extremadamente negativa. La información sobre los sucesos extremos se encuentra en la cola de estas distribuciones de probabilidad y, aunque su probabilidad pueda ser muy pequeña en comparación con la de los sucesos comunes, no es nula. La teoría de valores extremos es la rama de la probabilidad que estudia los sucesos extremos y sus probabilidades de ocurrencia [2]. En el marco de esta teoría, es bastante habitual distinguir entre colas ligeras, cuya probabilidad es relativamente baja en comparación con el cuerpo de la distribución, y colas pesadas, cuya probabilidad es relativamente alta.
Shotl aprovecha constantemente técnicas rigurosas de ciencia de datos para mejorar la experiencia de los usuarios. Nuestros algoritmos de rutas están diseñados para que las distribuciones de nuestros KPI no presenten colas pesadas. Esto implica que la probabilidad de que se produzca un suceso extremo sea la menor posible. Se pueden adoptar distintas estrategias para evitar estas peligrosas colas pesadas. Por ejemplo, el algoritmo intentará elegir una ruta óptima minimizando los KPI que se consideran negativos para la experiencia de usuario. Además, a partir de los resultados de las simulaciones, es posible ajustar algunos parámetros de la configuración del algoritmo para evitar en la medida de lo posible la aparición de sucesos extremos.
Referencias
[1] Domo: Data Never Sleeps 8.0,
https://www.domo.com/learn/data-never-sleeps-8 (2020)
[2] De Haan, L. y Ferreira, A., Extreme value theory: an introduction, Springer Science & Business Media, (2007)


