Aplicar la ciència de dades per millorar l'experiència dels usuaris de la mobilitat
Les dades aporten llum sobre els desitjos dels consumidors, i aquesta és la principal raó per la qual moltes empreses consideren la ciència de dades un factor clau en els seus plans estratègics de negoci.

Segurament no et sorprendrà que algú et digui que, t'agradi o no, estem constantment envoltats de dades. Els avenços tecnològics de les últimes dècades han portat internet a dispositius portàtils que molta gent fa servir a diari. A l'abril del 2020, uns 4.570 milions de persones (el 59 % de la població mundial) tenien accés a internet, i es calcula que cada persona genera uns 1,7 MB de dades per segon [1]. Si comparem aquesta xifra amb la capacitat d'emmagatzematge dels nostres dispositius electrònics quotidians, no és estrany que hi hagi qui cregui que vivim a l'era del big data. Allà on anem, tot el que comprem pot quedar registrat. En aquest sentit, les dades han aportat llum sobre els desitjos dels consumidors, i aquesta és la principal raó per la qual moltes empreses consideren la ciència de dades un factor clau en els seus plans estratègics de negoci.
Davant del repte de treballar amb grans conjunts de dades empíriques, l'estadística té un paper important. En el primer pas preliminar del procés d'anàlisi de dades, els algorismes de mineria de dades aporten tècniques per tractar adequadament aquests grans conjunts. Encara que les xifres esmentades són realment sorprenents, cal tenir en compte que no és possible explorar tot l'«univers de dades»: les dades que encara no s'han recollit es perden, i les dades que han d'arribar simplement es desconeixen. Per això, l'anàlisi estadística sempre es limita a un conjunt de dades o mostra concreta que abasta un nombre limitat de successos. El pas següent de l'anàlisi consisteix a descriure aquesta mostra per extreure els indicadors clau de rendiment (KPI) fonamentals per a qualsevol negoci. Però fins a quin punt és fiable la informació obtinguda d'aquesta mostra per caracteritzar tot l'«univers de dades»?
Un dels passos més importants de l'anàlisi estadística consisteix a inferir les propietats del conjunt (la població, en termes estadístics) a partir de la informació disponible en una mostra. A diferència dels enunciats lògics de les matemàtiques, del tipus «A implica B», els enunciats genèrics que es formulen en la inferència estadística es caracteritzen per una probabilitat d'ocurrència: «amb una probabilitat del 60 %, A implica B». La manca d'informació, juntament amb la complexitat inherent al sistema amb què es treballa, fa impossible afirmar res sense vacil·lar. En aquest context, les distribucions de probabilitat són eines matemàtiques essencials que relacionen les probabilitats d'ocurrència amb diferents successos.
El cos principal de la distribució de probabilitat correspon als successos més comuns, que tenen una probabilitat d'ocurrència relativament alta. Tanmateix, ens pot interessar estudiar els successos extrems, l'aparició dels quals podria tenir conseqüències greus per al rendiment d'un negoci. Per exemple, en l'àmbit de la mobilitat, és molt poc probable que un usuari hagi d'esperar més de tres hores que el reculli un autobús. Però, si passa, la seva experiència serà extremadament negativa. La informació sobre els successos extrems es troba a la cua d'aquestes distribucions de probabilitat i, encara que la seva probabilitat pugui ser molt petita en comparació amb la dels successos comuns, no és nul·la. La teoria de valors extrems és la branca de la probabilitat que estudia els successos extrems i les seves probabilitats d'ocurrència [2]. En el marc d'aquesta teoria, és bastant habitual distingir entre cues lleugeres, la probabilitat de les quals és relativament baixa en comparació amb el cos de la distribució, i cues pesades, la probabilitat de les quals és relativament alta.
Shotl aprofita constantment tècniques rigoroses de ciència de dades per millorar l'experiència dels usuaris. Els nostres algorismes de rutes estan dissenyats perquè les distribucions dels nostres KPI no presentin cues pesades. Això implica que la probabilitat que es produeixi un succés extrem sigui la menor possible. Es poden adoptar diferents estratègies per evitar aquestes perilloses cues pesades. Per exemple, l'algorisme intentarà triar una ruta òptima minimitzant els KPI que es consideren negatius per a l'experiència d'usuari. A més, a partir dels resultats de les simulacions, és possible ajustar alguns paràmetres de la configuració de l'algorisme per evitar en la mesura del possible l'aparició de successos extrems.
Referències
[1] Domo: Data Never Sleeps 8.0,
https://www.domo.com/learn/data-never-sleeps-8 (2020)
[2] De Haan, L. i Ferreira, A., Extreme value theory: an introduction, Springer Science & Business Media, (2007)


