Vai al contenuto

Applicare la data science per migliorare l'esperienza degli utenti della mobilità

I dati fanno luce sui desideri dei consumatori, ed è questo il motivo principale per cui molte aziende considerano la data science un fattore chiave nei propri piani strategici.

Víctor Navas
· 3 min di lettura
Pensilina dell'autobus vuota di notte con equazioni matematiche sovrapposte

Probabilmente non ti sorprenderà sentirti dire che, che ci piaccia o no, siamo costantemente circondati da dati. I progressi tecnologici degli ultimi decenni hanno portato internet su dispositivi portatili usati quotidianamente da moltissime persone. Ad aprile 2020 circa 4,57 miliardi di persone (il 59% della popolazione mondiale) avevano accesso a internet, e si stima che ogni persona generi circa 1,7 MB di dati al secondo [1]. Se confrontiamo questa cifra con la memoria dei nostri dispositivi elettronici di tutti i giorni, non sorprende che qualcuno pensi che viviamo nell'era dei big data. Ovunque andiamo, tutto ciò che compriamo può essere registrato. In questo senso i dati hanno fatto luce sui desideri dei consumatori, ed è questo il motivo principale per cui molte aziende considerano la data science un fattore chiave nei propri piani strategici.

Di fronte alla sfida di gestire grandi insiemi di dati empirici, la statistica ha un ruolo importante. Nella prima fase preliminare dell'analisi dei dati, gli algoritmi di data mining forniscono tecniche per gestire correttamente questi grandi insiemi. Anche se i numeri citati sono davvero impressionanti, è importante ricordare che non è possibile esplorare l'intero «universo dei dati»: i dati non ancora raccolti vanno persi e quelli in arrivo sono semplicemente sconosciuti. Per questo l'analisi statistica è sempre limitata a un determinato insieme di dati o campione, che comprende un numero limitato di eventi. Il passo successivo dell'analisi consiste nel descrivere questo campione per estrarre gli indicatori chiave di prestazione (KPI) fondamentali per qualsiasi attività. Ma quanto sono affidabili le informazioni ottenute da questo campione per caratterizzare l'intero «universo dei dati»?

Uno dei passaggi più importanti dell'analisi statistica consiste nell'inferire le proprietà dell'insieme (la popolazione, in termini statistici) sulla base delle informazioni disponibili in un campione. A differenza degli enunciati logici della matematica, del tipo «A implica B», gli enunciati generici dell'inferenza statistica sono caratterizzati da una probabilità di accadimento: «con una probabilità del 60%, A implica B». La mancanza di informazioni, insieme alla complessità intrinseca del sistema con cui si lavora, rende impossibile affermare qualcosa senza esitazioni. In questo contesto le distribuzioni di probabilità sono strumenti matematici essenziali che associano le probabilità di accadimento ai diversi eventi.

Il corpo principale della distribuzione di probabilità corrisponde agli eventi più comuni, che hanno una probabilità di accadimento relativamente alta. Tuttavia possono interessarci gli eventi estremi, il cui verificarsi potrebbe avere conseguenze gravi sulle prestazioni di un'attività. Ad esempio, nel campo della mobilità è molto improbabile che un utente debba aspettare più di tre ore per essere preso da un autobus. Ma se succede, la sua esperienza sarà estremamente negativa. Le informazioni sugli eventi estremi si trovano nella coda di queste distribuzioni e, anche se la loro probabilità può essere molto piccola rispetto a quella degli eventi comuni, non è nulla. La teoria dei valori estremi è la branca della probabilità che studia gli eventi estremi e le loro probabilità di accadimento [2]. In questa teoria è piuttosto comune distinguere tra code leggere, la cui probabilità è relativamente bassa rispetto al corpo della distribuzione, e code pesanti, la cui probabilità è relativamente alta.

Shotl sfrutta costantemente tecniche rigorose di data science per migliorare l'esperienza degli utenti. I nostri algoritmi di instradamento sono progettati in modo che le distribuzioni dei nostri KPI non presentino code pesanti. Questo significa che la probabilità che si verifichi un evento estremo è la più bassa possibile. Si possono adottare diverse strategie per evitare queste pericolose code pesanti. Ad esempio, l'algoritmo cercherà di scegliere un percorso ottimale minimizzando i KPI considerati negativi per l'esperienza dell'utente. Inoltre, sulla base dei risultati delle simulazioni, è possibile regolare alcuni parametri della configurazione dell'algoritmo per evitare il più possibile il verificarsi di eventi estremi.

Riferimenti

[1] Domo: Data Never Sleeps 8.0,

https://www.domo.com/learn/data-never-sleeps-8 (2020)

[2] De Haan, L. e Ferreira, A., Extreme value theory: an introduction, Springer Science & Business Media, (2007)

Approfondimenti sulla mobilità delle persone, una volta al mese

Decisioni di pianificazione, lezioni dai lanci e risultati da implementazioni reali — scritti per chi gestisce i servizi.

Una email al mese. Puoi annullare l’iscrizione quando vuoi · Informativa sulla privacy