Tech

Quando la statistica spiega la realtà

Quando la statistica spiega la realtà

Non molto tempo fa vi avevamo parlato della statistica, ossia di quella scienza che si occupa di studiare in quantità e qualità i fenomeni del mondo, in condizioni di incertezza (intesa come non completa conoscenza). Vi avevamo anche fornito qualche esempio di come la statistica può essere utile in vari ambiti, spaziando dall'economia a fenomeni di carattere generale. Oggi vogliamo darvi ancora qualche altro esempio di come la statistica sia davvero in ogni aspetto della nostra vita quotidiana.

Analisi di mercato

Il web è un mondo che elabora statistiche ogni giorno, tutti i giorni. Oggigiorno, la potenza dei computer, combinata ad un'ottima capacità di trasmissione dati, permette di elaborare una quantità di numeri inimmaginabile fino a pochi anni fa, e quindi di analizzare al meglio ogni singolo aspetto di un sito. Prima di approfondire questo aspetto, bisogna però fare un'importante considerazione.

La considerazione riguarda il fatto che la matematica non è un'opinione, e siccome la matematica è fatta di numeri, possiamo affermare che i numeri non sono un'opinione. Con questo vogliamo dirvi che un numero, quello è e quello resta, non subisce modifiche nello stesso momento in cui viene concepito o analizzato. Ogni numero è storia, ogni numero è legame con i fenomeni naturali, così come con i fenomeni che l'uomo crea e subisce.

A cosa ci serve la considerazione appena fatta? Serve per farci capire che spesso è conveniente tradurre ogni atteggiamento, ogni comportamento in numeri. Perché le parole "favorevole", "sfavorevole", "neutrale" sono difficili da quantificare, ma se noi, ad ogni aggettivo, assegniamo un numero, allora la quantificazione è ben che fatta. Ecco perché, nel questionario che avevamo lanciato qui su Tasc, trovavate dei numeri da 1 a 7: il numero 1 indicava la voce "Completamente in disaccordo", il numero 7 indicava la voce "Completamente d'accordo". E i numeri, una volta ottenuti, possono essere analizzati. È quello che abbiamo fatto noi, guardando ad alcuni aspetti. Per esempio, ci siamo chiesti se la qualità degli articoli potesse influenzare il ritorno alla lettura, ossia se il fatto che voi lettori torniate a leggere Tasc può dipendere da quanto i vari post vi sono piaciuti. Qualcuno di voi potrebbe dire: "Ci mancherebbe altro, siete un magazine!". In realtà, noi stiamo cercando di capire se davvero qualità va a braccetto con il ritorno dei lettori; è facilmente ipotizzabile, ma non è detto che sia così finché non ne  viene data la conferma. Il Cast se l'è chiesto, e si è dato una risposta.

La retta di regressione lineare

E per dare una risposta ci si è serviti di uno degli strumenti matematici più utilizzati in assoluto, e studiati in tutte le scuole superiori: la retta. La retta è un insieme di punti allineati tra loro, che seguono cioè la stessa direzione. La retta ha un'importante aspetto di fondo che tocca molti ambiti: rappresentata su di un piano cartesiano, indica che la relazione tra due variabili, tra due aspetti da indagare, cresce o decresce in modo costante; in altre parole, la variazione che passa da due punti vicini A e B è la stessa che passa tra altri due punti vicini tra loro C e D. Ipotizzare una variazione costante e sempre uguale ha molti significati. Ad esempio, in un'industria, l'aumento delle scorte di magazzino provoca costi sempre crescenti: più ordino, più devo pagare per conservare gli ordini; un po' diverso è invece il caso degli ordini da lavorare subito: come tutti di voi sapranno, più ordino, più è facile che il mio fornitore mi faccia uno sconto al crescere della quantità ordinata. Se non vi è facile capire quest'ultimo esempio, vi basti immaginare quando andate in un negozio di vostra fiducia e comprate 15 capi tutti uguali: probabilmente, il 15mo capo vi verrà regalato, proprio perché avete acquistato una tal quantità che al negozio garantisce già un ampio margine di guadagno. Immaginiamo invece che voi abbiate un ristorante, e il giorno d'apertura garantite 40 coperti; chiaramente la vostra dispensa è prevista per 40 persone. Nel tempo aumentate il vostro giro d'affari, e arrivate a garantire 80 coperti: l'aumento vi comporta il bisogno di maggiore spazio per stipare il cibo, quindi raddoppiate lo spazio della dispensa. E ancora, arrivate a 120 coperti: siete ora costretti a triplicare lo spazio della dispensa offerto quando avevate aperto. Eccola qui, la relazione lineare: ad ogni aumento di 40 coperti, dovete creare una nuova dispensa.

Gli esempi appena descritti ci fanno capire il vero senso della retta. In questo modo, vi viene più facile comprendere il significato di fondo che abbiamo cercato di analizzare nel nostro questionario: maggiore è la qualità degli articoli, maggiore è il ritorno degli utenti alla lettura, con una variazione (crescente o decrescente) costante. Ora bisogna fare un'altra importante considerazione, da tenere presente non solo in questo caso ma in tutti gli ambiti di analisi statistica.

Accuratezza, non perfezione

Poiché, come detto all'inizio dell'articolo, molto spesso non abbiamo la conoscenza completa della realtà, non possiamo pretendere di spiegarla perfettamente: come sarebbe possibile una cosa del genere? In altre parole, non bisogna pretendere, quando si fa statistica, di essere precisi e perfetti: è impossibile per definizione. Bisogna quindi porsi altri obiettivi: semplificarsi la realtà e ridurre l'errore al minimo. Ossia, cerchiamo di trovare un modello di fondo che cerchi di spiegare al meglio quando accade nella realtà, e che compia l'errore (che sicuramente faremo) più piccolo possibile. Difatti, proprio perché il modello è un modello e non la perfetta descrizione della realtà, dobbiamo accettare il fatto di sbagliare almeno un po'; è però nostro compito fare in modo che l'errore, nella teoria, sia effettivamente piccolo. Per rendervi più facile la comprensione, è come se dovessimo insegnare a dei ragazzi a giocare a pallone, e più precisamente ad effettuare un passaggio. Per fare questo esistono molti modi: con il collo del piede, con la punta del piede, con l'interno, con l'esterno. Chiaramente, il metodo migliore è l'interno del piede, perché consente un migliore controllo della direzione e un'adeguata facilità di movimento, e garantisce una minima possibilità di sbagliare. Ovviamente, i ragazzi non saranno sempre perfetti, ma se imparano a passare la palla con l'interno del piede faranno meno errori rispetto al caso in cui passino la palla con la punta del piede (non si riuscirebbe a comandare la direzione e la potenza).

Quindi, riassumendo, la statistica sa di sbagliare, ma si presuppone di trovare il modo per ridurre al minimo l'errore, per minimizzarlo. E la tecnica della derivata (la spiegazione, se vi può interessare, l'affidiamo a Wikipedia) ci consente di fare questo. Fatti alcuni conti, emergono delle soluzioni piuttosto interessanti. Ad esempio, il coefficiente angolare, ossia la pendenza della retta, dipende dalla covarianza e dalla varianza della variabile indipendente. La covarianza è un indice che quantifica l'esistenza di un rapporto tra due variabili (nel nostro caso, la qualità degli articoli e il ritorno alla lettura): se vale zero, non abbiamo correlazione tra i due aspetti e quindi non possiamo aspettarci una relazione di dipendenza. La varianza invece, è il grado di dispersione dei dati, e va applicata alla variabile indipendente (quella cioè che "sta in piedi da sola", che nasce da sé e non deriva da altri aspetti), nel nostro caso la qualità degli articoli. Per spiegare la varianza, riprendiamo l'esempio del già citato articolo sulla statistica. Prendiamo quindi due persone, A e B, che fanno due compiti in classe. A prende 5 e 7, B prende 4 e 8. Tutti e due hanno media 6, ma A è più vicino alla media di quanto non lo sia B; ha quindi varianza minore.

Ora, i conti ve li evitiamo; vi facciamo però vedere cosa è stato ottenuto.

Ora, dando una prima occhiata, potrebbe sembrare che i punti non siano molto vicini alla retta. In realtà, bisogna fare una considerazione. Affinché esista una buona relazione, come abbiamo detto i punti devono essere situati sulla retta stessa, il che significa che molti utenti, sia alla domanda "Quanto sei soddisfatto della qualità degli articoli" sia alla domanda "Tornerai a leggere spesso Tasc?" dovrebbero aver risposto con lo stesso punteggio (per esempio, 5 e 5 o 6 e 6). Come si può osservare, in realtà molti punti non sono sulla retta stessa, ma ci sono molto vicini (il che significa, ad esempio, 5 e 6 o 6 e 5). I punti vicini alla retta in realtà corrispondono ad un'alta proporzione di utenti (120 su 160 circa), quindi i punti più distanti dalla retta sono l'espressione dei voti di soltanto 40 persone circa. A dire la verità, anche quei punti più distanti dalla retta non sono certamente agli antipodi rispetto alla retta stessa, il che indica comunque una certa coerenza tra la qualità degli articoli e il ritorno alla lettura. Insomma, ciò che avevamo ipotizzato (ossia i lettori tornano più volentieri a leggere Tasc se la qualità è piuttosto alta) sembra essere accettabile anche nella realtà. A ulteriore conferma di questo c'è un particolare indice, chiamato R quadro, che assume il valore 94,51%: in altre parole, la retta riesce a prevedere/analizzare correttamente 94-95 risposte su 100.

Serie storiche

Altro aspetto importante che la statistica analizza è il fatto che quanto facciamo nella nostra vita, in ogni momento, è spesso dovuto a scelte che abbiamo compiuto prima di tali momenti. Per farvi capire meglio facciamo un semplice esempio. Immaginate che oggi è la prima volta che leggete Tasc; se vi piace, probabilmente in futuro leggerete il magazine un'altra volta. E se anche in questa volta rimarrete piacevolmente colpiti o attratti, probabilmente ritornerete un'altra volta ancora. E via così, fin quando raggiungerete un punto in cui più o meno terrete costante il ritmo di accessi al sito, ovviamente facendo qualche variazione. In altre parole, è possibile sapere il comportamento di fondo, che alla fine è sintetizzabile in un qualche modello che è possibile analizzare, studiare, approfondire.

Stiamo quindi parlando di un effetto storico, ossia del fatto che la situazione in cui ci si trova in un preciso momento è determinata dalle nostre scelte precedenti, un po' come accade in quasi ogni momento della nostra vita. Pertanto, sembra intuitivo ipotizzare la possibilità di prevedere scelte future se riusciamo a conoscere il modo in cui abbiamo fatto alcune scelte nel passato. Questo è proprio il compito delle serie storiche.

Per poter capire tali comportamenti abbiamo ovviamente bisogno di tutti i precedenti storici. Per farvi un esempio, l'immagine poco sopra indica la percentuale di iscritti all'università a seconda del sesso, dall'anno accademico 1951/1952 a quello 2009/010. Vogliamo però fare un esempio più concreto, e per questo abbiamo preso il numero di sessioni giornaliere di accesso a Tasc dal I gennaio 2014 al 15 Luglio 2014. Ecco quanto emerge da una prima analisi (Attenzione! I numeri di accesso non sono reali, ma sono stati opportunamente modificati; in ogni caso ciò non compromette le analisi che faremo di seguito).

L'asse orizzontale del grafico indica il tempo, l'asse verticale indica il numero di visite; ogni punto all'interno del grafico specifica quindi il numero di sessioni per un determinato giorno. Dando un'occhiata non troppo approfondita, si possono notare due cose: primo, il numero delle sessioni sembra oscillare intorno ad un valore medio evidenziato dalla linea tratteggiata blu; secondo, emerge un insieme di valori assolutamente fuori dalla media, per un periodo che circa va dal 15 di Febbraio ai primi di Marzo.

Fatte queste considerazioni, passiamo all'analisi vera e propria. Per questo aspetto, è importante riprendere il concetto di covarianza prima espresso e modificarlo un po'. Difatti, questa volta non abbiamo più due variabili,due fenomeni diversi da studiare, ma soltanto uno: il numero di sessioni giornaliere. Per questo ora andremo a parlare di autocovarianza, ossia l'indicazione di correlazione del fenomeno stesso in due tempi diversi. In altre parole: se ieri ci sono state 850 sessioni e oggi 900, possiamo dire che le sessioni di oggi dipendano in qualche modo da quelle di ieri? Nel caso di Tasc, ciò significa chiedersi se gli articoli di ieri influenzano le sessioni di oggi. In prima linea, si potrebbe dire di sì ma, come nel caso precedente, è necessario confermare tale ipotesi.

Passiamo pertanto ad analizzare l'autocovarianza per diversi istanti di tempo. In pratica, ci stiamo chiedendo quanto le sessioni di oggi dipendano da quelle di ieri, da quelle dell'altro-ieri, da quelle precedenti all'altro-ieri. Lo sfasamento temporale viene definito lag; pertanto, se studiamo la relazione tra oggi e ieri o tra ieri e l'altro-ieri, abbiamo il lag 1; se studiamo la relazione tra oggi e l'altro-ieri o tra ieri e tre giorni fa abbiamo il lag 2, e così via. Tutte queste formule possono essere espresse in un grafico:

Le barre rosse indicano il valore dell'autocovarianza: se sono prossime allo zero ciò significa che non esiste una correlazione tra i due istanti temporali indicati. Se tali barre non superano la linea blu, si può dire che l'autocovarianza ha un valore piuttosto esiguo tale da indicare un'assenza di correlazione. Quelle barre che superano la linea blu sono addirittura nove: ciò significa che si può ipotizzare, ad esempio, che effettivamente il numero di sessioni nel tempo t dipende dal numero di sessioni dei giorni precedenti. Ma quelle che più ci interessano sono le prime quattro - cinque barre, in particolare la prima: guardando a quest'ultima, il suo valore piuttosto alto sta ad indicare che il numero di sessioni di oggi dipende fortemente dal numero di sessioni di ieri, così come il numero di sessioni di ieri dipende fortemente dal numero di sessioni di due giorni fa, e così via. Con un software andiamo allora ad indagare quanto effettivamente tali dipendenze valgono. E ciò che otteniamo è questo:

Come è possibile vedere, ora siamo riusciti a ridurre tutte quelle iniziali barre rosse che andavano oltre le linee blu. Per ottenere questo risultato abbiamo chiesto al software di immaginare che le sessioni in un determinato istante temporale dipendano proprio dagli istanti temporali (giorni) precedenti. Qual è il senso di fare ciò? Immaginate di avere un negozio di abbigliamento; ovviamente, le vostre vendite, nel periodo natalizio, aumentano; sapete però quantificare le vostre vendite senza considerare questo effetto stagionale? Potete chiaramente ipotizzare un valore che rispecchi la media di tutto l'anno, ma non ne sarete mai perfettamente certi. Se avete tutti i dati, le tecniche che abbiamo utilizzato permettono di ottenere risultati piuttosto precisi. Ora, noi abbiamo fatto la stessa cosa, abbiamo cioè detto al computer: "Toglimi, da ogni giorno, l'effetto di visite dovuto al giorno prima". Il risultato finale? È un equazione. Chiamando Y(t) il numero di accessi al tempo t, Y(t-1) il numero di sessioni del giorno precedente a t e Y(t-2) il numero di sessioni del giorno t-2 , si ottiene che:

Y(t) = 0.953*Y(t-1) - 0.195*Y(t-2) + e(t)

dove e(t) indica che il modello che abbiamo stimato ora contiene degli errori rispetto a quanto si può veramente osservare. Quali sono questi errori? Quasi certamente possiamo considerarli come le sessioni fatte nello stesso istante di tempo t che si analizza (in altre parole, quegli utenti che leggono, al tempo t, gli articoli usciti lo stesso giorno t).

I dadi

Sempre nell'articolo sulla statistica, in fondo vi avevamo lasciato un piccolo giochetto da fare. Il gioco diceva: "Immaginate di aver giocato, ad esempio, a Monopoli. La partita con i vostri amici è durata, facciamola grande, tre ore. Siete capaci di dire qual è la media del punteggio che avete ottenuto lanciando i dadi?". La soluzione ve la diamo subito: è 3.5. Come mai questo risultato? Cerchiamo di spiegarlo in parole semplici. Presupposto l'uso di un dado non truccato (sei facce, ognuna contenenti numeri diversi da 1 a 6), ogni volta che lanciamo il dado in aria lo facciamo - in teoria - casualmente, quindi ci aspettiamo risultati spesso diversi l'uno dall'altro; il fatto è che ogni faccia, quindi ogni numero da 1 a 6, ha la stessa probabilità di uscire, pari a 1/6. Inoltre, se consideriamo di fare una partita a Monopoli lunga tre ore come il problema richiede, faremo assolutamente molti, molti lanci, e questo, per la legge dei grandi numeri (anche questa citata nell'articolo sulla statistica), porta ad avere che ogni numero uscirà più o meno con la stessa frequenza rispetto ad ogni altro. In altre parole, se facciamo, ad esempio, 2400 lanci, avremo che il numero 1, il 2, il 3, il 4, il 5 e il 6 usciranno circa 400 volte ciascuno. A questo punto, facciamo la somma finale: abbiamo 400 volte il numero 1, 400 volte il numero 2, 400 volte il numero 3, 400 volte il numero 4, 400 volte il numero 5 e 400 volte il numero 6. La somma finale è:

400*1 + 400*2 + 400*3 + 400*4 + 400*5 + 400*6 = 400 + 800 + 1200 + 1600 + 2000 + 2400 = 8400

Questa è, appunto, la somma dei valori ottenuti con 2400 lanci di dadi. Se facciamo la media, il numero che troviamo è il valore che il dado esprime ogni volta che viene lanciato. E, facendo 8400/2400, otteniamo proprio 3.5. Tale risultato in realtà sarebbe più facile da trovare. Difatti, immaginando una partita con solo 6 lanci di dadi, e considerando che ogni faccia esce con probabilità 1/6, avremmo che esce ogni numero. Quindi, in 6 lanci, otteniamo l'1, il 2, il 3, il 4, il 5 e il 6. Anche qui, facciamo la media tra i valori, e otteniamo che (1 + 2 +3 + 4 + 5 + 6)/6 = 21/6 = 3.5. Questo risultato è però un po' sfalsato: ricordiamo che la legge dei grandi numeri indica che più la numerosità dell'evento aumenta, più l'aspetto pratico si avvicina all'aspetto teorico. L'ultimo risultato ottenuto è quindi sì valido, ma molto distante dalla realtà; provate infatti a considerare 6 lanci di dado come un singolo evento e ripetete tale evento più e più volte,  e vedrete che in pochissimi eventi otterrete 6 numeri diversi.

Analisi dei gruppi

Altro esempio che riguarda l'utilità della statistica è l'analisi dei gruppi. Concetto importante per un'azienda nell'ambito della definizione delle strategie commerciali è capire il mercato nel quale si vuole operare; in altre parole, il prodotto che un'azienda realizza viene visto/usato/concepito in modi e scopi diversi da persona a persona. Quindi, per attirare l'interesse di potenziali clienti, è necessario capire che una strategia unificata non può andar bene per tutti, proprio perché ognuno ha bisogni/intenzioni diversi. Diventa quindi fondamentale suddividere il mercato in gruppi che siano omogenei al loro interno ma, appunto, diversi tra loro.Un esempio? Usiamo come "cavia" l'iPhone: c'è chi lo prende perché è bello, chi lo prende perché è funzionale, chi lo prende perché ha un vastissimo ecosistema di applicazioni e così via. Ognuno di questi è un gruppo, all'interno di ciascuno dei quali le persone hanno sensazioni simili ma che all'esterno sono, appunto, molto diversi tra loro.

L'analisi dei gruppi però è associabile anche alle persone. E per questo facciamo l'esempio di 6 persone che vengono valutate per le loro prestazioni lavorative in termini di cortesia, competenza, capacità di lavorare in gruppo, flessibilità e capacità organizzative. Lo scopo è vedere quanto tali persone siano simili tra loro per questi aspetti, e in che modo possono essere raggruppate. Questa volta non stiamo qui a spiegarvi come funziona il procedimento, ma vi portiamo direttamente al risultato finale, esprimibile tramite un grafico chiamato dendrogramma:

Cosa si può vedere da questo grafico? Le persone 4 e 5 (gruppo A) sono molto simili, così come lo sono le persone 2 e 6 (gruppo B); simili, ma non quanto i due gruppi appena citati, lo sono anche le persone 1 e 3 (gruppo C). Il gruppo C e il gruppo A possono a loro volta essere uniti formando un gruppo (il D) che sì presenta caratteristiche simili al suo interno, ma non tanto quanto i singoli gruppi A, B e C. In pratica, più la distanza (ossia la diversità tra le caratteristiche, e quindi la differenza tra i punteggi ottenuti) aumenta, più grandi sono le differenze all'interno di ogni gruppo, fino ad arrivare all'ultima linea orizzontale, quella che unisce il gruppo D e il gruppo B, che racchiude tutte le 6 unità scopo dell'indagine. Pertanto, riassumendo: abbiamo 3 gruppi piccoli sostanzialmente diversi tra loro: A (persone 4 e 5), B (2 e 6) e C (1 e 3); A e C possono essere uniti a formare il gruppo D, che risulta piuttosto diverso dal gruppo B; l'unione finale dei due gruppi D e B riporta alla situazione di partenza.