«Raw Data Is an Oxymoron»: perché il dato non è e non può essere neutro

“Dato” viene dal latino “datum”. Più precisamente, però, un dato è qualcosa che qualcuno ha deciso di prendere.



Nell’immaginario comune e nella ricerca, i dati vengono intesi come il mezzo per fotografare la realtà in maniera oggettiva. Si fa spesso riferimento alla natura parziale e convenzionale dei modelli statistici e, in generale, di tutti i prodotti dei dati. Tuttavia, il problema è molto più radicale e dipende da un vizio intrinseco del dato stesso.


Immaginiamo un modulo di iscrizione a una palestra.

Una domanda: "Qual è il tuo obiettivo principale?". Cinque risposte possibili: perdere peso, aumentare la massa muscolare, migliorare la resistenza, ridurre lo stress, altro. Chi lo compila sceglie una casella; chi lo analizza, qualche mese dopo, legge che la maggior parte degli iscritti vuole perdere peso.

Quel risultato non descrive le persone. Descrive le persone viste attraverso cinque caselle. Chi voleva tornare a camminare dopo un infortunio è finito in "altro", oppure in "migliorare la resistenza", perché era la voce più vicina. Chi aveva due obiettivi ha dovuto sceglierne uno. Chi si iscrive per passare del tempo con gli amici non ha trovato la sua risposta.


Prima ancora che qualcuno rispondesse, il modulo aveva già deciso cosa poteva esistere nei dati. In questo senso, il dato non è neutro ma dipende, per esempio, dal set di risposte possibili immaginate da chi ha scritto le domande o dal numero finito di informazioni che ha deciso di raccogliere.

Dati crudi e dati cotti

Nel linguaggio di tutti i giorni, e ancora di più in quello aziendale, parliamo di "dati grezzi". L'espressione suggerisce che esista uno stato originario del dato, puro, prima di ogni intervento umano, e che il lavoro dell'analista cominci dopo.

Nel 2005 Geoffrey Bowker, studioso di storia della scienza e delle infrastrutture informative, ha scritto una frase che smonta questa idea: "'raw data' is both an oxymoron and a bad idea". Il dato grezzo è una contraddizione in termini e anche un'idea dannosa.

Otto anni dopo, la storica dei media Lisa Gitelman ha usato la prima metà di quella frase come titolo di un volume collettivo, nella cui introduzione Virginia Jackson ha una tesi netta: i dati devono essere immaginati come dati per poter esistere e funzionare come tali. Qualcuno deve decidere che una certa porzione del mondo è rilevante, che va separata dal resto, contata, registrata in un formato. Per usare la metafora del libro, i dati sono sempre già cotti.

Uno dei saggi del volume, firmato dallo storico Daniel Rosenberg, ricostruisce come la parola "data" sia entrata nella lingua inglese. La sua funzione, osserva, è retorica prima ancora che tecnica: il dato è ciò che si dà per acquisito prima di cominciare a discutere.

Data e capta

L'italiano rende il problema ancora più evidente dell'inglese. "Dato" è il participio passato di dare: ciò che ci è stato dato. La parola stessa ci invita a pensare che il mondo ci consegni i suoi numeri già pronti, e che il nostro compito sia solo raccoglierli.

Nel 2011 Johanna Drucker, studiosa di storia del libro e di cultura visiva, ha proposto di cambiare parola. Invece di data, dal latino dare, Drucker suggerisce capta: letteralmente, “cose raccolte” o “catturate”. L’obiettivo è esplicitare come il dato non ci venga consegnato ma sia intenzionalmente raccolto, con strumenti ed in categorie per un fine predeterminato.

Non è un gioco di parole fine a sé stesso. Cambiare verbo cambia la domanda che ci facciamo davanti a una tabella. Con "dato" ci chiediamo cosa dice. Con "preso" ci chiediamo anche chi l'ha preso, con quale strumento, e cosa è rimasto fuori dalla rete.


Torniamo al modulo della palestra.

Secondo questo cambio di prospettiva, gli iscritti non ci hanno raccontato e consegnato i loro obiettivi; piuttosto, il modulo cattura una parte della realtà nelle maglie delle categorie e lascia “sfuggire” il resto.


Chi decide cosa si conta

Se ogni dato è una scelta, la domanda successiva è inevitabile: chi sceglie?

Nel 2016 Mimi Onuoha ha costruito un'installazione intitolata The Library of Missing Datasets: uno schedario bianco pieno di cartelle vuote. Su ogni cartella c'è il nome di un insieme di dati che nessuno ha mai raccolto, pur vivendo in società saturate di misurazioni.
Quello che non viene contato non entra nelle statistiche, e quello che non entra nelle statistiche fatica a entrare nelle decisioni. (NdR: ne abbiamo parlato anche a proposito dei dati invisibili delle città.)

Un esempio concreto viene dalla medicina. Dal 1977 al 1993 le autorità sanitarie statunitensi raccomandarono di escludere le donne in età fertile dalle prime fasi di sperimentazione dei farmaci, per proteggere eventuali gravidanze. Per sedici anni, di fatto, molti farmaci furono studiati quasi solo su uomini.
Gli effetti di questa lacuna nei dati si vedono ancora oggi. Per citarne uno, nel 2013 la FDA ha dimezzato la dose raccomandata per le donne di zolpidem, un sonnifero molto diffuso: l’organismo femminile elimina il farmaco più lentamente degli uomini, di fatto aumentando il rischio di sonnolenza alla guida anche a distanza di molte ore. E parliamo di un farmaco in commercio da oltre venti anni.

Cosa cambia per chi usa i dati?

A questo punto si potrebbe pensare che la conclusione ovvia sia un relativismo assoluto, ma sarebbe la conclusione sbagliata. I numeri restano lo strumento migliore che abbiamo per vedere oltre l'esperienza individuale: il punto non è rinunciare ai dati, ma smettere di ignorare le scelte che li hanno prodotti.

Una proposta concreta viene dal mondo dell'apprendimento automatico. Nel 2018 un gruppo di ricercatori guidato da Timnit Gebru ha suggerito di accompagnare ogni dataset con una scheda descrittiva, sul modello delle schede tecniche che accompagnano i componenti elettronici.

Non serve essere un laboratorio di ricerca per adottare questa abitudine. Un'azienda che analizza i propri clienti, una fondazione che misura l'impatto dei propri progetti, un centro sportivo che legge i questionari di iscrizione possono tutti tenere traccia delle scelte che stanno dietro ai propri numeri. È una forma di onestà metodologica, ed è anche la condizione per usare bene qualsiasi strumento di intelligenza artificiale: un modello impara dai dati esattamente come sono stati presi, comprese le caselle che mancavano.

Ogni tabella che arriva sul tavolo di chi decide contiene una serie di scelte già fatte: quali domande porre, quali categorie offrire, cosa contare e cosa lasciare fuori. Di solito quelle scelte viaggiano in silenzio. Chi ha costruito il modulo non incontra chi legge il report, e chi legge il report non vede le caselle che mancavano.

Namidia serve anche a questo: raccontare gli studi, le idee e i casi che mostrano cosa succede quando misuriamo, deleghiamo e automatizziamo. Non per diffidare dei numeri, ma per leggerli meglio.

Bibliografia

  • Bowker G. C. (2005), Memory Practices in the Sciences, MIT Press.

  • D'Ignazio C., Klein L. F. (2020), Data Feminism, MIT Press.

  • Drucker J. (2011), Humanities approaches to graphical display, Digital Humanities Quarterly 5(1).

  • Gebru T., Morgenstern J., Vecchione B., Wortman Vaughan J., Wallach H., Daumé III H., Crawford K. (2021), Datasheets for datasets, Communications of the ACM 64(12), 86 a 92.

  • Gitelman L. (a cura di) (2013), "Raw Data" Is an Oxymoron, MIT Press. Introduzione di L. Gitelman e V. Jackson.

  • Onuoha M. (2016), The Library of Missing Datasets, installazione.

  • Rosenberg D. (2013), Data before the fact, in Gitelman L. (a cura di), "Raw Data" Is an Oxymoron, MIT Press.

Maria Ascolese

CTO & Co-Founder di Nami - Data Intelligence

Avanti
Avanti

Cos'è un whitepaper e quando ha senso farne uno