Dati sintetici, la ricerca cerca un equilibrio tra utilità e riservatezza
La Banca d’Italia confronta due metodi per riprodurre un archivio di imprese senza diffonderne direttamente i microdati.

Condividere informazioni utili alla ricerca senza esporre direttamente i dati delle imprese è il problema affrontato dal Quaderno di economia e finanza n. 1056 della Banca d’Italia. Lo studio di Marco Langiulli, Alessandro Moro, Mattia Orzincolo e Daniele Piras utilizza il patrimonio dell’indagine INVIND per valutare la costruzione di dati sintetici, osservazioni generate che riproducono caratteristiche statistiche dell’archivio originario.
L’esercizio riguarda un insieme di 13.837 imprese osservate tra il 1993 e il 2024. Il pannello non è bilanciato: la durata delle informazioni disponibili varia da azienda ad azienda. Gli autori confrontano alberi di classificazione e regressione, indicati come CART, e copule gaussiane, considerando variabili territoriali, settore di attività, occupazione e fatturato. L’obiettivo è verificare quanto le basi ricostruite conservino le relazioni utili.
La fedeltà statistica, tuttavia, non coincide automaticamente con la protezione della riservatezza. Una riproduzione molto vicina alle osservazioni originarie può aumentare il rischio di reidentificazione. Il lavoro valuta anche l’introduzione di rumore controllato, cercando di ridurre tale esposizione senza compromettere le proprietà del campione. Utilità e protezione vengono così trattate come dimensioni da misurare insieme.
Per chi progetta archivi destinati a essere condivisi, ne deriva una questione: occorre stabilire prima quali analisi il dataset debba consentire. Una base adatta a descrivere distribuzioni aggregate potrebbe non esserlo per studiare percorsi individuali o eventi rari. Anche la documentazione diventa parte del prodotto, perché l’utilizzatore deve conoscere limiti, trasformazioni e margini di errore. Un possibile processo di verifica confronta risultati ottenuti sui dati originari e sintetici, controllando separatamente qualità statistica e rischio informativo. La somiglianza visiva tra due tabelle non offre, da sola, una misura sufficiente di nessuno dei due aspetti.






Commenti