Data literacy : définition, compétences et programme type

Data literacy (culture des données) : définition, les compétences qui comptent au quotidien, la qualité des données et un programme type pour vos équipes.

Tout le mondeLecture 4 min

La data literacy, ou culture des données, est la capacité à lire, comprendre, utiliser et questionner des données dans son travail. Elle ne suppose pas de savoir programmer : elle suppose de savoir si un chiffre est fiable, ce qu'il mesure vraiment, et quand il faut se méfier d'un tableau avant d'en tirer une décision.

Pourquoi la data literacy concerne tout le monde

Les données ne sont plus l'affaire d'une seule équipe. Un commercial alimente un CRM, un responsable RH exporte un tableau d'effectifs, un acheteur compare des fournisseurs dans un tableur, un manager lit un tableau de bord chaque lundi. À chaque étape, une erreur simple (une ligne en double, une case vide, une date au mauvais format) peut se propager jusqu'à une décision.

L'IA renforce l'enjeu : un modèle apprend des données qu'on lui fournit. S'il reçoit des données sales, il produit des résultats faux, et il les présente avec la même assurance que des résultats justes. La culture des données est donc un préalable à la maîtrise de l'IA.

Quelles compétences composent la data literacy ?

On peut les regrouper en quatre familles :

Famille Ce que la personne sait faire
Lire comprendre ce que mesure un indicateur, sa période, son unité, sa source ; lire un graphique sans se laisser tromper par son échelle
Contrôler repérer une donnée douteuse : doublon, valeur manquante, format incohérent, valeur impossible
Raisonner distinguer corrélation et causalité, se méfier des petits échantillons, comparer ce qui est comparable
Communiquer présenter un chiffre avec son contexte et ses limites, protéger les données personnelles qu'on partage

La qualité des données : le socle le plus concret

La famille « contrôler » est la plus facile à entraîner, et celle dont les erreurs coûtent le plus vite. Quatre problèmes reviennent sans cesse :

Les doublons

La même personne, commande ou facture présente deux fois, parfois avec une casse ou une orthographe différente. Conséquence typique : un chiffre d'affaires ou un effectif surévalués. Le réflexe : vérifier les identifiants avant d'additionner.

Les valeurs manquantes

Une case vide n'est pas un zéro. Un âge absent lu comme 0, un montant vide compté comme nul : la moyenne se déforme sans que personne ne le voie. Le réflexe : décider explicitement de compléter la valeur ou d'écarter la ligne.

Les formats incohérents

Dates en JJ/MM/AAAA et en MM/JJ/AAAA dans la même colonne, montants en euros et en milliers d'euros, séparateurs décimaux différents : les calculs restent possibles, mais faux. Le réflexe : harmoniser avant d'analyser.

Les valeurs aberrantes

Une valeur impossible (un âge de 250 ans, une température négative dans un four) doit être signalée. Une valeur rare mais légitime (un congélateur à -21 °C) doit, elle, être conservée. Le réflexe : se demander si la valeur est possible, pas seulement si elle est inhabituelle.

Ces quatre réflexes sont exactement ceux qu'entraîne Data Cleaning Rush : des lignes de données avancent vers un modèle sur un tapis roulant, et le joueur choisit la bonne action avant qu'elles n'arrivent. Chaque erreur montre en une phrase ce que le modèle a appris de travers.

À quoi ressemble un programme type ?

Un programme de data literacy qui fonctionne suit généralement ce schéma :

  1. Partir des données de l'entreprise. Les exemples génériques convainquent moins que les tableaux que les équipes manipulent vraiment. Un jeu forké peut reprendre des colonnes et des cas proches des vôtres, avec des données fictives.
  2. Commencer par la qualité des données, parce qu'elle se voit, se corrige et se mesure.
  3. Ajouter la lecture critique des indicateurs : période, échantillon, source.
  4. Relier à l'IA : une fois le réflexe de qualité acquis, montrer ce que devient une donnée sale dans un modèle, puis entraîner la vérification des réponses d'IA.
  5. Mesurer par compétence : doublons, valeurs manquantes, formats, valeurs aberrantes, pour savoir où porter l'effort suivant.

Les directions data trouveront des repères sur le pilotage de ce type de programme dans la page directions data et IA.

Data literacy et protection des données

Manipuler des données, c'est souvent manipuler des données personnelles. Un programme de culture des données rappelle les règles de base : ne partager que ce qui est nécessaire, préférer des données pseudonymisées ou agrégées, ne jamais coller un fichier nominatif dans un outil externe non validé. Ces notions sont définies dans le glossaire.

Commencer

Lancez une partie de Data Cleaning Rush depuis le catalogue, sans compte, puis continuez avec la page acculturation data et IA pour construire le reste du programme.

Modifier cette page sur GitHub (s'ouvre dans un nouvel onglet)