Problématique
On entend régulièrement, par exemple lors d’entretiens d’embauche, demander d’expliquer la différence entre Statistiques et Data Science. La question s’avère intéresser un grand nombre de personnes dans le monde de l’informatique, au sens large, et chacun y va de son avis. Nous n’allons pas trancher définitivement, mais plutôt étayer de plusieurs façons comment différencier ces deux disciplines.
Méthodologie
Il paraît évident que les Data Sciences1 ne sont pas tout à fait des statistiques. Cependant, dès que l’on commence à expliquer pourquoi, si l’on n’a pas préparé le sujet, on va rapidement donner des exemples ou des concepts qui font appel à la statistique. Cela n’aide pas à clarifier la réponse : le terme Data Science n’est-il qu’une appellation ronflante et quel est le rôle - voire l’importance - des statistiques dans ces dites sciences des données ? Notre méthode va être de comparer les deux avec les critères suivants :
- Essai de définition de chaque discipline
- Vocabulaire et concepts
- Problèmes traités et types de données
- Approches et buts visés
- Techniques et compétences spécifiques
- Domaines d’application
- Métiers associés
On peut aussi faire la liste des logiciels ou progiciels utilisés par l’une ou l’autre des disciplines, nous renvoyons à la bibliographie pour ce point.
Pour illustrer cette démarche, nous utiliserons quelques problèmes qui peuvent s’apparenter à l’une ou l’autre des disciplines.
Problèmes-type
- Dans une ville donnée, est-ce qu’il pleut plus le dimanche que le lundi ?
- On a examiné 4600 pièces mécaniques issues d’une ligne de production, et on a trouvé un taux de rejet de 0.54%. On mesure sur chaque pièce, 48 paramètres durant le procédé de fabrication. Est-il possible d’anticiper, avec ces mesures ou un sous-ensemble de ces mesures, le fait que des nouvelles pièces seront conformes ou pas ?
- Le département Marketing & Sales d’une société demande un algorithme de décision, pour estimer le meilleur prix de vente à fixer pour maximiser les bénéfices sur la commercialisation future d’un nouveau modèle d’appareil high-tech. Pour cela on se fonde sur les données des ventes d’un modèle similaire sur les 5 dernières années, ainsi que d’autres données ou indicateurs socio-économiques, saisonniers et géographiques (prix de matières premières, cours de la bourse, taux de chômage, pays visés, catégories des clients, …).
- Usure de pneus : on a établi que pour un certain modèle de voiture, la distance à laquelle il faut changer les pneus avant bien approximée par une loi normale d’espérance mathématique valant 36500 km. Sachant que j’ai déjà parcouru 33000 km avec mes pneus, puis-je espérer en faire encore 5000 sans risque réel ?
Un examen rapide de ces problèmes permet normalement de les rattacher aux statistiques pures ou aux Data Sciences. Cependant nous verrons que ce n’est pas toujours si évident.
Que sont les statistiques et les Data Sciences ?
Les statistiques et les Data Sciences ont pour objet des jeux de données, constitués de valeurs quantitatives ou qualitatives, possiblement de nature mixte. Chacune de ces disciplines a pour but d’extraire de l’information ou du sens à partir de ces données, pour aider par exemple à la compréhension de phénomènes complexes ou à la décision.
Les statistiques en résumé
Les statistiques sont une science mathématique, qui utilise des techniques destinées à produire des informations/indicateurs résumant un jeu de données (tels que la moyenne ou l’écart-type) ou à trouver des relations entre des données de sortie et des paramètres d’entrée. On parle de statistiques descriptives.
Les statistiques inférentielles ( Inferential Statistics en anglais), quant à elles, sont principalement utilisées pour le test d’hypothèse, relativement à un jeu de données, avec une approche probabiliste. On obtient par exemple un résultat à partir d’un échantillon de faible taille (typiquement un sondage avant un vote) : le pourcentage obtenu va-t-il s’appliquer à la population toute entière ? Avec quel niveau de confiance ?
Le problème est une question de statistiques : si nous récupérons les données pluviométriques sur 10 ans (soit un échantillon d’environ 520 valeurs), dans un même lieu, nous pourrons certainement conclure avec un bon intervalle de confiance.
Le vocabulaire des statistiques
Dans le monde des statistiques, on rencontre souvent les termes suivants, utilisés pour l’analyse mathématique de données numériques :
- moyennes et médiane
- variance et écart-type
- moments d’ordre supérieur comme Skewness et Kurtosis
- corrélation, analyse par composantes principales (PCA)
- probabilités : lois diverses de distribution statistique, théorèmes central-limite
- test d’hypothèse
- intervalle, niveau de confiance
- approche fréquentielle ou Bayésienne
Les statistiques sont bien une partie des mathématiques, qui utilise parfois des algorithmes pour des calculs longs, mais dont l’objectif premier n’est pas la recherche et l’implémentation efficace de tels algorithmes.
Les Data Sciences : vers une définition
Les Data Sciences ne sont pas seulement un domaine des mathématiques appliquées, puisque par essence elles sont interdisciplinaires. Elles peuvent traiter des jeux de données gigantesques et hétérogènes, et contiennent diverses méthodes de préparation initiale des données. Ainsi les algorithmes de partitionnement sont un exemple d’organisation des données.
Généralement, on parle de Data Science lorsqu’on cherche à apprendre à partir d’un ensemble de données, pour ensuite prévoir des résultats sur des données de même nature ; ceci peut entrer dans un process dynamique d’amélioration continue du modèle prédictif en fonction de nouvelles données analysées. Ce n’est pas une approche classique en statistiques.
Cependant les Data Sciences ont besoin des outils probabilistes et statistiques, ainsi que d’informatique car elles sont une science des algorithmes – comme le sont les méthodes d’optimisation par gradient pour calculer les meilleurs coefficients d’un modèle. L’apprentissage (Machine Learning) est considéré comme une partie des Data Sciences. La science des données est l’une des principales disciplines utilisées en Intelligence Artificielle, pour appréhender les problèmes de Big data. On ne peut dire que ce sont simplement des statistiques - appliquées à des quantités très importantes de données.
Notre problème est une question de Machine Learning :
- répartir les 4600 données de l’échantillon en un sous-ensemble d’apprentissage (learning set) et un second de validation (validation set) pour éprouver les modèles à tester.
- utiliser des méthodes de corrélation, pour extraire une ensemble de paramètres effectivement impliqués lorsqu’une pièce est rejetée.
- calculer et construire des modèles de prédiction de cette sortie binaire (conformité = 1, non-conformité = 0) à partir de ce sous-ensemble de données et de paramètres. Cela peut faire appel à un algorithme d’optimisation.
- sélectionner le modèle qui minimise les erreurs sur l’ensemble de validation.
- pour les nouvelles pièces produites, mesurer les paramètres significatifs uniquement et décider si la pièce va être conforme ou pas, grâce au modèle sélectionné.
Eléments de vocabulaire des Data Sciences
Un Data Scientist va fréquemment rencontrer ces termes ou ces concepts :
- Data Mining : analyse des données brutes pour extraire des relations entre données, trouver des figures significatives (patterns) et préparer le jeu de donnée au calcul du modèle
- Machine Learning : famille d’algorithmes plus ou moins sophistiqués, pour élaborer un modèle prédictif à partir d’un ensemble
- Apprentissage supervisé
- Intelligence Artificielle, IA
- Big Data
- Réseau neuronal ou de neurones
Les Data Sciences font partie de l’informatique (Computer Science), leur but est d’inventer ou de perfectionner des algorithmes effectifs d’analyse d’ensembles de données complexes, pour obtenir des modèles explicatifs, prédictifs et évolutifs. L’apprentissage (Machine Learning) est l’une des parties des Data Sciences les plus utilisées pour cet objectif. Les statistiques sont l’un des domaines mathématiques à connaître pour les Data Scientists.