Quels livres pour apprendre l'analyse de données ?
Le scénario se répète dans toutes les librairies techniques. Quelqu'un décide de se mettre à la donnée, monte au rayon informatique, et redescend avec un manuel de machine learning de six cents pages. Trois mois plus tard, cette personne sait entraîner une forêt aléatoire et ne sait toujours pas expliquer pourquoi la moyenne des salaires de son entreprise ne veut rien dire.
L'analyse de données souffre d'un problème d'ordre, pas d'un problème d'offre. Les livres sérieux existent en français, y compris des manuels universitaires excellents que personne ne recommande parce qu'ils ne sont pas à la mode. Le vrai sujet est de savoir dans quel ordre les ouvrir. Voici quatre titres, un seul parcours, et une section entière consacrée à ce qu'il ne faut surtout pas acheter en premier.
L'ordre est la seule chose qui compte
Trois étages, et ils ne sont pas interchangeables.
D'abord la statistique descriptive : décrire un jeu de données sans rien prédire. Moyenne, médiane, quartiles, variance, écart type, corrélation. C'est austère, c'est court, et c'est ce qui sépare une analyse honnête d'une analyse décorative.
Ensuite l'outil, Python ou R, qui vous permet de faire sur trois millions de lignes ce que vous saviez déjà faire à la main sur trente.
Enfin seulement les modèles : régression, classification, apprentissage automatique. Cet étage repose entièrement sur les deux précédents. Construit sans eux, il produit des chiffres qui ont l'air justes, ce qui est infiniment pire que des chiffres visiblement faux.
Si vous avez déjà des bases solides en statistiques, notre sélection dédiée aux livres pour apprendre les statistiques vous en dira plus sur le premier étage, et vous pouvez attaquer ici directement à la deuxième section.
Premier livre : Bernard Py, « Statistique descriptive »
Bernard Py, « Statistique descriptive. Nouvelle méthode pour bien comprendre et réussir » (Economica, cinquième édition, 2007) Voir à la FnacStatistique descriptive. Nouvelle méthode pour bien comprendre et réussir, de Bernard Py (lien affilié, ouvre un nouvel onglet). Prérequis : le programme de mathématiques de première, ou son souvenir approximatif.
Py enseignait la statistique descriptive à des étudiants de première année en sciences économiques, et son livre porte la trace de trente ans de copies corrigées. Son idée de mise en page mérite d'être signalée : la page de gauche contient le raisonnement essentiel, la page de droite les démonstrations, les compléments et les exercices. Vous lisez d'abord toutes les pages de gauche, vous revenez ensuite pour la partie technique. Peu de manuels acceptent d'être lus à deux vitesses, celui-ci le prévoit.
Ce qu'il vous apprend précisément : à décrire une série de données et à savoir quel indicateur ment. Vous comprendrez pourquoi la médiane résiste aux valeurs extrêmes quand la moyenne s'écroule, ce que mesure vraiment un écart type, et pourquoi une corrélation de 0,7 ne veut rien dire tant que vous n'avez pas regardé le nuage de points.
Ce qu'il ne vous apprend pas : à conclure. La statistique descriptive s'arrête à la description, elle ne dit rien sur la population dont vos données sont extraites. Cette limite est une qualité pédagogique : elle vous force à distinguer ce que vous observez de ce que vous inférez, distinction que la plupart des analystes amateurs n'ont jamais faite explicitement.
Deuxième livre : l'outil, Python ou R selon votre terrain
C'est ici que le parcours bifurque, et le choix compte moins que ce que les gens en disent.
Emmanuel Jakobowicz, « Python pour le data scientist. Des bases du langage au machine learning » (Dunod, troisième édition, 2024) Voir à la FnacPython pour le data scientist. Des bases du langage au machine learning, de Emmanuel Jakobowicz (lien affilié, ouvre un nouvel onglet). Prérequis : le premier étage, et un ordinateur ouvert à côté du livre.
Jakobowicz est docteur en statistique appliquée, formateur, et co-organise le meetup PyData Paris. Son livre a une qualité rare dans la littérature technique française : il consacre une place importante à la préparation et au nettoyage des données, qui représentent l'essentiel du travail réel et à peu près rien de ce que montrent les tutoriels. Vous partez du langage lui-même, vous passez par pandas et la manipulation de tableaux, et vous arrivez au machine learning en fin de parcours, ce qui est le bon sens.
François Husson, Sébastien Lê et Jérôme Pagès, « Analyse de données avec R » (Presses universitaires de Rennes, collection Pratique de la statistique, deuxième édition, 2016) Voir à la FnacAnalyse de données avec R, de François Husson, Sébastien Lê et Jérôme Pagès (lien affilié, ouvre un nouvel onglet). Prérequis : le premier étage, et quelques notions élémentaires de R.
Les trois auteurs enseignent à Agrocampus Rennes, et le livre est né d'un cours destiné à des étudiants qui ne deviendront pas statisticiens mais qui auront des données sur les bras. Il couvre l'analyse en composantes principales, l'analyse factorielle des correspondances, l'analyse des correspondances multiples et la classification. C'est l'école française d'analyse des données, celle de Benzécri, celle qui privilégie l'exploration géométrique d'un tableau plutôt que le test d'hypothèse.
Prenez R si votre sujet est l'enquête, la recherche, les sciences sociales, l'exploration multivariée. Prenez Python si vous voulez aussi automatiser des traitements, aller chercher des données ailleurs, faire tourner votre code ailleurs que sur votre machine. Un critère plus utile que tous les autres : choisissez le langage parlé par les gens autour de vous, parce que vous allez avoir besoin de poser des questions. Si vous n'avez jamais programmé du tout, notre parcours pour apprendre à programmer vous fera gagner des semaines avant celui-ci.
Troisième livre : Gilbert Saporta, « Probabilités, analyse des données et statistique »
Gilbert Saporta, « Probabilités, analyse des données et statistique » (Éditions Technip, troisième édition, 2011, environ six cent cinquante pages) Voir à la FnacProbabilités, analyse des données et statistique, de Gilbert Saporta (lien affilié, ouvre un nouvel onglet). Prérequis : un niveau d'algèbre et d'analyse de premier cycle scientifique ou économique.
Saporta a enseigné la statistique au CNAM pendant des décennies, et ce volume est la référence francophone du domaine. Vingt et un chapitres en cinq parties : outils probabilistes, analyse exploratoire, statistique inférentielle, modèles prédictifs, recueil des données.
Un conseil de méthode qui vaut pour ce livre en particulier. Ne le lisez pas de bout en bout. Achetez-le, posez-le à côté de votre écran, et ouvrez-le chaque fois qu'un chapitre de votre manuel d'outil mentionne une notion que vous ne maîtrisez pas. Vous y trouverez le traitement complet, avec les hypothèses explicites que les livres pratiques passent sous silence. Un manuel de référence se consulte pendant des années, il ne se dévore pas en trois semaines.
Ce qu'il ne vous apprend pas : à travailler. Saporta expose la théorie avec une rigueur qui ne laisse rien passer, mais il ne vous prendra pas par la main devant un fichier mal formaté avec des dates au format américain et trois valeurs manquantes codées « NR ». Cette compétence-là ne s'écrit pas.
Quatrième livre : Stéphane Tufféry, « Data mining et statistique décisionnelle »
Stéphane Tufféry, « Data mining et statistique décisionnelle. La science des données » (Éditions Technip, cinquième édition, 2017) Voir à la FnacData mining et statistique décisionnelle. La science des données, de Stéphane Tufféry (lien affilié, ouvre un nouvel onglet). Prérequis : les trois étapes précédentes, sans exception.
Tufféry vient du secteur bancaire et enseigne à Rennes, ce qui explique le ton du livre : il parle de problèmes réels, de scoring, de segmentation de clientèle, de détection de fraude, avec le souci constant de la validité des résultats. C'est le pont entre la statistique universitaire et l'usage industriel, et il est écrit en français par quelqu'un qui a pratiqué les deux.
Ce qu'il vous apprend précisément : à choisir une méthode plutôt qu'à l'appliquer. Vous saurez pourquoi une régression logistique reste préférable à un modèle plus sophistiqué quand il faut expliquer une décision à un client ou à un régulateur, comment valider un modèle sans se mentir, et ce qu'est vraiment le surapprentissage quand on le rencontre au lieu d'en lire la définition.
Par où ne pas commencer
Voici la section la plus utile de cet article.
Les manuels de machine learning pratique, en premier lieu. Ils sont excellents, ils sont bien écrits, et achetés en premier ils vous rendront un mauvais service. Notre sélection pour apprendre l'intelligence artificielle en recommande plusieurs, et précise exactement à quel moment ils deviennent utiles. Ce moment arrive après les quatre livres ci-dessus, pas avant.
Les ouvrages de vulgarisation sur le « big data », ensuite. Ils décrivent un phénomène économique et social, parfois très bien, et n'apprennent aucune compétence. Lisez-les le week-end si le sujet vous intéresse, ne les comptez pas dans votre progression.
Les livres organisés par bibliothèque logicielle, enfin. Un manuel entier consacré à un seul outil vieillit à la vitesse de cet outil, c'est-à-dire vite. La documentation en ligne fait mieux le travail, gratuitement, et à jour. Un livre a de l'intérêt sur les concepts qui ne bougent pas, beaucoup moins sur une syntaxe qui change tous les dix-huit mois.
Un mot enfin sur les manuels traduits de l'anglais dans ce domaine. La traduction française du vocabulaire statistique est instable, et vous croiserez trois traductions différentes pour le même terme selon les éditeurs. Commencer par des auteurs francophones vous évite cette confusion pendant la phase où vous n'avez pas encore les repères pour la détecter.
Ce que les livres ne feront pas à votre place
Aucun de ces quatre volumes ne vous donnera de données, et c'est le problème central.
L'analyse de données ne s'apprend pas en lisant sur l'analyse de données. Elle s'apprend sur un jeu de données qui vous intéresse personnellement, assez pour que vous ayez envie de savoir ce qu'il contient. Vos dépenses des trois dernières années, les résultats d'un club sportif, les données ouvertes de votre commune, votre historique de lecture. La question doit être la vôtre, sinon l'exercice reste scolaire et vous abandonnerez au premier fichier récalcitrant.
Un livre ne vous dira pas non plus que votre analyse est fausse. C'est la limite la plus dangereuse du domaine, parce qu'un résultat statistique erroné a exactement la même apparence qu'un résultat juste : un nombre, un graphique, une conclusion. Faites relire vos analyses. Un collègue, un forum spécialisé, un ami statisticien, n'importe qui capable de vous demander pourquoi vous avez exclu ces quarante lignes.
Enfin, personne ne vous apprendra à écrire vos résultats, et c'est pourtant la moitié du métier. Une analyse qui ne se raconte pas ne sert à rien. Prenez l'habitude, après chaque analyse, de rédiger un paragraphe qui dit ce que vous avez trouvé, sur quelles données, et ce que ce résultat ne permet pas de conclure. Cette troisième phrase est celle que personne n'écrit.
Après ces quatre livres
Vous aurez alors les descriptions, un outil, une référence théorique et les modèles. C'est un socle solide, et il suffit pour la plupart des usages professionnels.
La suite dépend du terrain. Si vous allez vers les enquêtes, l'échantillonnage et la théorie des sondages vous attendent. Si vous allez vers l'entreprise, la modélisation et l'expérimentation contrôlée deviendront centrales. Si c'est la visualisation qui vous a accroché, il existe une littérature entière sur la représentation graphique, dont une bonne partie n'est disponible qu'en anglais.
Le reste de notre collection quels livres acheter pour apprendre à applique la même méthode à d'autres domaines techniques, et le rayon sciences et informatique du catalogue vous aidera à repérer les manuels français qui ont eu droit à une édition récente, ce qui compte plus ici qu'ailleurs.
Faut-il commencer par les statistiques ou par la programmation ?
Python ou R pour débuter l'analyse de données ?
Peut-on apprendre l'analyse de données sans mathématiques ?
Faut-il acheter un livre de machine learning quand on débute ?
Combien de temps pour être autonome sur une analyse simple ?
Les cours en ligne remplacent-ils les livres dans ce domaine ?
Les liens « Voir à la Fnac » sont affiliés : un achat nous verse une petite commission, sans changement de prix pour vous. Les livres sont choisis indépendamment.