Ce dépôt présente deux démonstrations complémentaires de préparation, d’analyse et de modélisation de données avec Python.
L’objectif est d’illustrer une démarche complète : compréhension des données, nettoyage, transformation des variables, préparation pour le Machine Learning et application d’algorithmes de clustering.
Notebook : data_preparation_ml.ipynb
Principales étapes :
- anonymisation de données clients et commandes ;
- détection et traitement des valeurs aberrantes ;
- classement et transformation de variables ;
- normalisation de tableaux numériques ;
- préparation de matrices de données ;
- encodage de variables catégorielles ;
- utilisation de
OneHotEncoderavec Scikit-learn.
Notebook : data_analysis.ipynb
Principales étapes :
- création et représentation de groupes de points ;
- préparation des données pour le clustering ;
- application de l’algorithme K-means ;
- utilisation de Scikit-learn ;
- analyse et visualisation des groupes obtenus.
- Python
- Jupyter Notebook
- Pandas
- NumPy
- Scikit-learn
- Matplotlib
Le fichier sample_data.csv contient le jeu de données utilisé pour les démonstrations. Les données nécessaires à l’analyse sont anonymisées.
- Cloner ou télécharger le dépôt.
- Installer les bibliothèques nécessaires :
pip install pandas numpy scikit-learn matplotlib jupyter
- Lancer Jupyter Notebook :
jupyter notebook
- Ouvrir le notebook souhaité et exécuter les cellules dans l’ordre.
- préparation et contrôle de la qualité des données ;
- analyse exploratoire ;
- transformation et encodage de variables ;
- manipulation de données avec Pandas et NumPy ;
- mise en œuvre d’algorithmes de Machine Learning ;
- documentation d’une démarche d’analyse.
Jérôme Phalippon Business Analyst | Chef de projet Data/BI | Data Analytics