Skip to content

Repository files navigation

Python Data Analytics & Machine Learning

Ce dépôt présente deux démonstrations complémentaires de préparation, d’analyse et de modélisation de données avec Python.

L’objectif est d’illustrer une démarche complète : compréhension des données, nettoyage, transformation des variables, préparation pour le Machine Learning et application d’algorithmes de clustering.

Contenu du projet

1. Préparation et transformation des données

Notebook : data_preparation_ml.ipynb

Principales étapes :

  • anonymisation de données clients et commandes ;
  • détection et traitement des valeurs aberrantes ;
  • classement et transformation de variables ;
  • normalisation de tableaux numériques ;
  • préparation de matrices de données ;
  • encodage de variables catégorielles ;
  • utilisation de OneHotEncoder avec Scikit-learn.

2. Clustering et segmentation

Notebook : data_analysis.ipynb

Principales étapes :

  • création et représentation de groupes de points ;
  • préparation des données pour le clustering ;
  • application de l’algorithme K-means ;
  • utilisation de Scikit-learn ;
  • analyse et visualisation des groupes obtenus.

Technologies utilisées

  • Python
  • Jupyter Notebook
  • Pandas
  • NumPy
  • Scikit-learn
  • Matplotlib

Données

Le fichier sample_data.csv contient le jeu de données utilisé pour les démonstrations. Les données nécessaires à l’analyse sont anonymisées.

Exécution

  1. Cloner ou télécharger le dépôt.
  2. Installer les bibliothèques nécessaires :

pip install pandas numpy scikit-learn matplotlib jupyter

  1. Lancer Jupyter Notebook :

jupyter notebook

  1. Ouvrir le notebook souhaité et exécuter les cellules dans l’ordre.

Compétences illustrées

  • préparation et contrôle de la qualité des données ;
  • analyse exploratoire ;
  • transformation et encodage de variables ;
  • manipulation de données avec Pandas et NumPy ;
  • mise en œuvre d’algorithmes de Machine Learning ;
  • documentation d’une démarche d’analyse.

Auteur

Jérôme Phalippon Business Analyst | Chef de projet Data/BI | Data Analytics

About

Démonstrations Python de préparation de données, feature engineering et clustering avec Pandas et Scikit-learn.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages