GPGDR (Grands principes de gestion des données de Recherche)
Objectifs
L’École de Développement des Talents (EDT) et le CEntre de formation et de soutien aux Données de la REcherche (CEDRE) vous proposent une formation de sensibilisation aux enjeux et grands principes de gestion des données de la recherche. Au travers de recommandations, rappels de bonnes pratiques et échanges, l’objectif sera de vous faire adopter les bons réflexes et que vous vous posiez les bonnes questions, au bon moment.
Nous aborderons la notion et les enjeux de la Science ouverte, les principes FAIR, les étapes du cycle de vie de la donnée ainsi que le plan de gestion de données et
Objectifs
L’École de Développement des Talents (EDT) et le CEntre de formation et de soutien aux Données de la REcherche (CEDRE) vous proposent une formation de sensibilisation aux enjeux et grands principes de gestion des données de la recherche. Au travers de recommandations, rappels de bonnes pratiques et échanges, l’objectif sera de vous faire adopter les bons réflexes et que vous vous posiez les bonnes questions, au bon moment.
Nous aborderons la notion et les enjeux de la Science ouverte, les principes FAIR, les étapes du cycle de vie de la donnée ainsi que le plan de gestion de données et les nouvelles formes de publications.
En complément, une attention toute particulière sera prêtée aux aspects juridiques et réglementaires entourant cette gestion, avec une deuxième partie de journée dédiée à ce thème : définir vos données de recherche, découvrir et appréhender le cadre légal tout en comprenant les enjeux relatifs au traitement de vos données afin d’acquérir une méthodologie pratique pour répondre à vos problématiques juridiques.
Programme
Demi-journée 1 (Matinée)
Contexte et enjeux de la Science Ouverte
Principes FAIR
Plan de gestion des données
Description des données via leurs métadonnées
Identifiants pérennes
Stockage, archivage et entrepôts de données
Data et software papers
Journée 2 (Toute la journée)
Aspects règlementaires et juridiques liés à la gestion des données de recherche
Définitions et notions de données de la recherche
Typologie des données et cadre juridique applicable (droit de l’open data, droit sui generis des bases de données, RGPD, droit pénal...)
Enjeux en lien avec les données de la recherche (valorisation et risques)
Pré-requis
Aucun
Introduction à la Science des Données : De la Collecte à l'Analyse des Données
Objectif général
Cette formation a été conçue par le CEntre de formation et de soutien aux Données de la REcherche (CEDRE) en partenariat avec l'École de Développement des Talents (EDT) pour aider les encadrants en unité de recherche, les ingénieurs, les chefs de projet et tout autre professionnel intéressé à maîtriser les concepts fondamentaux de la data science et être capables de comprendre la démarche complète d'un projet data, depuis la formulation d'une problématique jusqu'à l'interprétation des résultats pour soutenir une prise de décision éclairée.
Objectifs pédagogiques
- Comprendre
Objectif général
Cette formation a été conçue par le CEntre de formation et de soutien aux Données de la REcherche (CEDRE) en partenariat avec l'École de Développement des Talents (EDT) pour aider les encadrants en unité de recherche, les ingénieurs, les chefs de projet et tout autre professionnel intéressé à maîtriser les concepts fondamentaux de la data science et être capables de comprendre la démarche complète d'un projet data, depuis la formulation d'une problématique jusqu'à l'interprétation des résultats pour soutenir une prise de décision éclairée.
Objectifs pédagogiques
- Comprendre les concepts fondamentaux de la data science, son rôle et ses domaines d'application dans le contexte universitaire et de la recherche.
- Distinguer les notions de data science, d'analyse de données, de machine learning et d'intelligence artificielle.
- Identifier les principales étapes du cycle de vie d'un projet data, depuis la formulation du besoin jusqu'à la prise de décision.
- Traduire une problématique métier en une problématique orientée données.
- Identifier les différents types de données, leurs sources et les principaux critères permettant d'évaluer leur qualité.
- Comprendre les enjeux liés à la gouvernance des données et aux principes FAIR.
- Identifier les principales anomalies pouvant affecter un jeu de données ainsi que les stratégies couramment utilisées pour les traiter.
- Comprendre les principes fondamentaux de l'analyse exploratoire des données, des statistiques descriptives et de la visualisation des données.
- Distinguer les notions de corrélation et de causalité, et prendre conscience des principaux biais pouvant influencer l'interprétation des résultats.
- Adopter une vision globale de la démarche data afin de préparer l'acquisition des compétences pratiques développées dans les modules suivants.
Module A- Initiation Python pour Machine Learning
Objectifs du module
- Consolider les fondamentaux du langage Python indispensables à la manipulation et au traitement des données.
- Découvrir l'écosystème Python dédié à la data science et adopter un environnement de travail adapté (Anaconda, Jupyter Notebook).
- Manipuler efficacement des données numériques à l'aide de NumPy.
- Importer, explorer, manipuler et transformer des jeux de données avec Pandas.
- Utiliser les principales fonctionnalités de Python et de Pandas pour automatiser les traitements courants sur les données.
- Produire des visualisations claires et adaptées à l
Objectifs du module
- Consolider les fondamentaux du langage Python indispensables à la manipulation et au traitement des données.
- Découvrir l'écosystème Python dédié à la data science et adopter un environnement de travail adapté (Anaconda, Jupyter Notebook).
- Manipuler efficacement des données numériques à l'aide de NumPy.
- Importer, explorer, manipuler et transformer des jeux de données avec Pandas.
- Utiliser les principales fonctionnalités de Python et de Pandas pour automatiser les traitements courants sur les données.
- Produire des visualisations claires et adaptées à l'aide de Matplotlib.
- Réaliser des visualisations statistiques plus élaborées avec Seaborn afin de faciliter l'exploration et la compréhension des données.
- Mettre en œuvre un workflow complet de manipulation et de visualisation des données en Python en préparation des modules de Prétraitement et analyse de données et de Machine Learning.
Méthodes pédagogiques
Prérequis :
- Les fondamentaux de programmation (Python) + Test de niveau à passer
Pré-requis
Connaissances en programmation Python
Test de niveau à passer
Venir avec son PC
Module B - Techniques de Prétraitement et de Manipulation de Données
Objectifs pédagogiques
- Comprendre les principales étapes du cycle de vie des données et l'importance du prétraitement dans un projet de data science.
- Identifier et corriger les principales anomalies présentes dans un jeu de données (valeurs manquantes, doublons, incohérences, valeurs aberrantes, etc.).
- Mettre en œuvre les techniques essentielles de préparation et de transformation des données en vue de leur exploitation.
- Réaliser une analyse exploratoire (EDA) afin de mieux comprendre la structure, la qualité et les caractéristiques d'un jeu de données.
- Interpréter les princ
Objectifs pédagogiques
- Comprendre les principales étapes du cycle de vie des données et l'importance du prétraitement dans un projet de data science.
- Identifier et corriger les principales anomalies présentes dans un jeu de données (valeurs manquantes, doublons, incohérences, valeurs aberrantes, etc.).
- Mettre en œuvre les techniques essentielles de préparation et de transformation des données en vue de leur exploitation.
- Réaliser une analyse exploratoire (EDA) afin de mieux comprendre la structure, la qualité et les caractéristiques d'un jeu de données.
- Interpréter les principaux indicateurs descriptifs et les visualisations pour identifier les tendances, les distributions et les relations entre les variables.
- Préparer un jeu de données propre et structuré pour son utilisation dans un projet de Machine Learning.
Méthodes pédagogiques
Prérequis :
- Avoir suivi le module A du parcours
ou
- Bases Python (variables, boucles, fonctions, structures de données)
- Bibliothèques Python : Numpy, Pandas, Matplotlib et Seaborn
- Notions de base en statistiques (moyenne, distribution, écart-type etc.)
+ Test de niveau à passer
Pré-requis
Connaissances en programmation Python
Test de niveau à passer ou avoir suivi le Module B
Venir avec son PC
Module C : Techniques de prétraitement et de manipulation de données
Objectifs pédagogiques
- Comprendre les principes de l’apprentissage supervisé et non supervisé
- Préparer et structurer des données pour l’analyse
- Implémenter des modèles de régression linéaire pour prédire des valeurs continues
- Construire des modèles de classification pour résoudre des problèmes de décision
- Évaluer et améliorer les performances des modèles (validation, tuning)
- Utiliser des algorithmes avancés : K-NN, Régression logistique, SVM
- Appliquer des méthodes d’apprentissage non supervisé : K-Means, ACP (PCA)
- Interpréter les résultats dans un contexte scientifique ou métier
- Mettre en œuvre un pipe
Objectifs pédagogiques
- Comprendre les principes de l’apprentissage supervisé et non supervisé
- Préparer et structurer des données pour l’analyse
- Implémenter des modèles de régression linéaire pour prédire des valeurs continues
- Construire des modèles de classification pour résoudre des problèmes de décision
- Évaluer et améliorer les performances des modèles (validation, tuning)
- Utiliser des algorithmes avancés : K-NN, Régression logistique, SVM
- Appliquer des méthodes d’apprentissage non supervisé : K-Means, ACP (PCA)
- Interpréter les résultats dans un contexte scientifique ou métier
- Mettre en œuvre un pipeline complet de Machine Learning
Méthodes pédagogiques
Prérequis :
+ Avoir suivi le module A du parcours
ou
+ Bases Python (variables, boucles, fonctions, structures de données)
+ Bibliothèques Python : Numpy, Pandas, Matplotlib et Seaborn
+ Notions de base en statistiques (moyenne, distribution, écart-type etc.)
+ Test de niveau à passer
Module complémentaire - Gestion des Données avec SQL et Bases de Données Relationnelles
Objectifs du module
- Comprendre le fonctionnement des bases de données relationnelles, leur intérêt, le vocabulaire associé (tables, champs, clés, relations, schémas…) ainsi que les principes de conception d'un modèle de données simple.
- Créer un base de données, des tables simples avec clés primaires et clés étrangères, et comprendre le rôle des contraintes dans l'intégrité des données.
- Découvrir les principes fondamentaux du langage SQL et maîtriser les opérations CRUD afin de créer, consulter, modifier et supprimer des données de manière structurée.
- Être capable de construire des requêtes SQL en
Objectifs du module
- Comprendre le fonctionnement des bases de données relationnelles, leur intérêt, le vocabulaire associé (tables, champs, clés, relations, schémas…) ainsi que les principes de conception d'un modèle de données simple.
- Créer un base de données, des tables simples avec clés primaires et clés étrangères, et comprendre le rôle des contraintes dans l'intégrité des données.
- Découvrir les principes fondamentaux du langage SQL et maîtriser les opérations CRUD afin de créer, consulter, modifier et supprimer des données de manière structurée.
- Être capable de construire des requêtes SQL en filtrant, triant et organisant les résultats pour répondre à un besoin d'analyse ou d'extraction de données.
- Utiliser les fonctions d'agrégation et les différents types de jointures afin de synthétiser les données et de combiner efficacement les informations provenant de plusieurs tables.
Méthodes pédagogiques
Possibilité de suivre le module de manière indépendante, sans forcément posséder de connaissances au préalable du langage SQL ou des bases de données relationnelles.
Pré-requis
Venir avec son PC