Prix & distinctions
- 2021 Prix de la jeune ingénieure en intelligence artificielle, organisé par l’agence Tilder en partenariat avec France Digitale et Challenges.
Équipe
CBIO
Biographie
Chloé Agathe Azencott est une chercheuse spécialisée en bioinformatique et en apprentissage statistique appliqué à la génomique et à la médecine de précision. Ses travaux se concentrent sur le développement de méthodes computationnelles pour l’analyse de données biomédicales complexes, notamment dans le cadre des études d’association pangénomiques (GWAS) et plus largement de l’analyse de données omiques et de la prédiction d’interactions médicament-cible. Son expertise inclut l’intégration de connaissances biologiques a priori, telles que les réseaux d’interactions géniques, pour renforcer la robustesse et l’interprétabilité des modèles prédictifs. Au fil de ses travaux, elle a contribué à des avancées méthodologiques pour la détection d’épistasie, la sélection de variables, et l’apprentissage multitâches, tout en abordant des défis liés à la rareté des données et à la grande dimension.
Publication(s)
-
2025
Noninvasive Multicancer Detection Using DNA Hypomethylation of LINE-1 Retrotransposons DOI : 10.1158/1078-0432.CCR-24-2669
-
2025
Assessing Random Forest self-reproducibility for optimal short biomarker signature discovery DOI : 10.1093/bib/bbaf318
-
2025
Sparse multitask group Lasso for genome-wide association studies DOI : 10.1371/journal.pcbi.1012734
-
2025
Multimodal BEHRT: transformers for multimodal electronic health records to predict breast cancer prognosis DOI : 10.3389/fonc.2025.1496215
-
2024
Concomitant medication, comorbidity and survival in patients with breast cancer DOI : 10.1038/s41467-024-47002-3
-
2024
Drug-Target Interactions Prediction at Scale: The Komet Algorithm with the LCIdb Dataset DOI : 10.1021/acs.jcim.4c00422
-
2023
pyComBat, a Python tool for batch effects correction in high-throughput molecular data using empirical Bayes methods DOI : 10.1186/s12859-023-05578-5
-
2023
Detection of genes with differential expression dispersion unravels the role of autophagy in cancer progression DOI : 10.1371/journal.pcbi.1010342
-
2023
A network-guided protocol to discover susceptibility genes in genome-wide association studies using stability selection DOI : 10.1016/j.xpro.2022.101998
-
2022
A systematic analysis of gene–gene interaction in multiple sclerosis DOI : 10.1186/s12920-022-01247-3
-
2022
Dynamic Risk Prediction of 30-Day Mortality in Patients With Advanced Lung Cancer: Comparing Five Machine Learning Approaches DOI : 10.1200/CCI.22.00054
-
2022
Where Do We Stand in Regularization for Life Science Studies? DOI : 10.1089/cmb.2019.0371
-
2022
The French Early Breast Cancer Cohort (FRESH): A Resource for Breast Cancer Research and Evaluations of Oncology Practices Based on the French National Healthcare System Database (SNDS) DOI : 10.3390/cancers14112671
-
2022
Nonlinear post-selection inference for genome-wide association studies DOI : 10.1142/9789811250477_0032
-
2022
Interpretable network-guided epistasis detection DOI : 10.1093/gigascience/giab093
-
2022
Multitask group Lasso for Genome Wide association Studies in diverse populations DOI : 10.1142/9789811250477_0016
-
2021
Boosting GWAS using biological networks: A study on susceptibility to familial breast cancer DOI : 10.1371/JOURNAL.PCBI.1008819
-
2021
Drug target identification with machine learning: How to choose negative examples DOI : 10.3390/ijms22105118
-
2021
A new hybrid record linkage process to make epidemiological databases interoperable: application to the GEMO and GENEPSO studies involving BRCA1 and BRCA2 mutation carriers DOI : 10.1186/s12874-021-01299-6
-
2020
Novel methods for epistasis detection in genome-wide association studies DOI : 10.1371/journal.pone.0242927
-
2019
Block HSIC Lasso: Model-free biomarker detection for ultra-high dimensional data DOI : 10.1093/bioinformatics/btz333
-
2019
KernelPSI: A post-selection inference framework for nonlinear variable selection
-
2018
Efficient multi-Task chemogenomics for drug specificity prediction DOI : 10.1371/journal.pone.0204999
-
2018
Machine learning and genomics: Precision medicine versus patient privacy DOI : 10.1098/rsta.2017.0350
-
2017
The inconvenience of data of convenience: Computational research beyond post-mortem analyses DOI : 10.1038/nmeth.4457
-
2016
Crowdsourced assessment of common genetic contribution to predicting anti-TNF treatment response in rheumatoid arthritis DOI : 10.1038/ncomms12460
-
2016
Multitask feature selection with task descriptors
-
2016
Network-guided biomarker discovery DOI : 10.1007/978-3-319-50478-0_16
-
2015
Prediction of human population responses to toxic compounds by a collaborative competition DOI : 10.1038/nbt.3299
-
2015
The evaluation of tools used to predict the impact of missense variants is hindered by two types of circularity DOI : 10.1002/humu.22768
-
2014
Multi-task feature selection on multiple networks via maximum flows DOI : 10.1137/1.9781611973440.23
-
2013
Efficient network-guided multi-locus association mapping with graph cuts DOI : 10.1093/bioinformatics/btt238
-
2012
GLIDE: GPU-based linear regression for detection of epistasis DOI : 10.1159/000341885
Enseignements
Science des données
Notions de statistiques (population, estimation) ; réduction de dimension ; bonnes pratiques (visualisation, représentativité, confidentialité, biais algorithmiques) ; apprentissage supervisé (minimisation du risque empirique, régularisation, sélection et validation).
Introduction au Machine Learning
L’essor de la numérisation fait s’accumuler dans les domaines les plus variés (internet, marketing, logistique, biologie, etc) des masses considérables de données. Ceci induit un besoin croissant de fouille et d’exploitation automatisée de données de toutes natures. De nombreux algorithmes (réseaux de neurones artificiels, SVM, forêts aléatoires, etc) permettent des analyses et modélisations plus puissantes que les simples méthodes statistiques linéaires classiques. Le but de ce cours est de présenter un panorama de ces techniques dites d'apprentissage statistique, ou machine learning, ainsi que leur cadre théorique et méthodologique commun, et leurs divers types d’applications.
L'Ingénieur et la Recherche en Santé (trimestre recherche)
Direction(s) de thèse(s)
- 2025 Prédiction biologiquement interprétable du risque de maladie à long terme ELGOHARY Kareem
- 2025 Développement de méthode pour l'analyse de données transcriptomiques AYADI Youmna
- 2023 Analyse des propriétés statistiques des génomes bactériens afin de discerner des facteurs favorisant l'échange de gène et les événements de migration ETHEIMER Paul
- 2022 Identification de biomarqueurs à partir de données transcriptomiques grâce à la méthode des knockoffs : application à des cohortes de cancérologie CARTIER Julie
- 2022 Apprentissage automatique et biologie des systèmes pour identifier des stratégies thérapeutiques dans le cancer du sein triple négatif ATIP3-déficient GUICHAOUA Gwenn
- 2019 Sélection stable de variables pour les études d'association génome entier NOUIRA Asma
- 2019 Apprentissage à partir de données multimodales pour améliorer le traitement du cancer du sein MBAYE Ndèye Mbaye
- 2016 Détection d'épistasie dans les études d'association pangénomiques avec des techniques d'apprentissage pour l'identification de cibles thérapeutiques SLIM Lotfi
- 2016 Études d'association pangénomique guidées par des réseaux CLIMENTE GONZÁLEZ Héctor
