800 packages pour l’analyse de données génomiques • Documentation très complète pour chaque package (vignette) • Mise à jour tous les 6 mois • Mise à disposition de matériel de cours • Exemples de workflows • Chaine F1000 pour la publication de workflow • Communauté d’utilisateurs / développeurs très vaste et active Bioconductor Analyse de données NGS sous R 2
Bioconductor pour l’analyse de données de ChIP-seq • GenomicRanges : Grammaire et fonctions pour la manipulation de données d’intervalles • Rsamtools : Grammaire et fonction pour la manipulation des BAM • DiffBind : Analyse différentielle de données de ChIP-seq • rtracklayer : Imports / exports de données de séquences et d’annotation • DESeq : Analyse différentielle pour données de comptage • edgeR : Analyse différentielle pour données de comptage • chipseq : Outils pour l’analyse de données de ChIP-seq • ChIPpeakAnno : Annotation et enrichissement fonctionnel pour le ChIP-seq • MotifDb : Collection de motifs et PWMs • motifStack : Outils graphique pour l’affichage des PWMs • PWMEnrich : Outils pour les tests d’enrichissement en motifs • …
Bioconductor pour l’analyse de données de ChIP-seq (peak-calling) • BayesPeak : Chaines de Markov cachées (HMM) et algorithme Bayésien • PICS : Inférence probabilistique • MOSAiCS : Model-based analysis of ChIP-Seq data • iSeq : Modèle bayésien Ising caché • ChIPseqR : Positionnement de nucléosome • CSAR : Tests basés sur la loi de Poisson • SPP : peak-caller développé dans le cardre du projet ENCODE • NarrowPeaks : Analyse en composante principale fonctionnelle (FPCA)
de données de ChIP-seq sous R Données brutes .fastq Données trimmées .fastq QuasR QuasR Rsamtools .bam .bam Prétraitement Données alignées Données filtrées QuasR • Qualité des reads • Contenu en GC • Taux de duplication • Séquences sur-représentées QuasR • Taux d’alignement csaw • Estimation de la taille des fragments
8 TP Cellule de la lignée Ishikawa • Cellules épithéliales dérivées d’un adénocarcinome de l’endomètre Anticorps anti-ESR1 polyclonalde lapin (Santa Cruz Biotechnology sc-543) • Récepteur aux estrogènes, facteur de transcription présentant plusieurs sites d’interaction protéine – protéine, hormone – protéine et protéine – ADN • Localisation nucléaire • Forme des homo et hétéro-dimers avec ESR2 • Essentiel pour le développement des caractères liés au genre • Impliqué dans le développement de certains cancers du sein, de l’endomètre ainsi que l’ostéoporose ChiP-seq Illumina Genome Analyzer SE 36 bp • 2 x 107 cellules • Sonication • Amplification par 15 cycles de PCR
de données de ChIP-seq sous R 20 Téléchargez les FASTA associé au chromosome 19 de l’assemblage hg38 du génome humain sur Ensembl (version soft mask et mask) Importer les deux FASTA dans R via le package Biostrings TP
/ BAM sous R - Analyse de données de ChIP-seq sous R 26 • Volume d’information trop important pour charger la totalité d’un BAM dans R • Package GenomicAligments which : régions génomiques du BAM à considérer what : informations à extraire du BAM flag : caractéristiques des alignements à considérer ScanBamParam () which = what = flag=
/ BAM sous R - Analyse de données de ChIP-seq sous R 27 which : régions génomiques du BAM à considérer what : informations à extraire du BAM flag : caractéristiques des alignements à considérer ScanBamParam () • Volume d’information trop important pour charger la totalité d’un BAM dans R • Package GenomicAligments
/ BAM sous R - Analyse de données de ChIP-seq sous R 28 Importez un des BAM générés précédemment en utilisant ScanBamParam et readGAlignments TP Explorez les informations contenues
Analyse de données de ChIP-seq sous R 29 Téléchargez le fichier BED référençant le régions blacklistées du génome hg19 Convertissez les coordonnées hg19 vers hg38 via liftOver TP
Analyse de données de ChIP-seq sous R 32 Principe du peakcallingsans contrôle avec csaw Comptage Comptage Signal / Bruit Valeur seuil Alignements Evaluation du signal Evaluation du bruit Ratio Signal / Bruit median
Analyse de données de ChIP-seq sous R 33 Générez les matrices de comptages dans des fenêtres chevauchantes de 150 bp Générez les matrices de comptages dans des fenêtres non-chevauchantes de 2000 bp Evaluez l’enrichissement local TP
Analyse de données de ChIP-seq sous R 35 Définissez le seuil discriminant signal / background Filtrez les régions pour lesquelles le ratio signal / background < log2 (2.5) TP
données de ChIP-seq sous R 37 Spécificité de la normalisation pour les données de ChIP-seq Pourquoi normaliser Différence de taille entre les librairies (composition) Différence d’efficacité de l’immuno-précipitation (efficacité) Variabilité technique classique Comment normaliser • Pour la composition : • Normalisation par le nombre de reads totaux (RPM) • Scaling factors (TMM & DESeq2) • Pour l’efficacité : • Scaling factors (TMM & DESeq2) • Normalisation non-linéaire (Lowess, quantiles) A prendre en compte Mutuellement exclusives
données de ChIP-seq sous R 38 Spécificité de la normalisation pour les données de ChIP-seq • Est-ce que l’on considère que les différences systématiques dans les régions où les comptages sont élevés sont de vrais positifs ? • OUI : Normalisation pour la composition Permet de préserver ces différences observées • NON : Normalisation pour l’efficacité Permet de lisser le différentiel d’efficacité de l’IP • Dépend de la question biologique : • KO vs wild-type : nombreuses différences attendues - Normalisation pour la composition • Profilage d’histones : peu de différences attendues - Normalisation pour l’efficacité Hypothèse : La plupart des pics ne sont pas différentiels
données de ChIP-seq sous R 39 Spécificité de la normalisation pour les données de ChIP-seq Evaluer l ’effort de normalisation Ratio des comptages Moyenne des comptage Composition Efficacité MA plot Rep 1 vs Rep 2 Signal Background MA plot Condition 1 vs Condition 2 Régions différentielles Régions non différentielles
données de ChIP-seq sous R 40 Spécificité de la normalisation pour les données de ChIP-seq Ligne matérialisant la normalisation pour la composition à passe à travers le nuage « background » Ligne matérialisant la normalisation pour l’efficacité à passe à travers le nuage « signal » Efficacité Composition MA plot Rep 1 vs Rep 2 Signal Background MA plot Condition 1 vs Condition 2 Régions différentielles Régions non différentielles
données de ChIP-seq sous R 41 Spécificité de la normalisation pour les données de ChIP-seq M ≠ 0 pour le background à biais de composition M ≠ 0 pour le signal à différence systématique pour les régions très couvertes, artefactuelle ou non biais d’efficacité possible Efficacité Composition MA plot Rep 1 vs Rep 2 Signal Background MA plot Condition 1 vs Condition 2 Régions différentielles Régions non différentielles
données de ChIP-seq sous R 46 Procédez à l’analyse différentielle avec EdgeR TP • BCV = racine carrée de la dispersion (loi NB) • Dispersion tagwise à variabilité importante pour les régions à faible comptage • Dispersion common à 20 %, les comptages sont très reproductibles, peu de variabilité • Dispersion trended à le nuage de point est réparti au dessus et en dessous, suggérant que le modèle a été correctement ajusté • Pour la plupart des jeux de données, on s’attend à une tendance qui décroit pour se stabiliser à un plateau à plus grande robustesse pour les comptages plus importants Common Tagwise Trended
multiples - Analyse de données de ChIP-seq sous R 47 Clusterisezles fenêtres adjacentes et évaluer le FDR Définissez, pour chaque cluster, la fenêtre la plus représentative TP
- Analyse de données de ChIP-seq sous R 50 Qu’est ce que les formats WIG / BIGWIG / BEGRAPH ? • Format utiliser pour stocker des informations de visualisation denses et continues (e.g. contenu en GC, probabilité, couverture en reads) • BIGWIG : format binaire, plus léger et en général recommandé • WIG : format ASCII, données continues • BEDGRAPH : format ASCII, données sparses Qu’est ce que le format BED ? • « Browser Extensible Data » • Format tabulaire adapté à l’affichage de données d’intervalles sur les « genome browsers » (UCSC, Ensembl, IGV …)
Analyse de données de ChIP-seq sous R 64 Pourquoi utiliser des outils adaptés au ChIP-seq ? FET et dérivés DAVID, METASCAPE Chaque gène a une probabilité identique d’être « significatif » Proportion similaire de gènes « significatifs » dans chaque gene set testés • NGS : corrélation positive entre la longueur du gène et la probabilité de le définir « significatif » • ChIP-seq : la probabilité qu’un gène présente un pic est proportionnelle à sa longueur • Les gènes plus longs apportent une contribution disproportionnée au signal d’enrichissement à Hypothèses du FET invalidées • Par ailleurs, la distribution en taille n’est pas homogène dans les gene sets Nervous system development (GO BP) rRNA processing (GO BP) Hypothèses
Analyse de données de ChIP-seq sous R 65 Pourquoi utiliser des outils adaptés au ChIP-seq ? Test binomial GREAT Le nombre de pics dans un locus est proportionnel à la taille du locus La variabilité en terme de nombre de pics par gène est proportionnelle à la taille du locus • 63 ENCODE ChIP-seq GM12878 Hypothèses Ryan P. Welch, Chee Lee, Paul M. Imbriano, Snehal Patil, Terry E. et al. “ChIP-Enrich: gene set enrichment testing for ChIP-seq data.” NAR 2014
Analyse de données de ChIP-seq sous R 66 Pourquoi utiliser des outils adaptés au ChIP-seq ? Chip-Enrich Ajustement pour la relation entre taille du locus et nombre de pics Ajustement pour la mappabilité Hypothèses Ryan P. Welch, Chee Lee, Paul M. Imbriano, Snehal Patil, Terry E. et al. “ChIP-Enrich: gene set enrichment testing for ChIP-seq data.” NAR 2014 Modèle 1 – FET Modèle 2 – Binomial Modèle 3 – Chip-Enrich Observations Relationship between the probability of a gene being assigned a peak and locus length.
Analyse de données de ChIP-seq sous R 67 Pourquoi utiliser des outils adaptés au ChIP-seq ? Chip-Enrich Ajustement pour la relation entre taille du locus et nombre de pics Ajustement pour la mappabilité Hypothèses Ryan P. Welch, Chee Lee, Paul M. Imbriano, Snehal Patil, Terry E. et al. “ChIP-Enrich: gene set enrichment testing for ChIP-seq data.” NAR 2014 Modèle 1 – FET Modèle 2 – Binomial Modèle 3 – Chip-Enrich Observations Relationship between the probability of a gene being assigned a peak and locus length.