Sébastien Lemieux et son équipe développent des algorithmes de bio-informatique et des méthodes d’intelligence artificielle pour l’analyse de données de transcriptomique, de protéomique et de criblage chimique à haut débit.
Thématique de recherche
Les technologies actuelles de séquençage, de spectrométrie de masse et de criblage produisent des volumes de données qui ne peuvent être interprétés qu’à travers des représentations informatiques intermédiaires. Les séquences sont alignées sur un génome de référence, puis résumées en niveaux d’expression pour quelque 20 000 gènes. Les molécules d’une chimiothèque sont décrites par le graphe des liens chimiques entre leurs atomes.
Ces représentations sont pratiques, mais elles reposent sur des catégories définies par l’humain, incomplètes et révisées continuellement. L’annotation d’un génome laisse de côté les transcrits non canoniques, les nouvelles isoformes et les réarrangements géniques, souvent au moment même où ces événements peuvent distinguer une tumeur d’une autre. La structure d’une molécule, quant à elle, prédit mal son effet biologique.
Le laboratoire s’intéresse à l’information perdue à cette étape. Ses travaux portent sur des représentations construites directement à partir du signal mesuré et sur les architectures d’apprentissage profond capables d’en extraire l’information biologique pertinente.
Objectifs de recherche
L’équipe construit des représentations numériques des données omiques qui ne dépendent pas d’annotation génomique, en travaillant directement à partir des lectures de séquençage, et souvent à très faible profondeur. L’intuition est la même dans les deux cas: pour entraîner un réseau de neurones, la diversité des conditions observées compte davantage que la précision des mesures individuelles. Une imprécision se compense sur un grand nombre d’exemples, alors qu’une information filtrée à la quantification est définitivement perdue.
Ces méthodes sont mises au service de la découverte thérapeutique, en collaboration avec les groupes expérimentaux de l’IRIC. Par exemple, nous représentons numériquement les molécules non pas via leur structure chimique, mais à partir de la réponse transcriptionnelle qu’elles induisent dans une cellule. Caractériser ainsi un grand nombre de composés permet ensuite de prédire des activités thérapeutiques, et d’étendre in silico la portée de criblages expérimentaux nécessairement limités. Ces travaux trouvent leurs applications dans la leucémie et dans l’identification d’antigènes tumoraux en appui au développement de vaccins thérapeutiques.
Axes de recherche
-
Bio-informatique et intelligence artificielle