WEBVTT
Kind: captions
Language: fr

00:00:01.170 --> 00:00:07.620
Bonjour à tous. Je parlerai aujourd'hui de
travaux de calcul sur le problème de la liaison

00:00:07.620 --> 00:00:10.021
des peptides, en collaboration avec George
Vasmatzis de la Mayo Clinic.

00:00:10.021 --> 00:00:13.540
En ce qui concerne le COVID-19, nous avons
tous entendu dire que la maladie se comporte

00:00:13.540 --> 00:00:20.010
comme n'importe quelle autre maladie. La gravité
des symptômes varie d'une personne à l'autre,

00:00:20.010 --> 00:00:25.220
mais elle est peut-être plus prononcée avec
le COVID-19 qu'avec d'autres maladies. Une

00:00:25.220 --> 00:00:31.400
bonne partie des personnes qui contractent
le virus ne présentent aucun symptôme. La

00:00:31.400 --> 00:00:36.680
plupart d'entre elles ne présentent aucun
symptôme ou présentent des symptômes légers,

00:00:36.680 --> 00:00:42.090
mais une fraction importante présente des
symptômes graves. Et bien sûr, un petit

00:00:42.090 --> 00:00:46.660
nombre de personnes présentent des symptômes
critiques, voire meurent. De nombreux facteurs

00:00:46.660 --> 00:00:52.340
influencent donc la gravité de la maladie
et les experts peuvent en parler mieux que

00:00:52.340 --> 00:00:57.930
moi. L'âge, le sexe et, en particulier, les
comorbidités sont très importants et l'exposition

00:00:57.930 --> 00:01:03.510
passée à des virus similaires joue un rôle,
mais une partie de l'équation en termes de

00:01:03.510 --> 00:01:09.530
gravité de la maladie est également constituée
par les différences innées de nos systèmes

00:01:09.530 --> 00:01:16.830
immunitaires. En fait, les gènes que nous
avons hérités de nos parents jouent un rôle

00:01:16.830 --> 00:01:24.220
dans la capacité de notre organisme à combattre
cette maladie ou la plupart des maladies.

00:01:24.220 --> 00:01:31.610
Notre sujet d'étude consiste donc à prédire
par calcul un aspect de la différence innée

00:01:31.610 --> 00:01:37.759
dans ce qu'on appelle la réponse cellulaire
du système immunitaire d'un individu.

00:01:37.759 --> 00:01:44.100
La réponse cellulaire est donc la première
ligne de défense de notre organisme face

00:01:44.100 --> 00:01:47.619
à une infection virale. Il s'agit du mécanisme
par lequel les peptides étrangers introduits

00:01:47.619 --> 00:01:51.780
dans les cellules sont découpés en petits
fragments appelés peptides. Ceux-ci peuvent

00:01:51.780 --> 00:01:58.130
alors être transportés à la surface des
cellules où ils peuvent se lier à des récepteurs

00:01:58.130 --> 00:02:02.460
de la surface cellulaire appelés molécules
de classe 1 du CMH [complexe majeur d'histocompatibilité].

00:02:02.460 --> 00:02:07.920
Si elles sont ainsi liées, les cellules infectées
deviennent des cibles pour les lymphocytes

00:02:07.920 --> 00:02:13.920
T tueurs qui peuvent venir tuer les cellules
infectées - qu'elles soient tuées par une

00:02:13.920 --> 00:02:19.570
infection virale ou, comme il s'avère, qu'il
s'agit de la défense la plus efficace dont

00:02:19.570 --> 00:02:21.881
nous disposons contre le cancer. Les cellules
cancéreuses sont également éliminées de

00:02:21.881 --> 00:02:26.150
cette manière. Il s'agit de la première
ligne de défense, car si elle se met en place

00:02:26.150 --> 00:02:30.470
une fois que nous sommes infectés, le système
immunitaire - les cellules T tueuses - peut

00:02:30.470 --> 00:02:33.989
tuer toutes les cellules infectées avant
qu'elles n'aient une chance de se développer.

00:02:33.989 --> 00:02:39.180
Mais si la réponse cellulaire échoue, les
cellules infectées deviennent des usines.

00:02:39.180 --> 00:02:44.970
Elles commencent à produire de nombreuses
copies du virus et d'autres aspects du système

00:02:44.970 --> 00:02:50.630
immunitaire doivent prendre le relais.
La réponse cellulaire est donc - comme tous

00:02:50.630 --> 00:02:55.120
les aspects de l'immunologie - complexe. Il
est très important de la comprendre. Elle

00:02:55.120 --> 00:02:59.340
est essentielle pour comprendre et prédire
la gravité des nouveaux virus tels que le

00:02:59.340 --> 00:03:03.170
SRAS-CoV-2, pour le développement de vaccins
ciblant les virus, ainsi que pour comprendre

00:03:03.170 --> 00:03:07.000
l'impact des mutations virales. Je reviens
sans cesse sur le sujet de l'immunothérapie

00:03:07.000 --> 00:03:11.420
du cancer, qui est le domaine d'expertise
de mon collaborateur. Comme beaucoup de gens,

00:03:11.420 --> 00:03:17.140
nous nous sommes intéressés à COVID-19
et nous avons réorienté les compétences.

00:03:17.140 --> 00:03:22.060
Ainsi, dans ce cas, les prédictions informatiques
ciblent à l'origine l'immunothérapie du

00:03:22.060 --> 00:03:27.680
cancer. Bien entendu, la même théorie s'applique
aux maladies auto-immunes. La réponse immunitaire

00:03:27.680 --> 00:03:35.830
cellulaire est donc, à la base, un problème
de calcul. Si nous avons les peptides bleus

00:03:35.830 --> 00:03:43.610
dans la figure de droite, il s'agit du fragment
de protéine associé au virus. La question

00:03:43.610 --> 00:03:47.110
est la suivante : ce peptide bleu va-t-il
se lier à l'intérieur d'un sillon ou d'une

00:03:47.110 --> 00:03:53.410
fente à l'intérieur de la molécule de surface
de la cellule jaune, la molécule CMH 1 ? La

00:03:53.410 --> 00:03:58.280
réponse immunitaire dépendra alors de la
fixation de ce fragment de protéine et du

00:03:58.280 --> 00:04:03.730
fait qu'il se fixe suffisamment bien pour
que les cellules T tueuses le reconnaissent.

00:04:03.730 --> 00:04:08.940
Les fragments bleus provenant du virus sont
nouveaux. Ainsi, avec un nouveau virus, nous

00:04:08.940 --> 00:04:13.459
aurons un ensemble de peptides complètement
nouveau. Les molécules jaunes de la surface

00:04:13.459 --> 00:04:18.079
cellulaire sont déterminées par nos gènes
et chaque individu possède jusqu'à six molécules

00:04:18.079 --> 00:04:23.050
différentes du CMH 1 déterminées par notre
héritage - trois de chaque parent. Les molécules

00:04:23.050 --> 00:04:28.389
de surface cellulaire, les molécules du CMH,
sont parmi les plus diverses de notre génome

00:04:28.389 --> 00:04:33.940
; il existe environ 21 000 variantes dans
la population humaine. Ce n'est pas un hasard.

00:04:33.940 --> 00:04:39.050
L'évolution a fait en sorte que cet aspect
de notre système immunitaire soit très diversifié

00:04:39.050 --> 00:04:42.449
afin que nous puissions survivre aux infections
virales passées.

00:04:42.449 --> 00:04:47.370
Mais cela pose également un défi informatique
très important, comme je vais le décrire.

00:04:47.370 --> 00:04:52.680
Le problème central auquel nous nous attaquons
est donc de savoir comment appliquer l'informatique

00:04:52.680 --> 00:05:00.639
pour prédire si le peptide bleu se liera
à la molécule jaune de la surface cellulaire,

00:05:00.639 --> 00:05:06.750
et ce pour une très large gamme de peptides,
tous ceux qui sont associés au virus, et

00:05:06.750 --> 00:05:12.720
pour une très large gamme de récepteurs
de la surface cellulaire, les molécules du

00:05:12.720 --> 00:05:14.670
CMH 1. Il y a eu beaucoup de travaux antérieurs
- des travaux computationnels antérieurs.

00:05:14.670 --> 00:05:16.000
Les travaux expérimentaux ont bien sûr fourni
des informations moléculaires sur la structure

00:05:16.000 --> 00:05:19.310
de ces molécules, et les travaux informatiques
qui ont été très fructueux ont consisté

00:05:19.310 --> 00:05:22.910
à appliquer un apprentissage automatique
- ce qui n'est pas une surprise pour ceux

00:05:22.910 --> 00:05:26.620
qui ont une formation en informatique et en
réseaux neuronaux. Il existe donc un logiciel

00:05:26.620 --> 00:05:30.030
appelé NetMHC qui a été formé de manière
intensive sur les données expérimentales

00:05:30.030 --> 00:05:33.030
avec la force de liaison pour les paires connues
de molécules bleu-jaune - les paires de peptides

00:05:33.030 --> 00:05:39.460
du CMH 1. Sur la base d'une structure de réseau
neuronal, ce programme peut prédire la force

00:05:39.460 --> 00:05:46.759
de liaison d'un nouveau peptide. Cette inférence
est basée sur une simple séquence peptidique,

00:05:46.759 --> 00:05:52.680
de sorte que la séquence de lettres, c'est-à-dire
les acides aminés du peptide, est associée

00:05:52.680 --> 00:05:56.789
à une étiquette correspondant à la molécule
de surface cellulaire, la molécule du CMH

00:05:56.789 --> 00:06:03.300
1. Il y a une force. Ce sont toutes les données
expérimentales. Ainsi, avec plusieurs milliers

00:06:03.300 --> 00:06:10.800
de paires de ce type, le réseau neuronal
peut être entraîné. Une fois qu'il est

00:06:10.800 --> 00:06:15.250
entraîné, il peut prédire, à partir d'une
nouvelle séquence peptidique, d'une nouvelle

00:06:15.250 --> 00:06:21.990
séquence d'acides aminés, dans quelle mesure
ce peptide se liera à une molécule donnée

00:06:21.990 --> 00:06:27.759
du CMH 1. Ici, la séquence peptidique serait
la molécule peptidique bleue dans le dessin,

00:06:27.759 --> 00:06:30.780
et l'étiquette correspondrait au récepteur
jaune de la surface cellulaire, la molécule

00:06:30.780 --> 00:06:35.680
du CMH 1. Les réseaux neuronaux sont puissants
dans la mesure où ils peuvent être facilement

00:06:35.680 --> 00:06:41.099
entraînés et où ils peuvent très efficacement
faire des prédictions sur la base des données

00:06:41.099 --> 00:06:46.509
qui leur sont fournies. Mais la limite ici
est qu'il n'y a absolument aucune donnée

00:06:46.509 --> 00:06:50.410
moléculaire, nous formons simplement des
étiquettes et des lettres, et les données

00:06:50.410 --> 00:06:53.849
de formation proviennent d'un ensemble très
diversifié de données expérimentales. Une

00:06:53.849 --> 00:06:59.060
grande partie de ces données provient par
exemple du VIH, un virus différent, et des

00:06:59.060 --> 00:07:04.620
peptides associés au VIH. Le problème est
qu'avec un tout nouveau virus comme le SARS-CoV-2,

00:07:04.620 --> 00:07:09.500
la plupart des peptides n'ont jamais été
vus auparavant, et un réseau neuronal fera

00:07:09.500 --> 00:07:14.340
des prédictions erronées parce qu'il fait
des déductions à partir d'une région très

00:07:14.340 --> 00:07:18.430
différente de l'espace peptidique.
Notre approche consisterait donc à effectuer

00:07:18.430 --> 00:07:23.340
des simulations au niveau moléculaire et,
bien entendu, de nombreux travaux ont déjà

00:07:23.340 --> 00:07:27.319
été réalisés sur ce sujet. Des techniques
de simulation moléculaire très sophistiquées

00:07:27.319 --> 00:07:30.970
sont connues et largement utilisées. L'une
d'entre elles s'appelle la dynamique moléculaire.

00:07:30.970 --> 00:07:36.240
Il existe également des simulations basées
sur la méthode de Monte Carlo. Elles utilisent

00:07:36.240 --> 00:07:42.100
une technique appelée recuit simulé, et
le docking moléculaire est une autre approche.

00:07:42.100 --> 00:07:46.680
Les logiciels disponibles pour ces simulations
au niveau moléculaire sont largement utilisés,

00:07:46.680 --> 00:07:50.400
mais ils sont spéciaux. Ils sont d'usage
général. Ils ont été développés pour

00:07:50.400 --> 00:07:57.210
de larges classes de molécules à lier et
sont extrêmement gourmands en ressources

00:07:57.210 --> 00:08:02.740
informatiques. Si l'on prend un peptide, une
paire du CMH 1, et que l'on utilise les logiciels

00:08:02.740 --> 00:08:12.199
existants pour le simuler, il faut des jours,
voire des semaines, pour simuler un seul événement

00:08:12.199 --> 00:08:17.460
de liaison. Il faut donc des semaines de supercalculateur
pour faire une seule prédiction. L'ampleur

00:08:17.460 --> 00:08:22.420
du problème auquel nous sommes confrontés
est la suivante : nous avons 21 000 variantes

00:08:22.420 --> 00:08:27.509
des molécules de surface des cellules jaunes,
les molécules CMH1, et pour le SARS-CoV-2,

00:08:27.509 --> 00:08:32.470
si nous nous concentrons uniquement sur la
protéine de pointe et que nous la découpons

00:08:32.470 --> 00:08:37.560
en petits morceaux pour les peptides, nous
en avons environ 38 000. Nous parlons donc

00:08:37.560 --> 00:08:41.789
d'un milliard de combinaisons que nous voulons
simuler en termes de souche, et s'il faut

00:08:41.789 --> 00:08:46.720
une semaine de temps de supercalculateur pour
chacune, nous ne disposons évidemment pas

00:08:46.720 --> 00:08:51.230
d'un milliard de semaines pour étudier cela.
Notre approche est donc double. D'une part,

00:08:51.230 --> 00:08:55.150
nous créons un logiciel hautement personnalisé
pour la simulation moléculaire et nous utilisons

00:08:55.150 --> 00:09:00.460
les détails du domaine dans lequel nous travaillons.
Nous commençons donc par le peptide. Les

00:09:00.460 --> 00:09:06.030
peptides ne varient pas tellement en termes
de longueur ou de forme. Nous commençons

00:09:06.030 --> 00:09:11.600
avec les peptides correctement alignés à
l'intérieur de la fente de la molécule de

00:09:11.600 --> 00:09:16.840
surface cellulaire, la molécule du CMH 1,
de sorte que nous ne passons pas beaucoup

00:09:16.840 --> 00:09:21.380
de temps à faire tourner l'ensemble du peptide
dans l'espace. Nous le plaçons exactement

00:09:21.380 --> 00:09:26.730
là où il doit être et nous effectuons toute
la recherche dans l'espace de torsion. Ainsi,

00:09:26.730 --> 00:09:32.810
au lieu de déplacer la molécule dans l'espace
tridimensionnel, nous nous contentons de tordre

00:09:32.810 --> 00:09:38.140
et de tourner ses liaisons pour essayer de
trouver la configuration optimale. L'autre

00:09:38.140 --> 00:09:41.620
contribution est que nous déployons ce système
à grande échelle. Nous utilisons donc des

00:09:41.620 --> 00:09:45.570
GPU et, à terme, une infrastructure informatique
en nuage, pour mettre toute la puissance de

00:09:45.570 --> 00:09:52.649
calcul au service du problème. Et notre objectif,
comme je l'ai indiqué dans le titre, est

00:09:52.649 --> 00:09:58.120
de transformer un milliard de jours en un
million de minutes ou peut-être un mois de

00:09:58.120 --> 00:10:04.459
temps de calcul en nuage.
Le défi est donc là et je vais en parler

00:10:04.459 --> 00:10:09.750
brièvement - je n'ai presque plus de temps.
Une chose : les données expérimentales ne

00:10:09.750 --> 00:10:15.490
sont pas complètes. Nous ne disposons pas
de modèles moléculaires complets, non seulement

00:10:15.490 --> 00:10:24.970
pour les 21 000 variantes, mais nous ne disposons
même pas d'une bonne répartition géographique.

00:10:24.970 --> 00:10:29.959
Cela rejoint certains des exposés précédents.
La plupart des données expérimentales concernent

00:10:29.959 --> 00:10:34.130
la variance des molécules du CMH 1 issues
de la démographie caucasienne occidentale.

00:10:34.130 --> 00:10:42.110
L'autre approche consiste donc à déduire
la structure des molécules, puis à les simuler.

00:10:42.110 --> 00:10:46.459
Dernière diapositive : l'impact de ces travaux.
Il est relativement simple de déterminer

00:10:46.459 --> 00:10:52.260
les gènes d'un individu qui codent pour les
molécules concernées, les molécules du

00:10:52.260 --> 00:10:58.029
CMH 1. Cela peut se faire par le biais du
typage HLA, qui est utilisé pour les tests

00:10:58.029 --> 00:11:03.630
de paternité. Grâce à ces informations
et à notre infrastructure informatique, nous

00:11:03.630 --> 00:11:11.720
serons en mesure de prédire la réaction
d'un individu à un nouveau pathogène, à

00:11:11.720 --> 00:11:15.940
un virus, à des variantes du virus pour différents
individus, ainsi que l'effet de différents

00:11:15.940 --> 00:11:20.550
vaccins sur différents virus pour différents
individus. Et bien sûr, comme je l'ai dit

00:11:20.550 --> 00:11:26.320
au début, ce travail ne s'appliquera pas
seulement aux virus, mais aussi potentiellement

00:11:26.320 --> 00:11:32.380
à l'immunothérapie du cancer et aux maladies
auto-immunes. Je m'arrêterai donc là. Je

00:11:32.380 --> 00:11:41.189
vous remercie de votre attention.

