WEBVTT
Kind: captions
Language: fr

00:00:01.760 --> 00:00:04.670
Merci à Florence, à Lauren et à tous les
membres de l'équipe COVID Info Commons.

00:00:04.670 --> 00:00:11.580
J'ai fait un premier exposé il y a environ
un an et demi et, à la fin de cet exposé,

00:00:11.580 --> 00:00:19.440
je ferai le point sur ce qui en a résulté
et sur une nouvelle collaboration qui s'est

00:00:19.440 --> 00:00:20.810
mise en place.

00:00:20.810 --> 00:00:26.740
Mais je voulais parler de notre archive de
données COVID-19, COVID-ARC en abrégé.

00:00:26.740 --> 00:00:30.070
Je suis professeur adjoint à l'Université
de Californie du Sud, à la Keck School of

00:00:30.070 --> 00:00:32.099
Medicine, dans le laboratoire de neuro-imagerie.

00:00:32.099 --> 00:00:37.030
Dans notre laboratoire, nous avons donc beaucoup
d'expérience dans la création d'archives

00:00:37.030 --> 00:00:42.100
de données multimodales à grande échelle,
principalement pour les données cérébrales.

00:00:42.100 --> 00:00:46.789
Mais au début de la pandémie, nous avons
pensé que nous pourrions utiliser notre expérience

00:00:46.789 --> 00:00:51.730
et nos ressources avec toutes ces archives
de données pour développer une archive de

00:00:51.730 --> 00:00:52.730
données COVID-19.

00:00:52.730 --> 00:00:57.940
Nous avons donc reçu une bourse RAPID de
la NSF pour développer ces archives de données

00:00:57.940 --> 00:00:58.940
appelées COVID-ARC.

00:00:58.940 --> 00:01:03.920
Ce que nous faisons, c'est regrouper différents
types de données COVID-19 ainsi que des ressources

00:01:03.920 --> 00:01:09.430
et nous avons construit une plateforme d'archives
centralisées et en réseau qui stockent,

00:01:09.430 --> 00:01:13.410
conservent, visualisent et diffusent les données
multimodales COVID-19.

00:01:13.410 --> 00:01:20.810
Nous disposons d'un grand nombre d'ensembles
de données provenant du monde entier.

00:01:20.810 --> 00:01:25.700
Nous avons donc travaillé avec les fournisseurs
de données pour mettre au point des accords

00:01:25.700 --> 00:01:28.119
d'utilisation des données adaptés à leurs
besoins.

00:01:28.119 --> 00:01:35.570
Les métadonnées sont également disponibles
sur le site web, de sorte que si les utilisateurs

00:01:35.570 --> 00:01:43.790
souhaitent demander l'accès à ces données,
nous facilitons le processus.

00:01:43.790 --> 00:01:50.810
Mais ce sont les fournisseurs de données
qui prennent la décision finale.

00:01:50.810 --> 00:01:56.380
Une grande partie des données est stockée
sur notre site à l'USC, mais certains ensembles

00:01:56.380 --> 00:02:01.579
de données sont stockés sur le site où
les données ont été collectées et nous

00:02:01.579 --> 00:02:06.600
disposons des métadonnées pour que les gens
puissent les consulter.

00:02:06.600 --> 00:02:14.330
Une grande partie de notre travail a consisté
à harmoniser les métadonnées, afin de faciliter

00:02:14.330 --> 00:02:24.000
la recherche sur les cohortes regroupées
et de permettre aux chercheurs d'effectuer

00:02:24.000 --> 00:02:30.310
différents types d'analyses sur différents
sites, plutôt que de se concentrer sur un

00:02:30.310 --> 00:02:31.810
seul d'entre eux.

00:02:31.810 --> 00:02:39.260
Dans quelques diapositives, je parlerai de
certains de ces défis et de la raison pour

00:02:39.260 --> 00:02:41.920
laquelle nous travaillons sur l'harmonisation.

00:02:41.920 --> 00:02:49.410
Nous avons également intégré des outils
de visualisation, de contrôle de la qualité

00:02:49.410 --> 00:02:50.410
et d'analyse.

00:02:50.410 --> 00:02:52.830
Encore une fois, pour aider les chercheurs
- juste pour accélérer la recherche sur

00:02:52.830 --> 00:02:53.830
COVID-19.

00:02:53.830 --> 00:03:00.730
En plus de tout le travail d'archivage et
d'harmonisation des données, nous effectuons

00:03:00.730 --> 00:03:07.650
également différents types d'analyses sur
les données dont nous disposons et nous utilisons

00:03:07.650 --> 00:03:14.360
les principes de rétroaction et la science
des données pour étudier divers aspects

00:03:14.360 --> 00:03:15.360
de COVID-19.

00:03:15.360 --> 00:03:22.260
En ce qui concerne les données, nous disposons
de différents types de données - une grande

00:03:22.260 --> 00:03:26.020
partie d'entre elles se concentre sur les
images de tomodensitométrie et de radiographie,

00:03:26.020 --> 00:03:32.740
mais nous avons aussi des données cliniques
qui comprennent les symptômes, les constantes,

00:03:32.740 --> 00:03:36.780
les comorbidités, les données démographiques,
les antécédents du patient, la géolocalisation.

00:03:36.780 --> 00:03:41.610
Nous disposons également - pour l'imagerie
- d'ultrasons et d'IRM, ainsi que de données

00:03:41.610 --> 00:03:42.610
EEG.

00:03:42.610 --> 00:03:48.410
Nous avons également fourni des masques pulmonaires,
des masques d'infection et des annotations

00:03:48.410 --> 00:03:49.410
de radiologues.

00:03:49.410 --> 00:03:54.129
Vous pouvez voir ici que nous utilisons le
système de transfert de fichiers crypté

00:03:54.129 --> 00:03:58.450
à grande vitesse d'IBM, conforme à la HIPAA,
appelé ASPERA, qui permet aux fournisseurs

00:03:58.450 --> 00:04:02.670
de données de transférer facilement des
données à COVID-ARC et aux utilisateurs

00:04:02.670 --> 00:04:06.620
de télécharger des données de COVID-ARC
sur leurs ordinateurs.

00:04:06.620 --> 00:04:12.739
À l'heure actuelle, nous disposons de 28
ensembles de données provenant du monde entier.

00:04:12.739 --> 00:04:18.509
Comme vous pouvez l'imaginer, il existe des
incohérences dans la dénomination des fichiers,

00:04:18.509 --> 00:04:23.010
dans le formatage des métadonnées, dans
les infrastructures de stockage, ainsi que

00:04:23.010 --> 00:04:26.350
d'autres différences entre ces ensembles
de données.

00:04:26.350 --> 00:04:31.639
Nous avons donc rassemblé toutes ces données
dans une archive centralisée et nous avons

00:04:31.639 --> 00:04:37.270
veillé à ce que le nom et l'organisation
des fichiers soient cohérents, que le formatage

00:04:37.270 --> 00:04:40.390
des métadonnées soit cohérent et qu'il
soit facile de télécharger plusieurs ensembles

00:04:40.390 --> 00:04:42.990
de données à partir d'un seul endroit à
l'aide d'ASPERA.

00:04:42.990 --> 00:04:46.490
Voici une capture d'écran d'une partie des
données dont nous disposons.

00:04:46.490 --> 00:04:53.440
Je n'ai pas pu tout mettre sur une seule diapositive,
mais vous pouvez voir que si vous allez sur

00:04:53.440 --> 00:04:56.430
covid-arc.loni.usc.edu, vous pouvez trouver
les données dont nous disposons.

00:04:56.430 --> 00:05:02.250
Vous pouvez voir le numéro du site, l'endroit
où les données ont été collectées, les

00:05:02.250 --> 00:05:07.290
modalités, les formats de fichiers, toutes
les métadonnées que nous avons en plus,

00:05:07.290 --> 00:05:10.400
et ensuite le nombre d'images qu'il y a.

00:05:10.400 --> 00:05:14.280
Certaines d'entre elles sont réparties entre
COVID et non COVID.

00:05:14.280 --> 00:05:18.970
Nous disposons également d'informations sur
la disponibilité publique ou non des données.

00:05:18.970 --> 00:05:24.280
Maintenant, je voudrais juste mettre en lumière
quelques-uns des projets sur lesquels mes

00:05:24.280 --> 00:05:28.210
étudiants ont travaillé, ils ont été très
productifs et ont fait des recherches vraiment

00:05:28.210 --> 00:05:29.210
passionnantes.

00:05:29.210 --> 00:05:34.639
J'ai quelques expériences de recherche NSF
pour les étudiants de premier cycle et Aksh

00:05:34.639 --> 00:05:35.740
Garg est l'un d'entre eux.

00:05:35.740 --> 00:05:39.620
Il a commencé alors qu'il était au lycée
et il est maintenant en première année de

00:05:39.620 --> 00:05:40.620
licence à Stanford.

00:05:40.620 --> 00:05:46.190
La semaine dernière, son article a été
accepté dans Expert Systems with Applications

00:05:46.190 --> 00:05:52.569
et il a comparé 40 architectures de réseaux
neuronaux convolutifs pour distinguer le COVID

00:05:52.569 --> 00:06:00.210
du non COVID et il a découvert que le meilleur
modèle EfficientNet-B5 donnait une sensibilité

00:06:00.210 --> 00:06:02.710
et une spécificité extrêmement élevées
en termes de précision.

00:06:02.710 --> 00:06:09.030
Le modèle s'appuyait également sur des caractéristiques
cliniques pertinentes, telles que les opacités

00:06:09.030 --> 00:06:15.460
de verre et les consolidations, qui sont souvent
observées chez les patients atteints de COVID.

00:06:15.460 --> 00:06:21.560
Un autre projet - Alex Bruckhaus est un autre
lauréat de la REU, dont les travaux ont été

00:06:21.560 --> 00:06:26.130
publiés dans le Journal of Immigrant and
Minority Health - lui et d'autres étudiants

00:06:26.130 --> 00:06:29.610
se sont penchés sur la dynamique de la vaccination
en Californie.

00:06:29.610 --> 00:06:34.130
Ils se sont donc penchés sur ce que l'on
appelle l'indice de vulnérabilité sociale

00:06:34.130 --> 00:06:38.330
(Social Vulnerability Index, SVI), qui comporte
quatre thèmes, à savoir le statut socio-économique,

00:06:38.330 --> 00:06:47.310
la composition du ménage et le handicap,
le type de logement et le transport, ainsi

00:06:47.310 --> 00:06:51.389
que le statut de minorité et la langue.

00:06:51.389 --> 00:06:57.889
Ils ont constaté que la couverture vaccinale
la plus faible se trouvait dans les groupes

00:06:57.889 --> 00:06:58.889
à forte vulnérabilité.

00:06:58.889 --> 00:07:06.240
Le statut minoritaire et la langue ont donné
lieu à la plus grande disparité de couverture

00:07:06.240 --> 00:07:16.110
entre les comtés à faible vulnérabilité
et ceux à forte vulnérabilité.

00:07:16.110 --> 00:07:27.020
Je pense donc qu'il s'agit d'un travail très
important, en particulier au moment où nous

00:07:27.020 --> 00:07:36.680
essayons de vacciner une plus grande partie
de la population.

00:07:36.680 --> 00:07:44.660
Un autre article publié par Alex Bruckhaus
et d'autres étudiants portait sur les taux

00:07:44.660 --> 00:07:49.360
d'infection après le confinement à la suite
des réouvertures.

00:07:49.360 --> 00:07:59.080
Ils ont donc étudié 83 comtés des États-Unis
où le nombre de cas de COVID-19 était élevé

00:07:59.080 --> 00:08:00.080
l'année dernière.

00:08:00.080 --> 00:08:07.409
Ils ont examiné différents types d'entreprises
et ont fait la distinction entre une réouverture

00:08:07.409 --> 00:08:09.479
totale et une réouverture partielle.

00:08:09.479 --> 00:08:19.110
Ils ont étudié les variations des taux d'infection
avant et après ces réouvertures et ont cherché

00:08:19.110 --> 00:08:27.770
à savoir quelles entreprises avaient le plus
d'impact sur l'augmentation des taux d'infection.

00:08:27.770 --> 00:08:34.700
Les bars et les salles de sport ont joué
un rôle important à cet égard.

00:08:34.700 --> 00:08:40.210
Yujia Zhang, qui est mon assistante sur ce
projet, a réalisé l'année dernière un

00:08:40.210 --> 00:08:45.910
article de synthèse sur l'association entre
le groupe sanguin et le COVID-19.

00:08:45.910 --> 00:08:57.700
Elle a donc examiné 23 études qui présentaient
une vue d'ensemble du groupe sanguin en tant

00:08:57.700 --> 00:09:03.670
que facteur de risque et de protection, de
la manière dont certains groupes sanguins

00:09:03.670 --> 00:09:08.310
sont susceptibles d'être testés positifs
et des résultats cliniques de la gravité.

00:09:08.310 --> 00:09:12.570
Elle a également examiné les associations
génétiques et les mécanismes moléculaires

00:09:12.570 --> 00:09:13.570
sous-jacents potentiels.

00:09:13.570 --> 00:09:21.300
Azrin Khan, qui a bénéficié d'une bourse
REU au cours des deux derniers étés, travaille

00:09:21.300 --> 00:09:27.209
sur un projet de segmentation des poumons
basée sur un seuil.

00:09:27.209 --> 00:09:33.560
Il s'agit d'une méthode de seuillage en plusieurs
étapes qui permet de quantifier les anomalies

00:09:33.560 --> 00:09:37.370
pulmonaires avec de meilleures performances
que les méthodes existantes.

00:09:37.370 --> 00:09:44.990
Et comme je manque de temps, je vais passer
un peu vite, mais je voulais parler d'une

00:09:44.990 --> 00:09:50.779
collaboration qui a commencé à la suite
de la première conférence COVID Info Commons

00:09:50.779 --> 00:09:52.060
que j'ai donnée.

00:09:52.060 --> 00:09:59.769
Michael Pazzani et Albert Hsiao de l'UCSD,
de San Diego, ont également donné des conférences

00:09:59.769 --> 00:10:06.260
et nous avons entamé une collaboration après
cela.

00:10:06.260 --> 00:10:10.990
Nous avons également soumis une proposition
de santé intelligente qui n'a pas été financée,

00:10:10.990 --> 00:10:18.060
mais nous l'avons soumise à nouveau en novembre
dernier, et nous attendons donc de savoir

00:10:18.060 --> 00:10:19.760
ce qu'il en est.

00:10:19.760 --> 00:10:24.640
Mais voici une capture d'écran de l'un des
webinaires de sensibilisation que nous avons

00:10:24.640 --> 00:10:26.779
organisés à l'intention des lycéens du
sud de la Californie, et nos étudiants ont

00:10:26.779 --> 00:10:30.350
collectivement donné des conférences éclair
sur leur projet, ce qui a été une grande

00:10:30.350 --> 00:10:31.350
réussite.

00:10:31.350 --> 00:10:33.210
Je tenais à vous remercier.

00:10:33.210 --> 00:10:38.610
Voici le site web du laboratoire, le site
web COVID-ARC, envoyez-moi un email[duncand@usc.edu]

00:10:38.610 --> 00:10:40.100
si vous avez des questions.

00:10:40.100 --> 00:10:43.059
Je remercie la NSF et le NIH pour leur financement.

