WEBVTT
Kind: captions
Language: es

00:00:02.240 --> 00:00:05.500
Hola, me llamo Hong Qin y soy profesor en
la Universidad de Tennessee, Chattanooga.

00:00:05.500 --> 00:00:12.559
Esta charla trata de un proyecto en el que
he tenido la suerte de trabajar con un gran

00:00:12.559 --> 00:00:19.699
equipo de colegas de North Carolina A&amp;T, Spelman
College y Catholic University of America.

00:00:19.699 --> 00:00:26.310
Estos son los colaboradores sobre el papel,
pero en realidad son muchos más.

00:00:26.310 --> 00:00:36.130
En nuestra colaboración hemos tenido probablemente
más de una docena de miembros del equipo

00:00:36.130 --> 00:00:39.550
que han estado trabajando en esto.

00:00:39.550 --> 00:00:44.469
Se trata de un proyecto financiado por la
National Science Foundation.

00:00:44.469 --> 00:00:46.879
Se llama PIPP Fase Uno.

00:00:46.879 --> 00:00:55.650
Mi objetivo es desarrollar un marco basado
en IA para predecir y prevenir futuras pandemias

00:00:55.650 --> 00:00:56.650
de coronavirus.

00:00:56.650 --> 00:01:02.660
Aunque digamos que se trata de coronavirus,
el modelo tiene ahora la posibilidad de generalizarse

00:01:02.660 --> 00:01:06.820
a presumiblemente muchas otras pandemias víricas

00:01:06.820 --> 00:01:12.370
Esta es la... vale, se está reenviando automáticamente...

00:01:12.370 --> 00:01:13.759
mis disculpas.

00:01:13.759 --> 00:01:23.470
Bien, este es el resumen que propusimos al
principio, aunque ahora hemos hecho muchas

00:01:23.470 --> 00:01:24.470
modificaciones.

00:01:24.470 --> 00:01:27.189
La idea sigue siendo la misma.

00:01:27.189 --> 00:01:31.230
Proponemos cómo predecir el virus - una nueva
pandemia de virus?

00:01:31.230 --> 00:01:39.170
Nuestra idea es que primero generemos todos
los posibles SARS-CoV-X a partir de los que

00:01:39.170 --> 00:01:46.729
son predecibles basándonos en patrones de
recombinación o cambio de hábitat.

00:01:46.729 --> 00:01:51.700
A continuación, predecimos esas posibles
reacciones del SARS-CoV-X.

00:01:51.700 --> 00:02:01.479
Este es el reto: es fácil generar esas secuencias,
pero ¿cómo sabemos cuál de ellas se volverá

00:02:01.479 --> 00:02:04.680
virulenta o se transmitirá en una población
humana?

00:02:04.680 --> 00:02:09.080
Esa es realmente la clave.

00:02:09.080 --> 00:02:11.390
Así que recurrimos a la IA.

00:02:11.390 --> 00:02:12.870
Cuando digo que la IA es una caja negra, bueno,
en este caso eso es probablemente también

00:02:12.870 --> 00:02:19.130
una bendición porque realmente no sabemos
cómo un virus salta de un huésped, de un

00:02:19.130 --> 00:02:22.730
animal, a un humano para volverse virulento.

00:02:22.730 --> 00:02:29.500
Así que la IA es una caja negra, pero probablemente
sea una gran herramienta que podamos utilizar

00:02:29.500 --> 00:02:31.790
aunque sea una caja negra.

00:02:31.790 --> 00:02:33.620
Ese es mi argumento.

00:02:33.620 --> 00:02:40.030
Y mis disculpas, tuve que tachar ciertas cosas
porque mi Universidad está solicitando una

00:02:40.030 --> 00:02:43.240
patente basada en la función de esto.

00:02:43.240 --> 00:02:50.629
Así que el objetivo es aquí tenemos secuencias
de entrada - esto es sólo secuencias de nucleótidos

00:02:50.629 --> 00:02:51.629
primarios.

00:02:51.629 --> 00:02:55.930
A partir de esta secuencia, vamos a hacer
ingeniería de características para generar

00:02:55.930 --> 00:02:57.750
algunas características útiles.

00:02:57.750 --> 00:03:04.010
A continuación, utilizamos la característica
de secuencia para alimentar nuestro modelo

00:03:04.010 --> 00:03:05.010
de IA.

00:03:05.010 --> 00:03:09.099
Basándonos en nuestro modelo de IA predeciremos
el final.

00:03:09.099 --> 00:03:15.670
Dado el reciente avance de la IA, también
podemos utilizar la simulación dinámica

00:03:15.670 --> 00:03:24.360
[inaudible] o incluso métodos experimentales
para verificar algunos genes candidatos como

00:03:24.360 --> 00:03:26.670
posibles impulsores del cambio de virulencia.

00:03:26.670 --> 00:03:32.590
Dado el modelo de IA, también generalizamos
esto - básicamente usamos el aprendizaje

00:03:32.590 --> 00:03:47.989
por transferencia de los coronavirus, presumiblemente
a otros virus como la gripe o el VIH, el VPH.

00:03:47.989 --> 00:03:49.480
Hay muchos virus.

00:03:49.480 --> 00:03:56.250
En realidad no soy experto en biología, sólo
en informática.

00:03:56.250 --> 00:04:00.019
Y así los desafíos que realmente estamos
tratando con - mis disculpas, es automáticamente

00:04:00.019 --> 00:04:01.110
reenviar de nuevo.

00:04:01.110 --> 00:04:06.920
El reto es realmente predecir la patogenicidad
de las secuencias.

00:04:06.920 --> 00:04:12.710
También podemos encontrar una regla potencial
y probar la capacidad general mediante la

00:04:12.710 --> 00:04:18.060
transformación de predecir el - futuros virus
y predecir el resultado.

00:04:18.060 --> 00:04:21.190
Será AI habilitado, el sistema de alerta
temprana.

00:04:21.190 --> 00:04:24.710
Queremos utilizar la IA para predecir el desarrollo
de vacunas.

00:04:24.710 --> 00:04:31.100
Dado que sabemos cómo cambia la varianza
de virulencia.

00:04:31.100 --> 00:04:36.830
Así que esa es la gran imagen de esto.

00:04:36.830 --> 00:04:42.430
Así que aquí están algunos resultados que
hemos desarrollado - que hemos logrado.

00:04:42.430 --> 00:04:50.150
Esta es una estimación de la aptitud viral
basada en la información - los datos que

00:04:50.150 --> 00:04:51.150
tenemos.

00:04:51.150 --> 00:05:03.000
Esto es en realidad para la sub-variante Omicron
y podemos comparar la variante Omicron utilizando

00:05:03.000 --> 00:05:08.150
un método con el desarrollo de comparación
por pares.

00:05:08.150 --> 00:05:12.500
Entonces podemos estimar la diferencia relativa
entre esas variantes.

00:05:12.500 --> 00:05:18.430
Basándonos en estos datos podemos generar
el llamado paisaje de fitness viral.

00:05:18.430 --> 00:05:21.979
Para los conocedores de la teoría de la evolución
- en la evolución existe el llamado paisaje

00:05:21.979 --> 00:05:26.810
de fitness y realmente hay muchos argumentos
al respecto, pero también hay mucha teoría

00:05:26.810 --> 00:05:29.710
basada en el paisaje de la evolución.

00:05:29.710 --> 00:05:37.580
Con el paisaje de la aptitud de un virus potencial,
podríamos en teoría predecir su trayectoria

00:05:37.580 --> 00:05:38.580
evolutiva.

00:05:38.580 --> 00:05:41.509
Esto - podemos - tenemos un método para hacer
esto.

00:05:41.509 --> 00:05:48.330
Este es el resultado estimado para las subvariantes
alfa beta delta omicron en EEUU.

00:05:48.330 --> 00:05:56.140
También estamos en el proceso de aplicar
esto a la gripe o la viruela.

00:05:56.140 --> 00:05:59.789
No tenemos suficientes datos para la viruela
u otros virus, pero la gripe parece prometedora.

00:05:59.789 --> 00:06:03.310
Se trata de un hallazgo importante de nuestro
proyecto actual.

00:06:03.310 --> 00:06:06.069
He aquí algunos resultados del modelo.

00:06:06.069 --> 00:06:11.570
Sin divulgar demasiados detalles sobre el
modelo de IA que hemos desarrollado.

00:06:11.570 --> 00:06:19.560
Hay realmente un montón de parámetros, pero
la precisión del modelo actual puede alcanzar

00:06:19.560 --> 00:06:21.840
una precisión bastante alta.

00:06:21.840 --> 00:06:26.980
Por supuesto, esto se basa en lo que sabemos.

00:06:26.980 --> 00:06:29.840
El reto es realmente desconocido.

00:06:29.840 --> 00:06:35.550
Aunque estemos prediciendo lo desconocido,
los datos ya son conocidos.

00:06:35.550 --> 00:06:42.100
En el aprendizaje automático, los entrenamos
con entradas de entrenamiento y prueba.

00:06:42.100 --> 00:06:46.789
El reto de predecir lo desconocido sigue siendo
una cuestión abierta.

00:06:46.789 --> 00:06:52.389
Algunas personas pueden argumentar, bueno,
¿por qué tenemos que hacer aprendizaje profundo?

00:06:52.389 --> 00:06:56.750
Hay muchos otros métodos estadísticos, genéticos,
genómicos, de tratamiento cuantitativo, ¿por

00:06:56.750 --> 00:06:58.840
qué tenemos que recurrir al aprendizaje profundo?

00:06:58.840 --> 00:07:03.460
Aquí tenemos algunas pruebas que demuestran
que el aprendizaje profundo, como mínimo,

00:07:03.460 --> 00:07:07.710
detecta firmas diferentes de los estudios
estándar de asociación de todo el genoma.

00:07:07.710 --> 00:07:10.490
A la izquierda, un resultado de nuestro aprendizaje
profundo.

00:07:10.490 --> 00:07:18.849
Esto es en realidad sobre la base de la OMS
etiquetados varianzas Alfa, Beta, Delta, Omicron,

00:07:18.849 --> 00:07:20.040
y otros.

00:07:20.040 --> 00:07:29.370
Queremos ver qué firma en el genoma del SARS-CoV-2
son importantes para contribuir a este aumento

00:07:29.370 --> 00:07:30.699
de la virulencia.

00:07:30.699 --> 00:07:36.270
Esas señales altas que puedes ver al final
del genoma del SARS-CoV-2.

00:07:36.270 --> 00:07:46.880
Y alrededor de esta región que estoy resaltando,
entre 20.000 y 25.000, se encuentra el gen

00:07:46.880 --> 00:07:55.389
spike que la OMS [ha identificado] y ante
el que reaccionará la mayor parte de la respuesta

00:07:55.389 --> 00:07:56.389
inmunitaria.

00:07:56.389 --> 00:08:01.780
Según los conocimientos convencionales, así
es como la OMS clasificó las variantes del

00:08:01.780 --> 00:08:02.780
SARS-CoV-2.

00:08:02.780 --> 00:08:13.750
Sorprendentemente, los modelos de IA captan
esas señales, pero no son las más fuertes,

00:08:13.750 --> 00:08:24.840
sino muchas otras.

00:08:24.840 --> 00:08:33.120
Algunas de las señales más fuertes no están
ahí.

00:08:33.120 --> 00:08:45.410
El uso de métodos genómicos estadísticos
convencionales, como el estudio de asociación

00:08:45.410 --> 00:08:55.800
del genoma completo, sigue eligiendo el gen
de la espiga como la señal más fuerte.

00:08:55.800 --> 00:09:13.600
Hay algunos otros, pero no muy fuertes.

00:09:13.600 --> 00:09:32.670
Así que en este caso, la IA y la selección
del método estadístico convencional, o al

00:09:32.670 --> 00:09:39.320
menos, dan un peso diferente a esas señales.

00:09:39.320 --> 00:09:45.230
Esto es sorprendente y también tranquilizador,
en cierto modo.

00:09:45.230 --> 00:09:48.399
Así que elegimos la sabiduría convencional,
el aumento, pero también elegimos algunas

00:09:48.399 --> 00:09:53.600
otras señales que pueden o no ser verificados
por el método experimental.

00:09:53.600 --> 00:09:57.579
Pero ¿cómo predecimos y cómo verificamos
esto, verdad?

00:09:57.579 --> 00:10:10.990
Así que usamos la IA para predecir muchas
cosas y sabemos que la IA puede generar muchas

00:10:10.990 --> 00:10:11.990
predicciones falsas.

00:10:11.990 --> 00:10:14.250
En este caso, ¿cómo podemos verificarlo?

00:10:14.250 --> 00:10:15.890
Eso es bastante desafiante.

00:10:15.890 --> 00:10:19.500
Estamos intentando, en general, dos maneras
diferentes.

00:10:19.500 --> 00:10:28.100
Una es generar un sistema experimental modelo
para verificar los hallazgos.

00:10:28.100 --> 00:10:38.920
Nuestro equipo está utilizando un modelo
biológico este es el [inaudible] también

00:10:38.920 --> 00:10:46.880
tenemos un sistema de línea celular para
convertir esos genes en el ciclo de vida y

00:10:46.880 --> 00:10:50.220
medir sus actividades relativas.

00:10:50.220 --> 00:10:58.190
Entonces también tenemos una persona computacional
para realizar la dinámica molecular para

00:10:58.190 --> 00:11:04.600
simular cómo esas mutaciones afectan [inaudible]
de su actividad.

00:11:04.600 --> 00:11:12.139
En este caso, ACE2 y RBD, pero también tenemos
otro [inaudible] en el que predecir en diferentes

00:11:12.139 --> 00:11:19.260
regiones cómo reaccionan con los genes humanos
- potencial dirigido a los sistemas inmunológicos

00:11:19.260 --> 00:11:20.260
humanos.

00:11:20.260 --> 00:11:25.350
También organizamos un taller y paneles de
expertos para discutir cómo diseñar IA confiable

00:11:25.350 --> 00:11:33.950
para promover la confianza social en la IA
- IA equitativa.

00:11:33.950 --> 00:11:47.680
La pandemia COVID ha demostrado que hay una
gran disparidad en nuestro sistema actual,

00:11:47.680 --> 00:12:03.670
por lo que si utilizamos la IA para 
predecir las pandemias futuras, puede amplificar

00:12:03.670 --> 00:12:10.150
fácilmente las disparidades ocultas en nuestro
sistema actual, probablemente también en

00:12:10.150 --> 00:12:11.700
nuestros datos actuales.

00:12:11.700 --> 00:12:20.190
Si reconocemos esto y organizamos un panel
bastante diverso, e incluyendo gente de Sudáfrica,

00:12:20.190 --> 00:12:30.400
Kenia, hay una persona de Europa y a través
de la - con diferentes antecedentes como abogados,

00:12:30.400 --> 00:12:33.970
médicos, políticos, gubernamentales - NIST
- agencias gubernamentales para tener todo

00:12:33.970 --> 00:12:39.580
tipo de perspectiva sobre cómo promover la
IA y promover la confianza en la IA en las

00:12:39.580 --> 00:12:41.870
comunidades históricamente marginadas.

00:12:41.870 --> 00:12:51.519
También enfatizamos mucho el desarrollo de
la fuerza laboral dada nuestras colaboraciones

00:12:51.519 --> 00:12:59.279
con las Instituciones de Servicio a las Minorías,
incluyendo Spelman College, North Carolina

00:12:59.279 --> 00:13:09.850
A&amp;T y Catholic University of America, que
contienen muchos estudiantes hispanos, y mi

00:13:09.850 --> 00:13:14.110
institución de origen, la Universidad de
Tennessee, Chattanooga.

00:13:14.110 --> 00:13:17.529
También colaboramos con un sistema hospitalario
Global South.

00:13:17.529 --> 00:13:25.339
Por último, quiero dar las gracias a NSF,
UTC y la Iniciativa AI Tennessee por su apoyo.

00:13:25.339 --> 00:13:33.850
Y por último, yo no puse en las diapositivas,
NSF ha lanzado llamada para la fase 2 de solicitud

00:13:33.850 --> 00:13:41.459
para un Centro Nacional, a estar en una escala
probablemente 10 veces mayor, si no 100 veces

00:13:41.459 --> 00:13:47.459
más grande, así que estoy buscando colaboradores,
especialmente con el compromiso de la comunidad,

00:13:47.459 --> 00:13:50.839
He oído que alguien trabaja en política
pública.

00:13:50.839 --> 00:13:54.240
Así que deseo conectar después de esto.

00:13:54.240 --> 00:14:01.029
Así que me detendré aquí, gracias.

