
u00bfY si lo mu00e1s u00fatil que AlphaFold3 puede decirte sobre un complejo proteu00edna-ADN no es du00f3nde se encuentra cada u00e1tomo, sino cuu00e1n probable es que cada par de u00e1tomos entre en contacto?
Esa pregunta impulsu00f3 a un equipo de investigadores de la Universidad Normal del Este de China y la Universidad de Peku00edn a construir ContactSeek, un marco computacional publicado hoy en Nature que utiliza las salidas de probabilidad de contacto de AlphaFold3 para mejorar dru00e1sticamente la especificidad de los editores de bases de ADN. Los resultados desafu00edan una suposiciu00f3n ampliamente aceptada en la ingenieru00eda de proteu00ednas: que conocer la estructura tridimensional precisa de un complejo es la mejor ruta para comprender y mejorar su funciu00f3n. En cambio, el equipo descubriu00f3 que la predicciu00f3n secundaria de AlphaFold3 (una matriz de probabilidades de contacto por pares entre cada residuo y cada nucleu00f3tido en un complejo) capturaba diferencias de interacciu00f3n que la estructura 3D predicha pasaba por alto por completo.
La estructura que no fue suficiente
La probabilidad de contacto (CP) es un canal secundario de informaciu00f3n en AlphaFold3. Junto a las familiares coordenadas atu00f3micas en un archivo .cif, cada ejecuciu00f3n de AF3 produce un archivo `_confidences.json` que contiene una matriz de valores entre 0 y 1 para cada par de tokens en la entrada. Un valor de 0.95 entre el residuo K1020 de Cas9 y un nucleu00f3tido de ADN especu00edfico significa que AF3 tiene un 95% de confianza en que esas dos partes estu00e1n en contacto. Es una cantidad de conjunto: refleja la distribuciu00f3n entre las ejecuciones de muestreo por difusiu00f3n de AlphaFold3, no un u00fanico estado plegado.
El primer autor, Haowei Meng, y sus colegas comenzaron mapeando los perfiles fuera de diana en todo el genoma de editores de bases de adenina (ABE) utilizando un mu00e9todo llamado perfilado dI, generando un catu00e1logo completo de sitios de ADN fuera de diana para editores Cas9-TadA8e en mu00faltiples ARN guu00eda. Luego introdujeron esas secuencias de ADN fuera de diana en AlphaFold3 junto con las secuencias dentro de diana correspondientes, generando miles de complejos ternarios predichos de Cas9, ARN guu00eda u00fanico y ADN diana.
Cuando los investigadores compararon quu00e9 tan bien las desviaciones estructurales 3D (medidas por la desviaciu00f3n cuadru00e1tica media, RMSD) frente a los cambios de CP distinguu00edan los complejos dentro de diana de los fuera de diana, el resultado fue inequu00edvoco. La CP era sistemu00e1ticamente mu00e1s sensible. Los cambios de RMSD entre complejos dentro y fuera de diana eran a menudo demasiado pequeu00f1os para ser analizados de manera confiable (desplazamientos sub-angstrom que cau00edan dentro del ruido de la predicciu00f3n). Los cambios de CP, por el contrario, mostraban diferencias claras y localizadas que se asignaban directamente a dominios funcionales conocidos de Cas9. Un desajuste de un solo nucleu00f3tido en una posiciu00f3n de espaciador determinada producu00eda una firma de cambio de CP distintiva en los residuos de Cas9 que contactan esa regiu00f3n del hu00edbrido ADN-ARN, incluso cuando la estructura 3D general parecu00eda esencialmente sin cambios.
Esto tiene sentido fu00edsico. Los complejos proteu00edna-ADN-ARN son ensamblajes dinu00e1micos que muestrean mu00faltiples estados conformacionales. Una estructura estu00e1tica captura una instantu00e1nea, pero la probabilidad de contacto codifica el conjunto: con quu00e9 frecuencia se forma una interfaz determinada, quu00e9 tan estable es y cu00f3mo responde a perturbaciones de la secuencia. Una secuencia de ADN fuera de diana podru00eda no cambiar mucho la posiciu00f3n de una cadena lateral, pero puede reducir sustancialmente la probabilidad de que esa cadena lateral forme un contacto estabilizador: una diferencia que una estructura u00fanica no puede revelar pero que una matriz de CP su00ed puede.
El pipeline de ContactSeek
Armado con esta perspectiva, el equipo construyu00f3 ContactSeek, un marco computacional modular que convierte matrices de CP en objetivos de ingenieru00eda procesables. El pipeline funciona en tres etapas.
Primero, para cada secuencia de ADN fuera de diana, ContactSeek calcula una matriz delta-CP: la diferencia entre la matriz CP fuera de diana y la matriz CP dentro de diana. Estos valores delta-CP capturan quu00e9 contactos residuo-nucleu00f3tido se debilitan o fortalecen cuando la secuencia de ADN se desvu00eda del objetivo previsto.
Segundo, identifica regiones de contacto de consenso (CCR). Estas son extensiones de residuos vecinos en la proteu00edna Cas9 cuyas probabilidades de contacto cambian de manera correlacionada en todo el conjunto de secuencias fuera de diana. Una CCR es esencialmente un dominio proteico cuya interacciu00f3n con u00e1cidos nucleicos es perturbada colectivamente por la uniu00f3n fuera de diana, lo que la convierte en un sitio prometedor para la ingenieru00eda.
Tercero, ContactSeek clasifica los residuos dentro de cada CCR mediante una mu00e9trica llamada correlaciu00f3n de mejora de contacto (contact enhancement correlation), esencialmente, quu00e9 tan estrechamente el cambio de CP de un residuo sigue la seu00f1al experimental de ediciu00f3n fuera de diana medida por secuenciaciu00f3n. Los residuos cuyos cambios de probabilidad de contacto se correlacionan fuertemente con las tasas de ediciu00f3n fuera de diana son los determinantes de especificidad mu00e1s probables.
De la computaciu00f3n a mejores editores
El equipo aplicu00f3 ContactSeek al ampliamente utilizado editor de bases de adenina ABE8e, que fusiona una desaminasa TadA8e catalu00edticamente mejorada con una nickasa Cas9. ContactSeek nominu00f3 dos residuos clave determinantes de especificidad: K1020 en el dominio REC2 de Cas9 y H29 en la propia desaminasa TadA8e.
K1020D fue el principal candidato en Cas9. El residuo K1020 de Cas9 se encuentra en un bucle del dominio REC2 cerca de la hebra de ADN no diana, y su probabilidad de contacto con el ADN cambiu00f3 mu00e1s que casi cualquier otro residuo cuando se analizaron secuencias fuera de diana. Las simulaciones de dinu00e1mica molecular confirmaron que la sustituciu00f3n K1020D reposiciona sutilmente el bucle, reduciendo su contacto con la hebra no diana de una manera que penaliza desproporcionadamente la uniu00f3n fuera de diana mientras deja las interacciones dentro de diana en gran parte intactas.
En el lado de la desaminasa, ContactSeek identificu00f3 a TadA8e H29D como la mutaciu00f3n principal potenciadora de especificidad. H29 se encuentra cerca del bolsillo del sitio activo de TadA8e, y su probabilidad de contacto con el ARN guu00eda y el sustrato de ADN cambiu00f3 sistemu00e1ticamente en todas las secuencias fuera de diana. La sustituciu00f3n H29D redujo la participaciu00f3n promiscua de la desaminasa con sustratos imperfectamente posicionados.
La variante combinada, ABE8e-DD (Cas9 K1020D + TadA8e H29D), produjo resultados sorprendentes. El perfilado fuera de diana en todo el genoma mostru00f3 que ABE8e-DD redujo la ediciu00f3n total fuera de diana en un 98-99% en relaciu00f3n con el ABE8e parental en mu00faltiples ARN guu00eda, mientras mantenu00eda la eficiencia de ediciu00f3n dentro de diana. En comparaciones directas contra varias variantes ABE de alta fidelidad conocidas (ABE8e-V28C, ABE8e-V106W, ABE8e-N108Q), ABE8e-DD logru00f3 una especificidad superior en todos los u00e1mbitos, medida por secuenciaciu00f3n de amplicones dirigidos, perfilado dI en todo el genoma y ensayos ortogonales de bucle R.
Mu00e1s allu00e1 de los editores de adenina
ContactSeek no se limita a los ABE. El equipo demostru00f3 su modularidad aplicando el marco a un sistema completamente diferente: los editores de bases de citosina (CBE) basados en LbCas12a. Cas12a es un efector CRISPR distinto con una estructura de ARN guu00eda y un mecanismo de corte de ADN diferentes. Al introducir secuencias fuera de diana de un CBE Cas12a-APOBEC3A en el mismo pipeline, se identificaron Cas12a R284E y APOBEC3A H29D como residuos determinantes de especificidad. La variante resultante mostru00f3 una ediciu00f3n fuera de diana sustancialmente reducida, confirmando que ContactSeek se generaliza entre familias de efectores CRISPR.
El marco tambiu00e9n demostru00f3 ser efectivo para reducir la ediciu00f3n fuera de diana en ARN. Los editores de bases, particularmente aquellos que utilizan desaminasas TadA8e y APOBEC3A, pueden editar promiscuamente transcritos de ARN, causando cambios no deseados A-a-I o C-a-U en el transcriptoma. ContactSeek adaptu00f3 su enfoque a los ARN fuera de diana clasificando los sitios de ediciu00f3n de ARN en todo el transcriptoma en grupos de actividad alta, media y baja, calculando delta-CP entre grupos e identificando CCR en la desaminasa que se correlacionaban con la actividad fuera de diana en ARN. La mutaciu00f3n resultante, TadA8e H29D, redujo simultu00e1neamente la ediciu00f3n fuera de diana en ARN sin sacrificar la actividad de ADN dentro de diana.
Un nuevo paradigma para la ingenieru00eda de especificidad
La importancia mu00e1s amplia de ContactSeek se extiende mu00e1s allu00e1 de la ediciu00f3n de bases. Durante au00f1os, los ingenieros de proteu00ednas han confiado en la informaciu00f3n estructural (estructuras cristalogru00e1ficas, mapas de crio-EM y, mu00e1s recientemente, estructuras predichas de AlphaFold2) para guiar el diseu00f1o racional. La suposiciu00f3n implu00edcita ha sido que una mayor resoluciu00f3n estructural siempre produce mejores conocimientos de ingenieru00eda. ContactSeek desafu00eda esa suposiciu00f3n al mostrar que la probabilidad de contacto, una propiedad estadu00edstica de conjunto, puede superar a la estructura estu00e1tica para una tarea que depende del reconocimiento molecular dinu00e1mico.
Esto es particularmente relevante para la ediciu00f3n del genoma, donde la diferencia entre la actividad especu00edfica y la promiscua a menudo depende de cu00f3mo un complejo proteu00edna-ADN responde a desajustes, protuberancias y otras desviaciones del objetivo perfecto. Una estructura cristalogru00e1fica te muestra el estado ideal. La probabilidad de contacto te muestra cu00f3mo se comporta el sistema cuando el sustrato es imperfecto, y para la ingenieru00eda de especificidad, eso es precisamente lo que importa.
El enfoque tambiu00e9n es experimentalmente eficiente. Las estrategias tradicionales para mejorar la especificidad de los editores de bases se han basado en cribados mutacionales a gran escala, campau00f1as de evoluciu00f3n dirigida o diseu00f1o racional guiado por estructura una mutaciu00f3n a la vez. ContactSeek solo requiere datos de secuenciaciu00f3n fuera de diana (cada vez mu00e1s rutinarios) y predicciones de AF3 (ru00e1pidamente asequibles). Reduce el espacio de bu00fasqueda de miles de mutaciones posibles a un puu00f1ado de candidatos de alta confianza en un solo pase computacional.
Con el cu00f3digo y los datos disponibles abiertamente en GitHub y Zenodo, ContactSeek proporciona una plantilla de cu00f3mo el anu00e1lisis de contacto impulsado por IA puede acelerar el desarrollo de herramientas de ediciu00f3n genu00f3mica mu00e1s seguras. A medida que el campo avanza hacia aplicaciones terapu00e9uticas de la ediciu00f3n de bases, la capacidad de eliminar sistemu00e1ticamente la actividad fuera de diana mientras se preserva la potencia dentro de diana seru00e1 cru00edtica. ContactSeek sugiere que el camino a seguir puede no requerir instantu00e1neas estructurales mu00e1s nu00edtidas, sino la voluntad de mirar las probabilidades en su lugar.
Traducido por Alessandra

