La probabilité de contact, pas la structure : comment AlphaFold3 a réécrit les règles de la conception d’éditeurs de bases

Et si la chose la plus utile qu’AlphaFold3 peut vous dire à propos d’un complexe protéine-ADN n’était pas où se trouve chaque atome, mais la probabilité que chaque paire d’atomes se touche ?

Cette question a conduit une équipe de chercheurs de l’Université Normale de la Chine de l’Est et de l’Université de Pékin à construire ContactSeek, un cadre computationnel publié aujourd’hui dans Nature qui utilise les sorties de probabilité de contact d’AlphaFold3 pour améliorer considérablement la spécificité des éditeurs de bases d’ADN. Les résultats bouleversent une hypothèse largement répandue en ingénierie des protéines : que connaître la structure tridimensionnelle précise d’un complexe est la meilleure voie pour comprendre et améliorer sa fonction. Au lieu de cela, l’équipe a découvert que la prédiction secondaire d’AlphaFold3 — une matrice de probabilités de contact par paires entre chaque résidu et chaque nucléotide dans un complexe — capturait des différences d’interaction que la structure 3D prédite manquait entièrement.

La structure qui ne suffisait pas

La probabilité de contact (CP) est un canal secondaire d’information dans AlphaFold3. Parallèlement aux coordonnées atomiques familières dans un fichier .cif, chaque exécution d’AF3 produit un fichier `_confidences.json` contenant une matrice de valeurs entre 0 et 1 pour chaque paire de jetons dans l’entrée. Une valeur de 0,95 entre le résidu K1020 de Cas9 et un nucléotide d’ADN spécifique signifie qu’AF3 est confiant à 95 % que ces deux entités sont en contact. C’est une quantité d’ensemble : elle reflète la distribution à travers les passages d’échantillonnage de diffusion d’AlphaFold3 plutôt qu’un seul état replié.

Support independent reporting built on evidence, transparency, and scientific rigor.

Keep quality journalism alive

Le premier auteur Haowei Meng et ses collègues ont commencé par cartographier les profils hors cible à l’échelle du génome des éditeurs de bases adénine (ABE) en utilisant une méthode appelée dI-profiling, générant un catalogue complet de sites d’ADN hors cible pour les éditeurs Cas9-TadA8e sur plusieurs ARN guides. Ils ont ensuite introduit ces séquences d’ADN hors cible dans AlphaFold3 aux côtés des séquences cibles correspondantes, générant des milliers de complexes ternaires prédits de Cas9, d’ARN guide simple et d’ADN cible.

Lorsque les chercheurs ont comparé comment les déviations structurelles 3D (mesurées par l’écart quadratique moyen, RMSD) par rapport aux changements de CP distinguaient les complexes cibles des complexes hors cible, le résultat était sans ambiguïté. La CP était systématiquement plus sensible. Les changements de RMSD entre les complexes cibles et hors cible étaient souvent trop petits pour être interprétés de manière fiable — des décalages sub-angström qui tombaient dans le bruit de la prédiction. Les changements de CP, en revanche, montraient des différences claires et localisées qui correspondaient directement aux domaines fonctionnels connus de Cas9. Un désappariement d’un seul nucléotide à une position d’espaceur donnée produisait une signature de changement de CP distinctive dans les résidus de Cas9 qui contactent cette région de l’hybride ADN-ARN, même lorsque la structure 3D globale semblait essentiellement inchangée.

Cela a un sens physique. Les complexes protéine-ADN-ARN sont des assemblages dynamiques qui échantillonnent de multiples états conformationnels. Une structure statique capture un instantané, mais la probabilité de contact encode l’ensemble : la fréquence à laquelle une interface donnée se forme, sa stabilité, et comment elle répond aux perturbations de séquence. Une séquence d’ADN hors cible pourrait ne pas déplacer la position d’une chaîne latérale de beaucoup, mais elle peut réduire substantiellement la probabilité que la chaîne latérale forme un contact stabilisant — une différence qu’une seule structure ne peut révéler mais qu’une matrice CP peut.

Le pipeline ContactSeek

Armés de cette perspicacité, l’équipe a construit ContactSeek, un cadre computationnel modulaire qui transforme les matrices CP en cibles d’ingénierie actionnables. Le pipeline fonctionne en trois étapes.

D’abord, pour chaque séquence d’ADN hors cible, ContactSeek calcule une matrice delta-CP : la différence entre la matrice CP hors cible et la matrice CP cible. Ces valeurs delta-CP capturent quels contacts résidu-nucléotide s’affaiblissent ou se renforcent lorsque la séquence d’ADN dévie de la cible prévue.

Ensuite, il identifie les régions de contact consensus (CCR). Ce sont des étendues de résidus voisins dans la protéine Cas9 dont les probabilités de contact changent de manière corrélée à travers l’ensemble des séquences hors cible. Un CCR est essentiellement un domaine protéique dont l’interaction avec les acides nucléiques est collectivement perturbée par la liaison hors cible, ce qui en fait un site prometteur pour l’ingénierie.

Troisièmement, ContactSeek classe les résidus au sein de chaque CCR par une métrique appelée corrélation d’amélioration de contact — essentiellement, à quel point le changement de CP d’un résidu suit le signal d’édition hors cible expérimental mesuré par séquençage. Les résidus dont les changements de probabilité de contact corrèlent fortement avec les taux d’édition hors cible sont les déterminants de spécificité les plus probables.

De la computation à de meilleurs éditeurs

L’équipe a appliqué ContactSeek à l’éditeur de bases adénine ABE8e largement utilisé, qui fusionne une désaminase TadA8e catalytiquement améliorée à une nickase Cas9. ContactSeek a nommé deux résidus clés déterminant la spécificité : K1020 dans le domaine REC2 de Cas9 et H29 dans la désaminase TadA8e elle-même.

K1020D était le premier hit dans Cas9. Le résidu K1020 de Cas9 se trouve dans une boucle du domaine REC2 près du brin d’ADN non cible, et sa probabilité de contact avec l’ADN changeait plus que presque tout autre résidu lorsque les séquences hors cible étaient analysées. Les simulations de dynamique moléculaire ont confirmé que la substitution K1020D repositionne subtilement la boucle, réduisant son contact avec le brin non cible d’une manière qui pénalise de manière disproportionnée la liaison hors cible tout en laissant les interactions cibles largement intactes.

Du côté de la désaminase, ContactSeek a identifié TadA8e H29D comme la mutation améliorant la spécificité la plus importante. H29 se trouve près de la poche du site actif de TadA8e, et sa probabilité de contact avec le guide ARN et le substrat ADN changeait systématiquement à travers les séquences hors cible. La substitution H29D réduisait l’engagement promiscuité de la désaminase avec des substrats imparfaitement positionnés.

Le variant combiné — ABE8e-DD (Cas9 K1020D + TadA8e H29D) — a produit des résultats frappants. Le profilage hors cible à l’échelle du génome a montré qu’ABE8e-DD réduisait l’édition hors cible totale de 98 à 99 % par rapport à l’ABE8e parent sur plusieurs ARN guides, tout en maintenant l’efficacité d’édition cible. Dans des comparaisons directes contre plusieurs variants ABE haute-fidélité connus (ABE8e-V28C, ABE8e-V106W, ABE8e-N108Q), ABE8e-DD a atteint une spécificité supérieure sur toute la ligne, mesurée par séquençage d’amplicons ciblés, dI-profiling à l’échelle du génome, et tests orthogonaux de boucle R.

Au-delà des éditeurs adénine

ContactSeek ne se limite pas aux ABE. L’équipe a démontré sa modularité en appliquant le cadre à un système entièrement différent : les éditeurs de bases cytosine (CBE) basés sur LbCas12a. Cas12a est un effecteur CRISPR distinct avec une structure d’ARN guide et un mécanisme de clivage de l’ADN différents. L’introduction de séquences hors cible d’un CBE Cas12a-APOBEC3A dans le même pipeline a identifié Cas12a R284E et APOBEC3A H29D comme résidus déterminant la spécificité. Le variant résultant a montré une édition hors cible substantiellement réduite, confirmant que ContactSeek se généralise à travers les familles d’effecteurs CRISPR.

Le cadre s’est également avéré efficace pour réduire l’édition hors cible de l’ARN. Les éditeurs de bases, particulièrement ceux utilisant les désaminases TadA8e et APOBEC3A, peuvent modifier de manière promiscuité les transcrits d’ARN, provoquant des changements A-en-I ou C-en-U non intentionnels dans le transcriptome. ContactSeek a adapté son approche aux cibles hors cible de l’ARN en classant les sites d’édition d’ARN à l’échelle du transcriptome en groupes d’activité élevée, moyenne et faible, en calculant le delta-CP entre les groupes, et en identifiant les CCR dans la désaminase qui corrélaient avec l’activité hors cible de l’ARN. La mutation TadA8e H29D résultante a simultanément réduit l’édition hors cible de l’ARN sans sacrifier l’activité ADN cible.

Un nouveau paradigme pour l’ingénierie de la spécificité

La signification plus large de ContactSeek s’étend au-delà de l’édition de bases. Pendant des années, les ingénieurs en protéines se sont appuyés sur l’information structurelle — structures cristallines, cartes cryo-EM, et plus récemment structures prédites d’AlphaFold2 — pour guider la conception rationnelle. L’hypothèse implicite a été qu’une résolution structurelle plus élevée donne toujours de meilleures perspectives d’ingénierie. ContactSeek défie cette hypothèse en montrant que la probabilité de contact, une propriété d’ensemble statistique, peut surpasser la structure statique pour une tâche qui dépend de la reconnaissance moléculaire dynamique.

Ceci est particulièrement pertinent pour l’édition du génome, où la différence entre une activité spécifique et une activité promiscuité dépend souvent de la façon dont un complexe protéine-ADN répond aux désappariements, aux bulges et autres déviations par rapport à la cible parfaite. Une structure cristalline vous montre l’état idéal. La probabilité de contact vous montre comment le système se comporte lorsque le substrat est imparfait — et pour l’ingénierie de la spécificité, c’est précisément ce qui importe.

L’approche est également expérimentalement efficace. Les stratégies traditionnelles pour améliorer la spécificité des éditeurs de bases se sont appuyées sur des criblages de mutagenèse à grande échelle, des campagnes d’évolution dirigée, ou une conception rationnelle guidée par la structure une mutation à la fois. ContactSeek ne nécessite que des données de séquençage hors cible (de plus en plus routinières) et des prédictions AF3 (devenant rapidement abordables). Il réduit l’espace de recherche de milliers de mutations possibles à une poignée de candidats à haute confiance en un seul passage computationnel.

Avec le code et les données disponibles ouvertement sur GitHub et Zenodo, ContactSeek fournit un modèle pour la façon dont l’analyse de contact pilotée par l’IA peut accélérer le développement d’outils d’édition du génome plus sûrs. Alors que le domaine se dirige vers des applications thérapeutiques de l’édition de bases, la capacité d’éliminer systématiquement l’activité hors cible tout en préservant la puissance cible sera critique. ContactSeek suggère que la voie à suivre peut ne pas nécessiter des instantanés structurels plus nets, mais une volonté de regarder les probabilités à la place.

Traduit par Lydie

Scroll to Top