La première fois qu'un laboratoire prédit une structure de protéines sur un ordinateur portable, la réponse est généralement un optimisme prudent. Un étudiant diplômé passe une séquence d'acides aminés dans un serveur Web, attend quelques minutes à une heure, et reçoit un modèle tridimensionnel avec des scores de confiance codés en couleur. Le modèle ressemble à une structure réelle: hélices alpha, feuilles bêta et boucles qui se mélangent dans un site actif plausible. Il porte également un nombre qui sépare les parties à faire confiance des parties à ignorer. Ce nombre, le test de différence de distance locale prédit ou pLDDT, est devenu l'une des valeurs les plus lues en biologie structurelle. Il y a cinq ans, la plupart des scientifiques de
Les méthodes de calcul pour prédire la structure moléculaire ne sont pas nouvelles. La modélisation homologique, le filage, l'assemblage des fragments et la dynamique moléculaire sont en usage depuis des décennies. Ce qui a changé est l'exactitude et l'accès. Les modèles d'apprentissage profond qui traitent un pli comme un problème de reconnaissance de motif sont arrivés avec force à l'évaluation CASP14 en 2020, lorsque AlphaFold2 a produit des prédictions proches de la précision expérimentale pour une grande partie des cibles. Dans les mois qui ont suivi, les laboratoires ont obtenu une hypothèse structurelle crédible avant de purifier la protéine, avant de la cristalliser, et parfois avant que l'ordre
De la séquence à la structure : comment fonctionnent les modèles de prédiction
Les protéines sont construites à partir de chaînes d'acides aminés, et la plupart sont pliées dans une forme tridimensionnelle préférée qui détermine comment elles lient d'autres molécules, catalyse les réactions, déplacent les ions et répondent aux partenaires de signalisation. Un modèle ne peut pas encore résoudre la physique du pliage pour chaque protéine, de sorte que les meilleurs outils prennent un raccourci statistique. Ils scannent les séquences de milliers d'organismes connexes et recherchent des positions qui ont tendance à changer ensemble. Ce signal de co-évolution indique les résidus qui sont proches de trois dimensions même lorsqu'ils sont loin en séquence. L'alignement de séquence multiple devient l'entrée, et le réseau prédit un
C’est pourquoi AlphaFold2 et ses proches se sont améliorés si rapidement : la croissance des bases de données de séquence de protéines leur a donné plus de données évolutionnaires. Pour les protéines avec des alignements de séquence profonde, la prédiction peut être aiguë. Pour les protéines orphelines ou les séquences synthétiques avec peu de parents, le modèle a moins de preuves et les scores de confiance baissent. La sortie n’est donc pas une réponse unique.
Les outils qui apparaissent maintenant dans les protocoles de laboratoire
AlphaFold2 reste le paramètre par défaut pour de nombreuses tâches uniquement en protéines car sa méthode sous-jacente est clairement décrite et ses prédictions sont faciles à obtenir.La méthode AlphaFold2 dans NatureIl s’agit de l’architecture, et leBase de données de la structure des protéines AlphaFoldRoseTTAFold, développé à l'Université de Washington, utilise un réseau à trois pistes qui prédit les coordonnées avec un coût de calcul plus faible et est disponible à travers leRobotique serveurESMFold de Meta AI prédit rapidement les structures à partir de séquences uniques plutôt que d'alignements, ce qui convient au dépistage méta-génomique; son approche est décrite dansSciencesAlphaFold3 étend la tâche à l'ADN de protéine, à l'ARN de protéine, aux complexes de protéines à petites molécules et aux formes de protéines modifiées post-translationnelles.
| Modèle | Ce qu’il prédit | Utilisation typique du laboratoire |
|---|---|---|
| Alphabète2 | Structures de protéines à chaîne unique | Construction de modèles dans les cartes cryo-EM, conception de construction, limites de domaine |
| Résumé | Structures et complexes de protéines | Monomères et petits ensembles de protéines lorsque le calcul est limité |
| ESMFOLD | Structures de protéines à partir de séquences simples | Écrans rapides de protéines environnementales ou synthétiques |
| Alphabète3 | Protéines avec ADN, ARN, ions et ligands | Générer des hypothèses de lien de site et d’interaction |
Aucun outil unique n’est le meilleur pour chaque problème. Un laboratoire qui étudie une enzyme conservée peut avoir besoin seulement d’AlphaFold2. Un groupe de méta-génomics qui traite des millions de fragments peut préférer ESMFold pour la vitesse.
Ce qui change quand une structure arrive avant l'expérience
Le changement le plus immédiat est dans la conception de la construction. Les cristallographes et les chercheurs de cryo-EM ont traditionnellement enlevé les boucles flexibles ou les régions terminales par essai et erreur parce que les régions non structurées empêchent les contacts de grille ou compliquent l'alignement des particules. Un modèle prédit avec confiance en résidus peut identifier ces régions avant qu'un seul milligramme de protéine ne soit produit. Les laboratoires de protéines de membrane utilisent des prédictions pour choisir des troncations qui peuvent mieux s'exprimer dans les détergents ou les nanodiscos. Le temps économisé n'est pas théorique; il est mesuré dans des semaines de tests d'expression échoués.
Les modèles prédits accélèrent également la détermination de la structure expérimentale. Dans le remplacement moléculaire, un modèle prédit peut servir de modèle de recherche lorsqu'aucun homologue expérimental n'est disponible. Dans le cryo-EM, l'adhésion d'une prédiction à une carte de résolution modeste aide à tracer la chaîne polypeptique plus rapidement que la construction à partir de zéro. Les journaux et les bases de données ont été adaptés en parallèle: les déposants de la banque de données de protéines sont désormais censés indiquer si AlphaFold ou des modèles similaires ont été utilisés dans la construction de modèles.
Lire les scores de confiance avant de faire confiance au modèle
Les parcelles de confiance colorées sont le premier écran. pLDDT va de 0 à 100; les régions au-dessus de 90 sont généralement fiables au niveau de la colonne vertébrale, tandis que les régions au-dessous de 50 devraient être traitées comme non structurées ou incertaines. Pour les complexes, l'erreur d'alignement prédit, ou PAE, indique si la position relative de deux domaines est soutenue par des preuves. Une faible PAE entre deux régions signifie que le modèle est sûr de leur orientation relative; une PAE élevée signifie que la position partagée est une devinette.
Les chercheurs devraient résister à l'instinct de traiter un score de confiance global comme une permission pour arrêter de vérifier. Un modèle peut être juste à propos d'un noyau plié et faux à propos d'une boucle de site actif qui importe pour la catalyse. Le mouvement pratique est de lire les scores par résidu en premier, puis d'inspecter la biologie: le sac prédit est-il en ligne avec les résidus fonctionnels connus? Les liens de disulfide se forment-ils entre les résidus de cystéine qui devraient être oxydés? Le site de glycosylation lié à N est-il orienté vers l'extérieur?
- Vérifiez pLDDT et PAE avant d'utiliser une région dans une déclaration fonctionnelle.
- Comparez la prédiction avec des données expérimentales provenant de la dispersion des rayons X à petit angle, du dichroisme circulaire, des cartes cryo-EM ou de l'échange hydrogène-déutérium, lorsque cela est disponible.
- Confirmez les résidus critiques par la mutagénèse ou les essais contraignants avant de tirer des conclusions.
- Traitez les positions de liaison de ligands à partir de modèles prédictifs comme des hypothèses, pas des affinités mesurées ou des modes de liaison.
AlphaFold3 et le problème de l'interaction
Les protéines agissent rarement seules.Le prochain test pratique pour la prédiction de la structure moléculaire n'est pas une autre pile de protéines mais un complexe: un facteur de transcription sur l'ADN, un anticorps sur un antigène, une kinase avec un inhibiteur de petite molécule, ou une protéine virale avec son récepteur.La nature en 2024Il peut produire des modèles plausibles d'assemblages protéine-ligande, protéine-acide nucléique, protéine-protéine et anticorps-antigène sans modèle.
Le fait est que plausible n'est pas la même chose que physique. AlphaFold3 n'est pas un modèle thermodynamique; il ne mesure pas l'affinité de liaison, et il peut halluciner des positions de ligand dans des poches qui ne sont que partiellement formées. L'utilisation pratique à l'intérieur d'un laboratoire est de générer des idées, de resserrer un écran, ou de guider la chimie médicinale. La confirmation expérimentale doit encore se produire, et cela prend généralement plus de temps que la prédiction.
Les limites d'un scientifique de banc
Les outils de prédiction sont moins fiables pour les régions intrinsèquement désordonnées, les boucles flexibles, la topologie des protéines de membrane dans un environnement de dilatation des lipides et les protéines qui nécessitent des cofacteurs ou des modifications post-translationnelles pour se plier. Ils ne modélisent pas bien la dynamique: une structure statique ne peut pas montrer les changements de conformation, l'allosterie, l'effet d'une mutation sur la stabilité ou la cinétique de liaison. Une structure prédite d'une protéine intrinsèquement désordonnée apparaît souvent comme une chaîne étendue avec un pLDDT faible.
Les mutations à un seul point sont un défi connexe. La plupart des modèles ne classent pas de manière cohérente la variante qui déstabilisera une protéine, et ils ne sont pas formés pour prédire la sensibilité à la température ou l'agrégation. Lorsqu'un laboratoire demande laquelle des 20 substitutions va casser la fonction, le modèle répond souvent avec des intervalles de confiance trop larges pour être utilisé.
La validation reste un travail de laboratoire
Une prédiction de structure pour une nouvelle protéine peut être générée en une après-midi, mais l'établissement que le modèle est significatif peut prendre des mois: purifier la protéine, mesurer son état oligomérique, sondage d'un site de liaison avec des mutants, ou la collecte d'une carte cryo-EM à faible résolution.
Dans la pratique, un laboratoire combinera les méthodes. Une prédiction peut justifier une construction. Une carte cryo-EM peut confirmer la pliure globale. Une expérience d'échange hydrogène-déuterium peut tester quelles régions sont flexibles. Un panneau de mutagénèse peut lier un résidu à l'activité. Le modèle entre dans ce flux de travail comme une pièce de preuve, pas un substitut pour les autres.
La question auxquelles les laboratoires seront confrontés dans la deuxième année est simple et gênante: avons-nous arrêté de faire l'expérience plus lente parce que le modèle était bon, ou parce que le modèle était facile?La réponse variera selon la protéine, par laboratoire et par budget.De meilleurs outils peuvent raccourcir la distance entre une séquence et une structure.Ils ne peuvent pas supprimer l'obligation de tester l'hypothèse.
Photo by Stephan HK on Unsplash
