Academic Jobs - Home of Higher Ed Logo

Modèles de prédiction de structure moléculaire en laboratoire

Poster une histoire
1 116vues
Native advertising — guest articles from $400See packages
A scientist in a white lab coat using a laptop in a laboratory
Photo by ThisisEngineering on Unsplash

La première fois qu'un laboratoire prédit une structure de protéines sur un ordinateur portable, la réponse est généralement un optimisme prudent. Un étudiant diplômé passe une séquence d'acides aminés dans un serveur Web, attend quelques minutes à une heure, et reçoit un modèle tridimensionnel avec des scores de confiance codés en couleur. Le modèle ressemble à une structure réelle: hélices alpha, feuilles bêta et boucles qui se mélangent dans un site actif plausible. Il porte également un nombre qui sépare les parties à faire confiance des parties à ignorer. Ce nombre, le test de différence de distance locale prédit ou pLDDT, est devenu l'une des valeurs les plus lues en biologie structurelle. Il y a cinq ans, la plupart des scientifiques de

Les méthodes de calcul pour prédire la structure moléculaire ne sont pas nouvelles. La modélisation homologique, le filage, l'assemblage des fragments et la dynamique moléculaire sont en usage depuis des décennies. Ce qui a changé est l'exactitude et l'accès. Les modèles d'apprentissage profond qui traitent un pli comme un problème de reconnaissance de motif sont arrivés avec force à l'évaluation CASP14 en 2020, lorsque AlphaFold2 a produit des prédictions proches de la précision expérimentale pour une grande partie des cibles. Dans les mois qui ont suivi, les laboratoires ont obtenu une hypothèse structurelle crédible avant de purifier la protéine, avant de la cristalliser, et parfois avant que l'ordre

De la séquence à la structure : comment fonctionnent les modèles de prédiction

Les protéines sont construites à partir de chaînes d'acides aminés, et la plupart sont pliées dans une forme tridimensionnelle préférée qui détermine comment elles lient d'autres molécules, catalyse les réactions, déplacent les ions et répondent aux partenaires de signalisation. Un modèle ne peut pas encore résoudre la physique du pliage pour chaque protéine, de sorte que les meilleurs outils prennent un raccourci statistique. Ils scannent les séquences de milliers d'organismes connexes et recherchent des positions qui ont tendance à changer ensemble. Ce signal de co-évolution indique les résidus qui sont proches de trois dimensions même lorsqu'ils sont loin en séquence. L'alignement de séquence multiple devient l'entrée, et le réseau prédit un

C’est pourquoi AlphaFold2 et ses proches se sont améliorés si rapidement : la croissance des bases de données de séquence de protéines leur a donné plus de données évolutionnaires. Pour les protéines avec des alignements de séquence profonde, la prédiction peut être aiguë. Pour les protéines orphelines ou les séquences synthétiques avec peu de parents, le modèle a moins de preuves et les scores de confiance baissent. La sortie n’est donc pas une réponse unique.

Les outils qui apparaissent maintenant dans les protocoles de laboratoire

AlphaFold2 reste le paramètre par défaut pour de nombreuses tâches uniquement en protéines car sa méthode sous-jacente est clairement décrite et ses prédictions sont faciles à obtenir.La méthode AlphaFold2 dans NatureIl s’agit de l’architecture, et leBase de données de la structure des protéines AlphaFoldRoseTTAFold, développé à l'Université de Washington, utilise un réseau à trois pistes qui prédit les coordonnées avec un coût de calcul plus faible et est disponible à travers leRobotique serveurESMFold de Meta AI prédit rapidement les structures à partir de séquences uniques plutôt que d'alignements, ce qui convient au dépistage méta-génomique; son approche est décrite dansSciencesAlphaFold3 étend la tâche à l'ADN de protéine, à l'ARN de protéine, aux complexes de protéines à petites molécules et aux formes de protéines modifiées post-translationnelles.

ModèleCe qu’il préditUtilisation typique du laboratoire
Alphabète2Structures de protéines à chaîne uniqueConstruction de modèles dans les cartes cryo-EM, conception de construction, limites de domaine
RésuméStructures et complexes de protéinesMonomères et petits ensembles de protéines lorsque le calcul est limité
ESMFOLDStructures de protéines à partir de séquences simplesÉcrans rapides de protéines environnementales ou synthétiques
Alphabète3Protéines avec ADN, ARN, ions et ligandsGénérer des hypothèses de lien de site et d’interaction

Aucun outil unique n’est le meilleur pour chaque problème. Un laboratoire qui étudie une enzyme conservée peut avoir besoin seulement d’AlphaFold2. Un groupe de méta-génomics qui traite des millions de fragments peut préférer ESMFold pour la vitesse.

Ce qui change quand une structure arrive avant l'expérience

Le changement le plus immédiat est dans la conception de la construction. Les cristallographes et les chercheurs de cryo-EM ont traditionnellement enlevé les boucles flexibles ou les régions terminales par essai et erreur parce que les régions non structurées empêchent les contacts de grille ou compliquent l'alignement des particules. Un modèle prédit avec confiance en résidus peut identifier ces régions avant qu'un seul milligramme de protéine ne soit produit. Les laboratoires de protéines de membrane utilisent des prédictions pour choisir des troncations qui peuvent mieux s'exprimer dans les détergents ou les nanodiscos. Le temps économisé n'est pas théorique; il est mesuré dans des semaines de tests d'expression échoués.

Les modèles prédits accélèrent également la détermination de la structure expérimentale. Dans le remplacement moléculaire, un modèle prédit peut servir de modèle de recherche lorsqu'aucun homologue expérimental n'est disponible. Dans le cryo-EM, l'adhésion d'une prédiction à une carte de résolution modeste aide à tracer la chaîne polypeptique plus rapidement que la construction à partir de zéro. Les journaux et les bases de données ont été adaptés en parallèle: les déposants de la banque de données de protéines sont désormais censés indiquer si AlphaFold ou des modèles similaires ont été utilisés dans la construction de modèles.

Lire les scores de confiance avant de faire confiance au modèle

Les parcelles de confiance colorées sont le premier écran. pLDDT va de 0 à 100; les régions au-dessus de 90 sont généralement fiables au niveau de la colonne vertébrale, tandis que les régions au-dessous de 50 devraient être traitées comme non structurées ou incertaines. Pour les complexes, l'erreur d'alignement prédit, ou PAE, indique si la position relative de deux domaines est soutenue par des preuves. Une faible PAE entre deux régions signifie que le modèle est sûr de leur orientation relative; une PAE élevée signifie que la position partagée est une devinette.

Les chercheurs devraient résister à l'instinct de traiter un score de confiance global comme une permission pour arrêter de vérifier. Un modèle peut être juste à propos d'un noyau plié et faux à propos d'une boucle de site actif qui importe pour la catalyse. Le mouvement pratique est de lire les scores par résidu en premier, puis d'inspecter la biologie: le sac prédit est-il en ligne avec les résidus fonctionnels connus? Les liens de disulfide se forment-ils entre les résidus de cystéine qui devraient être oxydés? Le site de glycosylation lié à N est-il orienté vers l'extérieur?

  • Vérifiez pLDDT et PAE avant d'utiliser une région dans une déclaration fonctionnelle.
  • Comparez la prédiction avec des données expérimentales provenant de la dispersion des rayons X à petit angle, du dichroisme circulaire, des cartes cryo-EM ou de l'échange hydrogène-déutérium, lorsque cela est disponible.
  • Confirmez les résidus critiques par la mutagénèse ou les essais contraignants avant de tirer des conclusions.
  • Traitez les positions de liaison de ligands à partir de modèles prédictifs comme des hypothèses, pas des affinités mesurées ou des modes de liaison.

AlphaFold3 et le problème de l'interaction

Les protéines agissent rarement seules.Le prochain test pratique pour la prédiction de la structure moléculaire n'est pas une autre pile de protéines mais un complexe: un facteur de transcription sur l'ADN, un anticorps sur un antigène, une kinase avec un inhibiteur de petite molécule, ou une protéine virale avec son récepteur.La nature en 2024Il peut produire des modèles plausibles d'assemblages protéine-ligande, protéine-acide nucléique, protéine-protéine et anticorps-antigène sans modèle.

Le fait est que plausible n'est pas la même chose que physique. AlphaFold3 n'est pas un modèle thermodynamique; il ne mesure pas l'affinité de liaison, et il peut halluciner des positions de ligand dans des poches qui ne sont que partiellement formées. L'utilisation pratique à l'intérieur d'un laboratoire est de générer des idées, de resserrer un écran, ou de guider la chimie médicinale. La confirmation expérimentale doit encore se produire, et cela prend généralement plus de temps que la prédiction.

Les limites d'un scientifique de banc

Les outils de prédiction sont moins fiables pour les régions intrinsèquement désordonnées, les boucles flexibles, la topologie des protéines de membrane dans un environnement de dilatation des lipides et les protéines qui nécessitent des cofacteurs ou des modifications post-translationnelles pour se plier. Ils ne modélisent pas bien la dynamique: une structure statique ne peut pas montrer les changements de conformation, l'allosterie, l'effet d'une mutation sur la stabilité ou la cinétique de liaison. Une structure prédite d'une protéine intrinsèquement désordonnée apparaît souvent comme une chaîne étendue avec un pLDDT faible.

Les mutations à un seul point sont un défi connexe. La plupart des modèles ne classent pas de manière cohérente la variante qui déstabilisera une protéine, et ils ne sont pas formés pour prédire la sensibilité à la température ou l'agrégation. Lorsqu'un laboratoire demande laquelle des 20 substitutions va casser la fonction, le modèle répond souvent avec des intervalles de confiance trop larges pour être utilisé.

La validation reste un travail de laboratoire

Une prédiction de structure pour une nouvelle protéine peut être générée en une après-midi, mais l'établissement que le modèle est significatif peut prendre des mois: purifier la protéine, mesurer son état oligomérique, sondage d'un site de liaison avec des mutants, ou la collecte d'une carte cryo-EM à faible résolution.

Dans la pratique, un laboratoire combinera les méthodes. Une prédiction peut justifier une construction. Une carte cryo-EM peut confirmer la pliure globale. Une expérience d'échange hydrogène-déuterium peut tester quelles régions sont flexibles. Un panneau de mutagénèse peut lier un résidu à l'activité. Le modèle entre dans ce flux de travail comme une pièce de preuve, pas un substitut pour les autres.

La question auxquelles les laboratoires seront confrontés dans la deuxième année est simple et gênante: avons-nous arrêté de faire l'expérience plus lente parce que le modèle était bon, ou parce que le modèle était facile?La réponse variera selon la protéine, par laboratoire et par budget.De meilleurs outils peuvent raccourcir la distance entre une séquence et une structure.Ils ne peuvent pas supprimer l'obligation de tester l'hypothèse.

a bathroom with a lot of writing on the wall

Photo by Stephan HK on Unsplash

Portrait de Dr. Elena Ramirez
A propos de l'auteur

Dr. Elena RamirezVoir auteur

Academic Jobs In House Author

Discussions

Sort par :

Soyez le premier à commenter cet article !

vous

Vous serez invité à vous connecter avant de publier votre commentaire.

Nouvelle0 comments

Rejoignez la conversation !

Ajoutez vos commentaires dès maintenant !

Avoir votre mot

Niveau d’engagement

Browse par faculté

Browse par sujet

Frequently Asked Questions

🧬Qu'est-ce que la prédiction de structure moléculaire ?

La prédiction de la structure moléculaire utilise des modèles informatiques pour estimer les coordonnées tridimensionnelles des atomes dans une molécule sans résoudre d'abord la structure expérimentalement. Pour les protéines, l'entrée est généralement une séquence d'acides aminés, et la sortie comprend une forme prévue ainsi que des scores de confiance qui signalent les régions fiables et incertaines.

🔬Comment AlphaFold prédit-il les structures protéiques ?

AlphaFold utilise l'apprentissage profond et les informations évolutives provenant d'alignements de séquences multiples. Il recherche les positions d'acides aminés qui changent ensemble dans les protéines apparentées, ce qui indique les résidus qui se trouvent à proximité dans l'espace tridimensionnel. Le modèle prédit ensuite un ensemble de coordonnées et rapporte des scores de confiance pour chaque région.

📏Quelle est l'exactitude des modèles actuels de prédiction de structure moléculaire ?

L'exactitude dépend de la protéine et de la quantité de données évolutives. Pour de nombreuses protéines bien conservées, AlphaFold2 produit des prédictions de chaîne principale proches de l'exactitude expérimentale. Pour les protéines orphelines, les régions intrinsèquement désordonnées ou les complexes rares, les scores de confiance chutent et le modèle doit être considéré comme une hypothèse plutôt que comme un résultat.

🧾Qu'est-ce que signifie pLDDT ?

pLDDT signifie test de différence de distance locale prédite. Il s'agit d'un score de confiance par résidu allant de 0 à 100. Les régions au-dessus de 90 sont généralement fiables au niveau de la chaîne principale, tandis que les régions en dessous de 50 doivent être considérées comme non structurées ou incertaines.

💊Les modèles peuvent-ils prédire comment une protéine se lie à un médicament ?

AlphaFold3 peut générer des modèles de complexes protéine-ligand plausibles, mais il ne mesure pas l'affinité de liaison ou la thermodynamique. Une position de ligand prédite est un point de départ pour les expériences, et non un mode de liaison mesuré. Les chimistes médicinaux confirment toujours la liaison par des essais et des méthodes structurales.

🧪Les structures prédites remplacent-elles la cristallographie aux rayons X ou la cryo-EM ?

Non. Les prédictions accélèrent la conception de structures, la construction de modèles et la génération d'hypothèses, mais elles ne remplacent pas la validation expérimentale. La cristallographie aux rayons X, la cryo-EM et la RMN fournissent toujours des contraintes mesurées sur la dynamique, la liaison, les modifications post-traductionnelles et le placement des chaines latérales.

🧩Quelle est la différence entre AlphaFold2 et AlphaFold3 ?

AlphaFold2 prédit les structures de protéines à chaîne unique à partir d'alignements de séquences. AlphaFold3 étend la prédiction aux complexes contenant des protéines, de l'ADN, de l'ARN, des ions et de petites molécules en utilisant une approche basée sur la diffusion. AlphaFold3 a une portée plus large, mais nécessite une interprétation prudente pour les modèles de ligand et de composants multiples.

🖥️Quel modèle un laboratoire doit-il utiliser ?

Cela dépend de la question. AlphaFold2 est un choix par défaut solide pour les structures à protéines uniquement. RoseTTAFold est utile lorsque les ressources de calcul sont limitées ou que des complexes sont impliqués. ESMFold est rapide pour écraner de nombreuses séquences. AlphaFold3 convient pour générer des hypothèses sur les interactions avec l'ADN, l'ARN ou les petites molécules.

⚠️Quelles sont les principales limites des modèles de prédiction de structure des protéines ?

Les modèles sont moins fiables pour les régions intrinsèquement désordonnées, les boucles flexibles, la topologie des protéines membranaires dans une bicouche lipidique, les changements conformationnels, l'allostérie et l'effet des mutations ponctuelles sur la stabilité ou l'agrégation. Ils produisent des modèles statiques et ne mesurent pas l'affinité de liaison.

✅Comment un laboratoire peut-il valider une structure prédite avant publication ?

Un laboratoire devrait vérifier les scores pLDDT et d'erreur prévus alignés, comparer le modèle avec les données expérimentales de SAXS, de dichroïsme circulaire, de cryo-EM ou d'échange hydrogène-déutérium et confirmer les résidus fonctionnels par mutagenèse ou des essais de liaison avant de tirer des conclusions.

🗂️Les structures prévues sont-elles acceptées dans la Protein Data Bank ?

La Protein Data Bank stocke des structures déterminées expérimentalement, tandis que la base de données de structures de protéines AlphaFold héberge des modèles prévus. Les structures prévues peuvent soutenir la construction de modèles expérimentaux, mais les déposants sont censés indiquer si des modèles informatiques ont été utilisés et fournir les preuves expérimentales sous-jacentes.

👩‍🔬Ai-je besoin d'être un expert en apprentissage automatique pour exécuter ces modèles ?

Non. De nombreux modèles sont disponibles via des serveurs web tels que la base de données AlphaFold, Robetta et les notebooks ColabFold. Les chercheurs ayant une expérience de base en bioinformatique peuvent exécuter des prédictions, bien que l'interprétation des scores de confiance et des limites nécessite encore un jugement en biologie structurale.