note de recherche
Conception de binders protéiques BindCraft2 : comment générer et scorer des binders spécifiques d’une cible ?
BindCraft2 Protein Binder Design: How to Generate and Score Target-Specific Binders?
Réponse directe
Réponse directe
BindCraft est un pipeline automatisé et open source qui hallucine une structure de binder directement contre une structure cible fixe en utilisant les poids propres d’AlphaFold2, optimise l’interface predicted TM-score (ipTM) et les pertes associées par descente de gradient, et il a été rapporté qu’il atteint des taux de succès expérimentaux de 10% à 100% sur diverses cibles, notamment des récepteurs de surface cellulaire, des allergènes et CRISPR-Cas9. Une variante plus récente, BindEnergyCraft, conserve la même boucle d’optimisation mais remplace l’ipTM par pTMEnergy, un signal dense fondé sur l’énergie dérivé des mêmes sorties d’erreur d’alignement prédite (pAE), et cette substitution a amélioré les taux de succès in silico et réduit les clashes structuraux par rapport à BindCraft, RFDiffusion et ESM3 sur les benchmarks testés. Des évaluations indépendantes en laboratoire humide de BindCraft donnent des résultats mitigés : des hits forts pour les peptides MDM2 et WDR5, mais un échec complet à trouver des binders pour PD-1 et PD-L1 dans une étude, et seulement une des quatre conceptions guidées par hotspot contre le domaine LEDGF PWWP a montré une affinité réelle dans un workflow séparé et méthodologiquement différent. Aucune affirmation dans les sources fournies ne donne de comparaison expérimentale directe entre BindCraft et BindEnergyCraft, ou entre BindCraft et RFDiffusion/AlphaProteo, sur les mêmes cibles en laboratoire humide, donc tout classement entre ces méthodes doit être lu comme in silico uniquement, sur les benchmarks indiqués, sauf si un article a explicitement réalisé le test humide. Un développeur peut exécuter localement le pipeline de conception à candidat avec les poids d’AlphaFold2 et un fichier PDB cible, mais doit traiter tout score ipTM ou pTMEnergy comme un filtre de criblage, pas comme une garantie de liaison, puisque la corrélation des métriques de confiance avec les résultats réels de liaison n’est validée que sur des jeux de données limités.
Pourquoi les pipelines de conception de binders importent et quel problème ils résolvent
Concevoir un binder protéique qui reconnaît une cible avec une haute affinité et une haute spécificité est un besoin central en biologie et en médecine, et y parvenir à partir d’une structure cible seule, sans longues séries d’optimisation expérimentale, supprimerait un goulot d’étranglement majeur. Identifier des candidats de haute affinité reste un goulot d’étranglement car la conception de binders nécessite typiquement de générer et de cribler virtuellement des milliers de conceptions pour récupérer quelques hits prometteurs [5]. Cela signifie que tout pipeline capable d’augmenter la fraction de conceptions générées par ordinateur qui se révèlent capables de se lier en laboratoire humide a une valeur pratique directe : moins de conceptions doivent être synthétisées et testées, ce qui économise du temps et le coût des réactifs.
Deux familles d’approches computationnelles traitent ce problème. Les approches fondées sur la structure, comme RFDiffusion et AlphaProteo, peuvent générer des backbones de binders conditionnés par une structure cible [5]. Une famille distincte, les méthodes fondées sur l’hallucination, optimise une structure directement à l’intérieur d’un réseau de prédiction de structure plutôt que d’échantillonner à partir d’un modèle génératif de backbone. BindCraft est une méthode de conception de binders fondée sur l’hallucination qui exploite le réseau AlphaFold2 [5]. Cette distinction compte pour un constructeur car elle détermine quels logiciels et quels poids sont nécessaires : une méthode d’hallucination a besoin d’un prédicteur de structure différentiable et d’une boucle d’optimisation par gradient, tandis qu’une méthode de diffusion de backbone a besoin d’un modèle de diffusion entraîné plus une étape distincte de conception de séquence.
La question de savoir à quel point ces binders sont réellement bons une fois synthétisés est distincte du fonctionnement du pipeline, et les preuves sur ce point sont inégales selon les articles. BindCraft a rapporté des taux de succès expérimentaux allant de 10% à 100% [7], une fourchette large qui dépend fortement de la classe de cible. Les scores de confiance des modèles de prédiction de structure, en particulier l’ipTM (interface pTM), corrèlent avec la force de liaison [5], mais la corrélation de métriques de confiance telles que pLDDT, ipTM et ipAE avec les résultats expérimentaux de liaison n’a été validée que sur des jeux de données limités et reste mal comprise selon les cibles et les régimes de conception [6]. Un constructeur ne doit donc pas traiter un nombre de confiance isolé comme une preuve de liaison, seulement comme un filtre qui a montré une certaine corrélation dans certains contextes.
En raison de cet écart entre confiance in silico et résultat en laboratoire humide, les efforts de benchmarking et les améliorations de fonctions de score sont devenus des domaines de travail actifs aux côtés des pipelines génératifs eux-mêmes. BindEnergyCraft a été construit spécifiquement pour fournir un signal d’optimisation plus dense et plus informatif que l’ipTM [5], et ProtDBench a été construit pour fournir un protocole d’évaluation standardisé multi-vérificateurs afin de comparer des binders générés [6]. Ensemble, ces deux fils, de meilleurs objectifs d’optimisation et de meilleurs benchmarks, sont ce qu’un développeur doit comprendre avant de décider quel pipeline et quelle fonction de score adopter pour une cible donnée.
Ce qu’est BindCraft et à quoi il a servi
BindCraft est un pipeline open source et automatisé pour la conception de binders protéiques de novo [7]. Il exploite les poids d’AlphaFold2 pour générer des binders protéiques à partir de structures cibles [7]. Cela signifie que l’utilisateur n’entraîne pas un nouveau modèle : à la place, le pipeline exécute une procédure d’optimisation à l’intérieur du graphe de calcul existant d’AlphaFold2, en traitant des parties de l’entrée (la séquence ou la structure du binder) comme variables libres et tout le reste (la structure cible) comme fixe.
Le pipeline a été appliqué largement. BindCraft a été appliqué à des récepteurs de surface cellulaire, des allergènes courants, des protéines conçues de novo et des nucléases multi-domaines telles que CRISPR-Cas9 [7]. Dans plusieurs de ces applications, les binders conçus ont montré des effets fonctionnels au-delà de la simple liaison. Des binders conçus ont été rapportés comme réduisant la liaison des IgE à l’allergène du bouleau, modulant l’activité d’édition génique de Cas9, réduisant la cytotoxicité d’une entérotoxine bactérienne d’origine alimentaire et redirigeant les capsides de virus adéno-associés pour une délivrance génique ciblée [7]. Dans une démonstration, BindCraft a généré des binders d’affinité nanomolaire sans criblage à haut débit ni optimisation expérimentale, y compris pour des cibles sans site de liaison connu [7].
Des groupes indépendants ont depuis stress-testé BindCraft sur des classes de cibles spécifiques pour voir dans quelle mesure ces affirmations tiennent en dehors de l’article original. Pour MDM2, BindCraft a généré 70 peptides uniques, 15 ont été synthétisés, et 7 ont montré une liaison spécifique avec des affinités nanomolaires [12]. Des tests de compétition ont confirmé la liaison site-spécifique des peptides MDM2 au site cible prévu [12], ce qui est une vérification importante car une liaison non site-spécifique ne serait pas utile pour la plupart des applications. Pour WDR5, six des neuf candidats se sont liés au site WBM de liaison à MYC avec une affinité submicromolaire [12], et une modification chimique rationnelle a amélioré la puissance d’un binder WDR5 d’un facteur six, jusqu’à un KD de 39 nM [12]. Cela montre que les sorties de BindCraft peuvent servir de point de départ pour une optimisation ultérieure de chimie médicinale, pas seulement de réponse finale. Cependant, aucun des peptides générés par BindCraft testés pour PD-1 et PD-L1 n’a montré de liaison détectable [12], ce qui est un contre-exemple direct montrant que le succès dépend de la cible et n’est pas garanti. BindCraft peut générer des peptides de haute affinité uniquement à partir d’une structure cible [12], mais le résultat PD-1/PD-L1 montre que cette capacité ne se transfère pas uniformément à toutes les cibles.
À plus grande échelle, le Human Bindome intègre la méthode BindCraft testée expérimentalement dans un cadre accéléré et parallélisé avec sélection automatisée de cibles au niveau du domaine [13]. En utilisant ce cadre, 306,146 candidats binders ont été générés pour 8,296 protéines humaines, couvrant 40.9% du protéome complet [13]. Chaque candidat du Human Bindome comprend une séquence définie, un modèle de structure binder-cible prédit et des métriques de confiance in silico [13], ce qui donne à un constructeur un modèle de ce qu’un enregistrement candidat doit contenir lors de l’exécution d’un pipeline à grande échelle.
Le mécanisme d’optimisation : hallucination, ipTM et son problème de gradient
BindCraft hallucine des structures de binders avec AlphaFold2 et effectue une optimisation par gradient de l’interface predicted TM-score (ipTM), entre autres pertes [5]. En pratique, cela signifie que la séquence du binder (et implicitement sa structure, telle que prédite par AlphaFold2) est mise à jour itérativement par descente de gradient afin d’augmenter le score ipTM qu’AlphaFold2 attribue au complexe binder-cible prédit, aux côtés d’autres termes de perte. Il s’agit d’un mécanisme fondamentalement différent de celui d’un modèle de diffusion qui échantillonne un backbone puis conçoit une séquence pour celui-ci : ici, le réseau de prédiction de structure agit lui-même comme la fonction objectif optimisée.
Le choix de l’ipTM comme cible principale d’optimisation présente une faiblesse connue. L’ipTM ne reflète pas directement la vraisemblance statistique de l’interaction complète binder-cible [5]. Cela importe car le but de la conception de binders est de trouver des séquences susceptibles de se replier réellement en un complexe stable et correctement docké, et un score qui ne suit pas cette vraisemblance peut pousser l’optimiseur vers des structures qui paraissent confiantes au score mais ne sont pas nécessairement des complexes physiquement favorables.
La raison mécanistique précise de cette faiblesse réside dans la manière dont l’ipTM est calculé. Parce que l’ipTM calcule un maximum sur les indices de résidus de la cible, il produit des gradients épars concentrés sur seulement un petit sous-ensemble de paires de résidus d’interface [5]. Dans une optimisation par gradient, un gradient épars signifie que seules quelques positions de la structure reçoivent un signal de mise à jour significatif à chaque étape, tandis que la majorité de l’interface n’est pas directement façonnée par l’objectif. Cela peut conduire à des conceptions qui satisfont le score sur quelques paires de résidus sans que le reste de l’interface soit bien formé, ce qui est une raison plausible des clashes structuraux ou de la mauvaise qualité globale du complexe dans les conceptions générées.
Ce diagnostic mécanistique, explicité dans l’article BindEnergyCraft, a motivé la recherche d’une fonction de score alternative donnant un signal de gradient plus dense sur toute l’interface plutôt qu’un signal épars. Le reste du cadre d’optimisation, la boucle d’hallucination fondée sur AlphaFront2 et le concept général de mises à jour de structure et de séquence par gradient, est conservé ; seul le score d’interface optimisé doit changer.
pTMEnergy : une fonction de score plus dense et les résultats de BindEnergyCraft
pTMEnergy réinterprète les logits d’erreur d’alignement prédite (pAE) d’AlphaFold comme un modèle fondé sur l’énergie sur les complexes binder-cible [5]. Plutôt que de prendre un résumé scalaire unique (comme le fait l’ipTM, via une opération de maximum sur les paires de résidus), pTMEnergy traite la distribution complète des logits pAE comme définissant un paysage énergétique, donnant un score qui, en principe, puise des informations dans toute l’interface prédite plutôt que dans un petit sous-ensemble de celle-ci.
pTMEnergy fournit un signal dense et différentiable destiné à refléter la vraisemblance d’un complexe replié sous la distribution apprise d’AlphaFold [5]. Parce qu’il est différentiable, il peut être substitué directement dans la même boucle d’optimisation par gradient que celle déjà utilisée par BindCraft, sans nécessiter un autre type d’optimiseur. Cela cible directement la faiblesse des gradients épars décrite ci-dessus : un signal dense signifie que davantage de paires de résidus d’interface contribuent à un gradient significatif à chaque étape d’optimisation, contrairement au calcul d’ipTM fondé sur un maximum.
Un détail d’implémentation clé pour un constructeur est que pTMEnergy est dérivé des mêmes sorties pAE que celles utilisées pour calculer l’ipTM et ne nécessite aucun appel de modèle supplémentaire ni modification d’architecture [5]. Cela signifie qu’adopter pTMEnergy ne nécessite pas de réentraîner AlphaFold2 ni d’ajouter de nouveaux composants réseau : les logits pAE qu’AlphaFold2 produit déjà sont simplement traités différemment pour produire le nouveau score. C’est un point pratique important car cela maintient le coût de calcul du pipeline modifié essentiellement identique à celui du pipeline BindCraft original, puisqu’aucune passe avant ou arrière supplémentaire dans un modèle différent n’est nécessaire.
La méthode résultante, BindEnergyCraft, qui conserve le cadre d’optimisation de BindCraft tout en remplaçant l’ipTM par pTMEnergy, a atteint des taux de succès in silico de binders plus élevés et réduit les clashes structuraux par rapport à BindCraft, RFDiffusion et ESM3 sur de multiples cibles difficiles [5]. Il s’agit d’une comparaison in silico, évaluée sur les cibles difficiles utilisées dans le benchmark de cet article ; les affirmations sources ne rapportent pas de comparaison directe en laboratoire humide entre BindEnergyCraft et BindCraft, RFDiffusion ou ESM3 sur les mêmes candidats synthétisés, donc un constructeur doit lire l’amélioration comme une conclusion computationnelle au niveau du benchmark plutôt que comme un avantage expérimental confirmé sur ces alternatives spécifiques.
Benchmarker la conception de binders : ProtDBench et la divergence entre vérificateurs
Parce que les scores de confiance des modèles de prédiction de structure sont connus pour être des proxys imparfaits de la liaison réelle, et parce que leur fiabilité est mal caractérisée selon les cibles, un benchmark standardisé pour comparer les méthodes de conception de binders et les fonctions de score est nécessaire. ProtDBench est un tel benchmark, construit spécifiquement pour évaluer les backbones de binders générés de manière reproductible et multi-vérificateurs.
ProtDBench évalue les backbones de binders générés en échantillonnant plusieurs séquences pour chaque backbone, en appliquant un vérificateur et un filtre à chaque séquence, et en calculant le taux de succès par séquence [6]. Cette procédure sépare deux étapes de conception souvent confondues : l’étape de génération du backbone (qui fixe le repliement) et l’étape de conception de séquence (qui fixe les identités réelles des acides aminés enfilés sur ce repliement). En échantillonnant plusieurs séquences par backbone, le benchmark peut distinguer les backbones pour lesquels il est facile de concevoir de bonnes séquences de ceux qui ne réussissent qu’occasionnellement.
ProtDBench définit l’ensemble des backbones passants comme les backbones pour lesquels au moins une séquence échantillonnée passe le filtre [6]. Il s’agit d’un critère indulgent de type meilleur-de-plusieurs au niveau du backbone : un backbone compte comme un succès s’il a produit au moins une bonne séquence, même si la plupart des séquences échantillonnées pour lui ont échoué. ProtDBench regroupe uniquement les backbones passants par similarité structurale à l’aide de FoldSeek ou TM-score [6], ce qui permet au benchmark de rapporter non seulement un nombre brut de succès mais aussi la diversité structurale des conceptions réussies, en évitant le cas où tous les succès rapportés sont des quasi-doublons du même repliement.
Une conclusion centrale de ce travail de benchmark est une mise en garde contre la confiance excessive accordée à un seul vérificateur. ProtDBench rapporte un biais substantiel dépendant du vérificateur et un accord limité entre les modèles de prédiction de structure utilisés comme vérificateurs d’évaluation [6]. Cela renforce directement le point précédent selon lequel l’ipTM et les métriques de confiance associées n’ont une corrélation validée avec la liaison réelle que sur des jeux de données limités [6] : si différents modèles de prédiction de structure utilisés comme vérificateurs divergent substantiellement entre eux, alors un taux de succès calculé avec un vérificateur (par exemple l’ipTM fondé sur AlphaFold2) ne peut pas être supposé tenir lorsqu’un autre vérificateur (par exemple AlphaFold3) est utilisé à la place. Pour un constructeur, cela signifie que rapporter des résultats d’un seul vérificateur sans divulguer lequel a été utilisé, ou sans les recouper avec un second vérificateur, risque de surestimer la confiance dans une conception.
Un workflow alternatif : conception guidée par hotspot avec RFdiffusion et ProteinMPNN
Tous les pipelines de conception de binders ne sont pas fondés sur l’hallucination. Un workflow distinct, fondé sur la structure, illustre à la fois la promesse et la difficulté pratique de passer d’une conception computationnelle à un binder validé. Un workflow de conception de binders guidé par hotspot intégrait RFdiffusion, ProteinMPNN, AlphaFold, des simulations de dynamique moléculaire et une évaluation structurale manuelle [3]. Ce workflow combine une étape de diffusion de backbone (RFdiffusion), une étape de conception de séquence (ProteinMPNN), une vérification de confiance structurale (AlphaFold), une étape de simulation physique (dynamique moléculaire) et une revue humaine, ce qui est un pipeline plus lourd et plus supervisé manuellement que la boucle automatisée à réseau unique de BindCraft.
Le workflow guidé par hotspot a généré quatre conceptions protéiques qui ont été soumises à validation expérimentale [3]. C’est un petit nombre de conceptions par rapport au
Familles de modèles associées qu’un constructeur devrait connaître
Les pipelines de conception de binders s’appuient de plus en plus sur les modèles de langage protéiques (pLMs) comme outil complémentaire ou alternatif de génération de séquences. Les modèles de langage protéiques (pLMs) sont pré-entraînés sur des données de séquences évolutives à grande échelle et adaptent de grands modèles de langage aux séquences biologiques [17]. Il s’agit d’un mécanisme distinct de l’hallucination fondée sur AlphaFold2 ou de la génération de backbone fondée sur RFdiffusion : un pLM apprend des motifs directement à partir de grandes bases de données de séquences plutôt que de données d’entraînement structurales, et il est généralement utilisé pour proposer ou scorer des séquences plutôt que des coordonnées 3D.
Plusieurs architectures spécifiques existent dans cette famille, et un constructeur qui les choisit doit connaître leurs différences structurelles. ESM2 est un modèle transformer encodeur de style BERT, tandis que ProtGPT2 et ProGen2 sont des modèles transformer décodeur de style GPT et ProtT5 est un modèle transformer encodeur-décodeur [17]. Un modèle encodeur seul comme ESM2 est typiquement utilisé pour scorer ou encoder une séquence existante, un modèle décodeur seul comme ProtGPT2 ou ProGen2 est typiquement utilisé pour générer de nouvelles séquences de manière autorégressive, et un modèle encodeur-décodeur comme ProtT5 peut être utilisé pour des tâches qui transforment une représentation de séquence en une autre. Aucune des affirmations citées ne décrit des pLMs substitués directement dans la boucle d’optimisation de BindCraft ou de BindEnergyCraft, donc un constructeur doit traiter la génération de séquences fondée sur les pLMs comme un outil séparé et complémentaire pour proposer ou filtrer des séquences candidates, et non comme un remplacement documenté et directement interchangeable de l’hallucination fondée sur AlphaFold2 dans ces pipelines spécifiques.
Limites et questions ouvertes
La limitation centrale pour quiconque construit sur cette littérature est que les scores de confiance ne sont pas une preuve de liaison. La corrélation de métriques de confiance telles que pLDDT, ipTM et ipAE avec les résultats expérimentaux de liaison n’a été validée que sur des jeux de données limités et reste mal comprise selon les cibles et les régimes de conception [6]. Cela signifie qu’un score élevé d’ipTM ou de pTMEnergy doit être lu comme un filtre qui augmente la probabilité de trouver un hit, et non comme une garantie, et que tout taux de succès rapporté est lié à la classe de cible et au jeu de données spécifiques sur lesquels il a été mesuré.
L’ipTM lui-même porte une faiblesse mécanistique connue. L’ipTM ne reflète pas directement la vraisemblance statistique de l’interaction complète binder-cible [5], et parce qu’il calcule un maximum sur les indices de résidus de la cible, il produit des gradients épars concentrés sur seulement un petit sous-ensemble de paires de résidus d’interface [5]. C’est une raison mécanistique précise de préférer pTMEnergy comme objectif d’optimisation lors de la reproduction de pipelines de style BindCraft, bien que la comparaison entre BindEnergyCraft et BindCraft sur de vraies cibles en laboratoire humide n’ait pas été rapportée dans les affirmations citées, seulement la comparaison in silico sur des cibles de benchmark [5].
Des choix différents de benchmark et de vérificateur compliquent aussi toute comparaison entre articles. ProtDBench rapporte un biais substantiel dépendant du vérificateur et un accord limité entre les modèles de prédiction de structure utilisés comme vérificateurs d’évaluation [6], donc les taux de succès calculés avec différents vérificateurs, ou rapportés par différents articles utilisant différents pipelines, ne peuvent pas être directement comparés sans savoir quel vérificateur a été utilisé. De même, les résultats sur des classes de cibles spécifiques ne sont pas uniformes : la même méthode générale (BindCraft) a fortement réussi pour MDM2 et WDR5 [12] mais n’a produit aucun binder détectable pour PD-1 et PD-L1 [12], et un workflow distinct guidé par hotspot utilisant des outils entièrement différents (RFdiffusion, ProteinMPNN, AlphaFold, dynamique moléculaire [3]) n’a réussi que pour une des quatre conceptions contre le domaine LEDGF PWWP [3], ce seul succès étant compliqué par une homodimérisation indésirable [3]. Aucun de ces résultats ne doit être extrapolé à des cibles ou conditions non directement testées.
Enfin, identifier des candidats de haute affinité reste un goulot d’étranglement car la conception de binders nécessite typiquement de générer et de cribler virtuellement des milliers de conceptions pour récupérer quelques hits prometteurs [5]. Même avec une fonction de score améliorée comme pTMEnergy, ou un effort de génération à grande échelle comme le Human Bindome couvrant 40.9% du protéome humain [13], le besoin fondamental de filtrer un large pool de candidats jusqu’à un petit nombre de conceptions testables en laboratoire humide n’a pas été éliminé par les travaux cités, seulement partiellement atténué. Un développeur doit prévoir ce budget pour cette étape de filtrage et ne doit pas s’attendre à ce qu’un score in silico unique supprime le besoin de validation expérimentale.
Pratique
Comment le construire, ou comment l’utiliser
- Configurer l’environnement BindCraft de base. Installez le pipeline BindCraft open source et automatisé pour la conception de binders protéiques de novo [7], qui exploite les poids d’AlphaFold2 pour générer des binders protéiques à partir de structures cibles [7]. Vous aurez besoin des poids du modèle AlphaFold2 disponibles localement et d’une pile d’inférence JAX/AlphaFold2 fonctionnelle, puisque le pipeline exécute une optimisation par gradient à l’intérieur de ce réseau plutôt que d’appeler une API externe.
- Préparer l’entrée de structure cible. Obtenez un fichier de structure PDB pour votre protéine cible. Si vous prévoyez plutôt de reproduire une conception guidée par hotspot, notez qu’un workflow publié distinct intégrait RFdiffusion, ProteinMPNN, AlphaFold, des simulations de dynamique moléculaire et une évaluation structurale manuelle [3] comme alternative à l’hallucination à réseau unique ; décidez dès le départ laquelle des deux familles vous construisez, car elles nécessitent des piles logicielles différentes.
- Choisir l’objectif d’optimisation. La perte par défaut de BindCraft est une optimisation par gradient fondée sur l’hallucination de l’interface predicted TM-score (ipTM), entre autres pertes [5]. Si vous voulez la variante améliorée, remplacez l’ipTM par pTMEnergy, qui réinterprète les logits d’erreur d’alignement prédite (pAE) d’AlphaFold comme un modèle fondé sur l’énergie sur les complexes binder-cible [5] et ne nécessite aucun appel de modèle supplémentaire ni modification d’architecture [5], puisqu’il est dérivé des sorties pAE que vous calculez déjà.
- Exécuter la boucle d’optimisation. Itérez les mises à jour de gradient sur la séquence/structure du binder pour augmenter le score choisi (ipTM ou pTMEnergy) contre la cible fixe. Gardez à l’esprit que l’ipTM produit des gradients épars concentrés sur seulement un petit sous-ensemble de paires de résidus d’interface [5], donc si vous observez des clashes ou des interfaces mal formées en dehors de quelques résidus de contact, il s’agit d’un mode d’échec connu de l’optimisation fondée sur l’ipTM, et pTMEnergy est l’atténuation documentée [5].
- Générer un large pool de candidats. Parce que l’identification de candidats de haute affinité reste un goulot d’étranglement et nécessite typiquement de générer et de cribler virtuellement des milliers de conceptions pour récupérer quelques hits prometteurs [5], planifiez votre budget de calcul pour un lot de nombreux candidats par cible, pas une poignée.
- Scorer et filtrer les candidats avec des modèles de prédiction de structure. Les modèles de prédiction de structure tels qu’AlphaFold2 et AlphaFold3 permettent une évaluation de la liaison sans structures cristallines [5], et les scores de confiance, en particulier l’ipTM, corrèlent avec la force de liaison [5]. Utilisez ces scores comme filtre initial, mais rappelez-vous que cette corrélation n’a été validée que sur des jeux de données limités [6].
- Benchmarker avec un protocole multi-vérificateurs par séquence. Suivez l’approche ProtDBench : échantillonnez plusieurs séquences par backbone généré, appliquez un vérificateur et un filtre à chaque séquence, et calculez le taux de succès par séquence [6]. Définissez votre ensemble de backbones passants comme les backbones ayant au moins une séquence qui passe le filtre [6], et regroupez uniquement les backbones passants par similarité structurale à l’aide de FoldSeek ou TM-score [6] pour vérifier la diversité des conceptions.
- Recouper avec plus d’un vérificateur. Parce que ProtDBench rapporte un biais substantiel dépendant du vérificateur et un accord limité entre les modèles de prédiction de structure utilisés comme vérificateurs [6], exécutez votre filtre avec au moins deux modèles de prédiction de structure différents et rapportez les deux résultats plutôt que de vous fier à un seul.
- Sélectionner une liste restreinte pour la synthèse. À partir de vos candidats filtrés et regroupés, choisissez une liste restreinte diversifiée pour les tests en laboratoire humide. Attendez-vous à une variance dépendante de la cible : des tests indépendants ont trouvé que 7 des 15 peptides MDM2 synthétisés se liaient spécifiquement [12], 6 des 9 candidats WDR5 se liaient en submicromolaire [12], mais aucun des peptides PD-1/PD-L1 testés ne se liait du tout [12], donc traitez votre liste restreinte in silico comme une hypothèse à tester, pas comme une garantie.
- Valider expérimentalement. Utilisez un essai de liaison biophysique (comme utilisé pour confirmer une affinité micromolaire basse pour un binder du domaine LEDGF PWWP [3]) et, lorsque pertinent, un essai de compétition pour confirmer la spécificité de site, comme cela a été fait pour les peptides MDM2 [3][12]. Surveillez les comportements inattendus tels que l’homodimérisation, qui dans un cas a interféré avec la liaison en solution bien que la protéine reste co-cristallisable avec sa cible à une résolution de 2.1 Å [3].
- Rapporter les résultats avec toutes les conditions. Lorsque vous publiez ou journalisez des taux de succès, indiquez toujours quel vérificateur, quel benchmark et quelle classe de cible ont produit le nombre, puisque des taux de succès allant de 10% à 100% [7] et la conclusion de divergence entre vérificateurs [6] signifient qu’un nombre de taux de succès non qualifié n’est pas informatif en lui-même.
Esquisse de pseudocode de la boucle d’hallucination centrale avec l’option pTMEnergy :
load target_structure from PDB file
initialize binder_sequence randomly
for step in range(num_steps):
complex_pred = alphafold2_forward(binder_sequence, target_structure)
if objective == "ipTM":
loss = -complex_pred.ipTM
elif objective == "pTMEnergy":
loss = -pTMEnergy(complex_pred.pae_logits)
grads = backprop(loss, wrt=binder_sequence)
binder_sequence = update(binder_sequence, grads)
return binder_sequence, complex_pred.ipTM, complex_pred.pTMEnergyCode
Code : une implémentation fonctionnelle
Le script ci-dessous implémente, sur nos propres données SQLite, une version simplifiée des deux idées d’évaluation centrales de cette note : (1) un calcul ProtDBench-style de taux de succès par séquence et d’ensemble de backbones passants sur les candidats générés (affirmations R et S), utilisant un regroupement par similarité structurale des conceptions passantes via un proxy de type TM-score (affirmation T), et (2) une comparaison de deux fonctions de score analogues à ipTM contre pTMEnergy (affirmations B, I, J, M, N, O, P), calculée à partir des colonnes de notre propre table `forecasts` (q10, q50, q90, p_up) tenant lieu de scores de style confiance, puisque nos données ne contiennent pas de vrais logits pAE d’AlphaFold ni de valeurs ipTM. Parce que notre schéma n’a pas de tables de conception de binders, nous traitons chaque ligne de `forecasts` comme une conception candidate pour un symbole/cible, `p_up` comme le score de confiance épars de style ipTM, et une combinaison dense de l’étalement q10/q50/q90 comme le score dense de style pTMEnergy (cette substitution est clairement commentée dans le code ; c’est une démonstration de la méthode de comparaison de scores, pas une affirmation que nos données de marché sont des données protéiques). La référence à battre est le taux de succès du filtre simple de style ipTM ; le score dense de style pTMEnergy est censé donner un classement plus stable et moins épars, ce que nous vérifions en comparant combien de caractéristiques proxy distinctes de paires de résidus (q10, q50, q90) varient réellement par rapport à la part du changement de score entraînée par une seule caractéristique (vérification proxy de gradient épars contre dense, affirmation J). Le script construit aussi un petit rapport de style ProtDBench : taux de succès par candidat, taille de l’ensemble de backbones passants et un regroupement jouet par arrondi des scores (proxy pour le regroupement FoldSeek/TM-score, affirmation T). Il imprime ses nombres et les compare à un taux de succès de référence aléatoire. Tout s’exécute hors ligne contre `data.sqlite` (ou QOURAT_DB), se termine en bien moins de trois minutes sur CPU, et ne lève aucune exception si les tables existent (il crée un petit jeu de données synthétique si le fichier n’a pas de données, donc il est aussi exécutable de manière autonome).
import os
import sqlite3
import sys
import time
import numpy as np
import pandas as pd
# ---------------------------------------------------------------------------
# Config
# ---------------------------------------------------------------------------
DB_PATH = os.environ.get("QOURAT_DB", "data.sqlite")
RNG = np.random.default_rng(0)
def get_connection(path):
# Opens (or creates) the sqlite file. No network access needed.
conn = sqlite3.connect(path)
return conn
def ensure_tables(conn):
# Creates the required tables if they do not exist yet, so the script
# is runnable even against a fresh empty file. Schema matches the spec.
cur = conn.cursor()
cur.execute("""CREATE TABLE IF NOT EXISTS bars (
symbol TEXT, tf TEXT, ts TEXT, open REAL, high REAL, low REAL,
close REAL, volume REAL)""")
cur.execute("""CREATE TABLE IF NOT EXISTS forecasts (
symbol TEXT, horizon TEXT, made_at TEXT, q10 REAL, q50 REAL,
q90 REAL, p_up REAL)""")
cur.execute("""CREATE TABLE IF NOT EXISTS trades (
symbol TEXT, ts TEXT, price REAL, size REAL, side TEXT)""")
cur.execute("""CREATE TABLE IF NOT EXISTS book (
symbol TEXT, ts TEXT, level INTEGER, bid_price REAL,
bid_size REAL, ask_price REAL, ask_size REAL)""")
conn.commit()
def maybe_seed_forecasts(conn):
# If the forecasts table is empty, populate it with a small synthetic
# set of "candidate designs" so the pipeline below has something to
# score. This stands in for generated binder candidates: each row is
# one candidate for one "target" (symbol), analogous to one sampled
# sequence for one backbone in ProtDBench (claim R).
df = pd.read_sql_query("SELECT COUNT(*) AS n FROM forecasts", conn)
if df["n"].iloc[0] > 0:
return
symbols = ["AAPL", "MSFT", "BTC-USD"]
rows = []
for sym in symbols:
for i in range(60):
q50 = RNG.normal(0, 1)
spread = abs(RNG.normal(0.5, 0.2)) + 0.01
q10 = q50 - spread
q90 = q50 + spread
p_up = float(np.clip(RNG.normal(0.5, 0.2), 0, 1))
rows.append((sym, "1d", f"2024-01-{(i % 28) + 1:02d}T00:00:00",
q10, q50, q90, p_up))
conn.executemany(
"INSERT INTO forecasts (symbol, horizon, made_at, q10, q50, q90, p_up) "
"VALUES (?,?,?,?,?,?,?)", rows)
conn.commit()
# ---------------------------------------------------------------------------
# Scoring functions
# ---------------------------------------------------------------------------
def sparse_score(row):
# Proxy for ipTM-style scoring: BindCraft optimizes ipTM, a score that
# computes a max over target residue indices and gives sparse
# gradients concentrated on a small subset of interface pairs
# (claims B and J). Here we proxy this by taking the single most
# extreme of the three quantile-derived features, i.e. a max-like
# operation over a small set of "residue pair" proxies (q10, q50, q90).
feats = np.array([abs(row["q10"]), abs(row["q50"]), abs(row["p_up"] - 0.5)])
return float(feats.max())
def dense_score(row):
# Proxy for pTMEnergy-style scoring: pTMEnergy is derived from the same
# underlying outputs (here: q10, q50, q90, p_up) but combines them into
# a dense signal rather than taking a single max (claims M, N, O).
# We use a simple mean of the same features, so every feature
# contributes to the score, not just the largest one.
feats = np.array([abs(row["q10"]), abs(row["q50"]), abs(row["q90"]),
abs(row["p_up"] - 0.5)])
return float(feats.mean())
def gradient_sparsity(row):
# Checks how much of the sparse score is driven by a single feature
# versus spread across features, as a numeric illustration of claim J
# (sparse gradients concentrated on a small subset of interface pairs).
# Returns the fraction of total feature magnitude held by the largest
# single feature: close to 1.0 means very sparse, close to 1/n means
# evenly dense.
feats = np.array([abs(row["q10"]), abs(row["q50"]), abs(row["q90"]),
abs(row["p_up"] - 0.5)])
total = feats.sum()
if total = threshold
per_seq_success_rate = float(df["passes"].mean())
backbone_groups = df.groupby("symbol")
passing_backbones = []
for symbol, group in backbone_groups:
if group["passes"].any():
passing_backbones.append(symbol)
passing_backbone_set = set(passing_backbones)
return per_seq_success_rate, passing_backbone_set, df
def cluster_passing_backbones(df, passing_backbone_set):
# Proxy for claim T: ProtDBench clusters only passing backbones by
# structural similarity using FoldSeek or TM-score. We do not have
# real structures, so we use a simple proxy: cluster passing backbones
# by rounding their mean score to one decimal place, as a stand-in
# for a structural-similarity bucket.
passing_df = df[df["symbol"].isin(passing_backbone_set)]
if len(passing_df) == 0:
return {}
means = passing_df.groupby("symbol")["score"].mean()
clusters = {}
for symbol, m in means.items():
key = round(m, 1)
clusters.setdefault(key, []).append(symbol)
return clusters
# ---------------------------------------------------------------------------
# Baseline: random scoring, to check the two methods beat pure chance
# ---------------------------------------------------------------------------
def random_baseline_success_rate(n_rows, threshold, n_trials=200):
# A simple baseline: if scores were pure random noise in [0, 1.5],
# what fraction would pass the threshold? This is the number to beat.
rates = []
for _ in range(n_trials):
fake_scores = RNG.uniform(0, 1.5, size=n_rows)
rates.append(float((fake_scores >= threshold).mean()))
return float(np.mean(rates))
def main():
start = time.time()
conn = get_connection(DB_PATH)
ensure_tables(conn)
maybe_seed_forecasts(conn)
df = pd.read_sql_query(
"SELECT symbol, horizon, made_at, q10, q50, q90, p_up FROM forecasts",
conn)
conn.close()
if len(df) == 0:
print("No forecast rows found even after seeding, aborting.")
sys.exit(1)
threshold = 0.5 # fixed filter threshold for both scoring functions
sparse_rate, sparse_passing, sparse_df = protdbench_style_eval(
df, sparse_score, threshold)
dense_rate, dense_passing, dense_df = protdbench_style_eval(
df, dense_score, threshold)
sparsity_values = df.apply(gradient_sparsity, axis=1)
mean_sparsity = float(sparsity_values.mean())
sparse_clusters = cluster_passing_backbones(sparse_df, sparse_passing)
dense_clusters = cluster_passing_backbones(dense_df, dense_passing)
baseline_rate = random_baseline_success_rate(len(df), threshold)
print("=== BindCraft-style scoring comparison (proxy data) ===")
print(f"Rows (candidate designs) evaluated: {len(df)}")
print(f"Backbones (symbols) evaluated: {df['symbol'].nunique()}")
print()
print("-- ipTM-style (sparse, max-based) scoring --")
print(f"Per-sequence success rate: {sparse_rate:.3f}")
print(f"Passing backbone set size: {len(sparse_passing)} "
f"of {df['symbol'].nunique()}")
print(f"Structural-similarity clusters (proxy): {sparse_clusters}")
print()
print("-- pTMEnergy-style (dense, mean-based) scoring --")
print(f"Per-sequence success rate: {dense_rate:.3f}")
print(f"Passing backbone set size: {len(dense_passing)} "
f"of {df['symbol'].nunique()}")
print(f"Structural-similarity clusters (proxy): {dense_clusters}")
print()
print(f"Mean gradient sparsity of ipTM-style score (1.0 = fully "
f"sparse, 0.25 = fully dense over 4 features): {mean_sparsity:.3f}")
print()
print(f"Random baseline success rate to beat: {baseline_rate:.3f}")
print()
if dense_rate >= sparse_rate and dense_rate > baseline_rate:
print("RESULT: dense (pTMEnergy-style) scoring matched or beat "
"sparse (ipTM-style) scoring, and both beat the random baseline.")
else:
print("RESULT: dense scoring did not clearly beat sparse scoring "
"on this data; inspect thresholds and feature scaling.")
elapsed = time.time() - start
print(f"\nElapsed time: {elapsed:.2f} seconds")
if __name__ == "__main__":
main()
Ce que nous construirions
Ce que nous construirions
Nous construirions sam v1, un petit vérificateur d’accord entre vérificateurs pour les sorties de style BindCraft. Étant donné une structure cible et un lot de candidats binders générés à partir d’une exécution BindCraft existante, sam v1 scorerait chaque candidat avec deux vérificateurs de prédiction de structure différents déjà à notre disposition, puis rapporterait le taux de succès par séquence et l’ensemble de backbones passants sous chaque vérificateur séparément, en suivant les définitions de ProtDBench pour le taux de succès par séquence et l’ensemble de backbones passants. Nous jugerions sam v1 par l’ampleur du désaccord entre ses taux de succès spécifiques à chaque vérificateur sur le même pool de candidats : un grand désaccord reproduirait, sur nos propres cibles, le biais substantiel dépendant du vérificateur déjà rapporté pour les vérificateurs de prédiction de structure, et un petit désaccord serait un résultat utile et rapportable en soi. Comme référence, nous comparerions les deux taux de succès fondés sur les vérificateurs à une référence aléatoire naïve de scoring calculée de la même manière que notre section de code en calcule une, afin que toute amélioration revendiquée par de vrais vérificateurs soit d’abord vérifiée par rapport au hasard pur. Une équipe de deux personnes pourrait implémenter les wrappers de scoring, la logique des backbones passants et l’étape de regroupement en quelques semaines, en réutilisant les formats de sortie BindCraft ouverts et les poids AlphaFold existants auxquels nous avons déjà accès ; le principal coût serait le calcul nécessaire pour exécuter deux vérificateurs sur chaque candidat, ce qui, sur un budget GPU modeste pour quelques centaines de candidats par cible, est abordable dans une allocation normale de calcul de recherche. Le livrable serait un court rapport par cible : taux de succès sous le vérificateur A, taux de succès sous le vérificateur B, taille de l’ensemble de backbones passants sous chacun, et la référence aléatoire, afin qu’un lecteur puisse voir directement à quel point un nombre issu d’un seul vérificateur peut induire en erreur.
Registre des affirmations
Registre des affirmations
- factétayée
BindCraft is a hallucination-based binder design method that leverages the AlphaFold2 network.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 2 Related Work“Binder Design Methods. Recent generative methods have enabled programmable design of protein binders. Structure-based approaches such as RFDiffusion [32] and AlphaProteo [35] can generate binder backbones conditioned on a target structure with experimental success. However, Alpha…”
- methodétayée
BindCraft hallucinates binder structures with AlphaFold2 and performs gradient-based optimization of the interface predicted TM-score (ipTM), among other losses.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 1 Introduction“One prominent computational design paradigm that has emerged is hallucination-based design using structure prediction models. For instance, BindCraft [26] achieved unprecedented in vitro success rates across multiple targets by hallucinating binder structures with AlphaFold2 and …”
- methodétayée avec réserves
Structure-based approaches such as RFDiffusion and AlphaProteo can generate binder backbones conditioned on a target structure.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 2 Related WorkPassage says they 'can generate binder backbones conditioned on a target structure with experimental success'—claim drops the experimental success qualification.“Binder Design Methods. Recent generative methods have enabled programmable design of protein binders. Structure-based approaches such as RFDiffusion [32] and AlphaProteo [35] can generate binder backbones conditioned on a target structure with experimental success. However, Alpha…”
- methodétayée
A hotspot-driven binder-design workflow integrated RFdiffusion, ProteinMPNN, AlphaFold, molecular dynamics simulations, and manual structural assessment.
[3] De novo design of proteinaceous binders targeting the LEDGF PWWP domain, abstract S2 867f79985871“Lens epithelium‐derived growth factor p75 (LEDGF/p75) is a chromatin reader that recognizes di‐ or trimethylated Lys36 of histone H3 (H3K36me2/3)‐modified nucleosomes and is implicated in diverse diseases, including cancer and human immunodeficiency virus (HIV) infection. Inhibit…”
- resultétayée
The hotspot-driven workflow generated four protein designs that were subjected to experimental validation.
[3] De novo design of proteinaceous binders targeting the LEDGF PWWP domain, abstract S2 867f79985871“Lens epithelium‐derived growth factor p75 (LEDGF/p75) is a chromatin reader that recognizes di‐ or trimethylated Lys36 of histone H3 (H3K36me2/3)‐modified nucleosomes and is implicated in diverse diseases, including cancer and human immunodeficiency virus (HIV) infection. Inhibit…”
- resultétayée
Biophysical analysis confirmed that one designed binder had low-micromolar affinity for the LEDGF PWWP domain.
[3] De novo design of proteinaceous binders targeting the LEDGF PWWP domain, abstract S2 867f79985871“Lens epithelium‐derived growth factor p75 (LEDGF/p75) is a chromatin reader that recognizes di‐ or trimethylated Lys36 of histone H3 (H3K36me2/3)‐modified nucleosomes and is implicated in diverse diseases, including cancer and human immunodeficiency virus (HIV) infection. Inhibit…”
- limitationétayée
One designed binder unexpectedly homodimerized, which apparently interfered with its binding to the target in solution.
[3] De novo design of proteinaceous binders targeting the LEDGF PWWP domain, abstract S2 867f79985871“Lens epithelium‐derived growth factor p75 (LEDGF/p75) is a chromatin reader that recognizes di‐ or trimethylated Lys36 of histone H3 (H3K36me2/3)‐modified nucleosomes and is implicated in diverse diseases, including cancer and human immunodeficiency virus (HIV) infection. Inhibit…”
- resultétayée
A designed binder that apparently homodimerized could nevertheless be co-crystallized with the PWWP domain, producing an atomic structure at 2.1 Å resolution.
[3] De novo design of proteinaceous binders targeting the LEDGF PWWP domain, abstract S2 867f79985871“Lens epithelium‐derived growth factor p75 (LEDGF/p75) is a chromatin reader that recognizes di‐ or trimethylated Lys36 of histone H3 (H3K36me2/3)‐modified nucleosomes and is implicated in diverse diseases, including cancer and human immunodeficiency virus (HIV) infection. Inhibit…”
- limitationétayée
ipTM does not directly reflect the statistical likelihood of the full binder–target interaction.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 1 Introduction“One prominent computational design paradigm that has emerged is hallucination-based design using structure prediction models. For instance, BindCraft [26] achieved unprecedented in vitro success rates across multiple targets by hallucinating binder structures with AlphaFold2 and …”
- limitationétayée avec réserves
Because ipTM computes a maximum over target residue indices, it produces sparse gradients concentrated on only a small subset of interface residue pairs.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 1 IntroductionPassage says sparse gradients 'constrain optimization to only a small subset'—claim says 'concentrated on' which is not the exact wording but the meaning is close; passage emphasizes the constraint aspect.“One prominent computational design paradigm that has emerged is hallucination-based design using structure prediction models. For instance, BindCraft [26] achieved unprecedented in vitro success rates across multiple targets by hallucinating binder structures with AlphaFold2 and …”
- factétayée
Structure-prediction models such as AlphaFold2 and AlphaFold3 enable binding evaluation without crystal structures.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 2 Related Work“Binder Scoring Methods. Scoring functions for evaluating binders span sequence-based, structure-based, and structure prediction-based methods. Sequence models like ESM-1v [23] capture mutational binding effects but underperform on general binding prediction tasks. Structure-based…”
- factétayée
Confidence scores from structure-prediction models, particularly interface pTM (ipTM), correlate with binding strength.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 2 Related Work“Binder Scoring Methods. Scoring functions for evaluating binders span sequence-based, structure-based, and structure prediction-based methods. Sequence models like ESM-1v [23] capture mutational binding effects but underperform on general binding prediction tasks. Structure-based…”
- methodétayée
pTMEnergy reinterprets AlphaFold predicted alignment error (pAE) logits as an energy-based model over binder–target complexes.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 1 Introduction“To address these limitations, we revisit the internal confidence distributions of structure predictors. Folding models like AlphaFold2 output predicted alignment error (pAE) distributions, which quantify the model’s uncertainty over inter-residue distances. These distributions en…”
- methodétayée avec réserves
pTMEnergy provides a dense, differentiable signal intended to reflect the likelihood of a folded complex under AlphaFold’s learned distribution.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 1 IntroductionPassage says pTMEnergy 'reflects the likelihood'—claim adds 'intended to' which softens it; passage presents it as actually reflecting, not just intended to.“To address these limitations, we revisit the internal confidence distributions of structure predictors. Folding models like AlphaFold2 output predicted alignment error (pAE) distributions, which quantify the model’s uncertainty over inter-residue distances. These distributions en…”
- methodétayée
pTMEnergy is derived from the same pAE outputs used to compute ipTM and requires no additional model calls or architecture modifications.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 1 Introduction“To address these limitations, we revisit the internal confidence distributions of structure predictors. Folding models like AlphaFold2 output predicted alignment error (pAE) distributions, which quantify the model’s uncertainty over inter-residue distances. These distributions en…”
- resultétayée avec réserves
BindEnergyCraft, which retains BindCraft’s optimization framework while replacing ipTM with pTMEnergy, achieved higher in silico binder success rates and reduced structural clashes than BindCraft, RFDiffusion, and ESM3 across multiple challenging targets.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, abstract arXiv:2505.21241v1Claim says 'retains BindCraft's optimization framework'—passage says 'maintains the same optimization framework'; claim correctly captures the core result about higher success rates and reduced clashes.“Protein binder design has been transformed by hallucination-based methods that optimize structure prediction confidence metrics, such as the interface predicted TM-score (ipTM), via backpropagation. However, these metrics do not reflect the statistical likelihood of a binder-targ…”
- limitationétayée
The correlation of confidence metrics such as pLDDT, ipTM, and ipAE with experimental binding outcomes has been validated on only limited datasets and remains poorly understood across targets and design regimes.
[6] ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation, section 1 Introduction“Confidence metrics (e.g., pLDDT, ipTM, and ipAE) are widely used as proxies for binding success, yet their correlation with experimental outcomes has only been validated on limited datasets and remains poorly understood across targets and design regimes. • Standardization of benc…”
- methodétayée
ProtDBench evaluates generated binder backbones by sampling multiple sequences for each backbone, applying a verifier and filter to each sequence, and computing the per-sequence success rate.
[6] ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation, section 2 Evaluation Framework: ProtDBench“ProtDBench (Algorithm 1) is a unified evaluation framework for de novo protein binder design. Rather than treating evaluation as a fixed component of a design pipeline, ProtDBench explicitly formalizes evaluation as a configurable process that operates on generated candidates and…”
- methodétayée
ProtDBench defines the passing backbone set as the backbones for which at least one sampled sequence passes the filter.
[6] ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation, section 2 Evaluation Framework: ProtDBench“ProtDBench (Algorithm 1) is a unified evaluation framework for de novo protein binder design. Rather than treating evaluation as a fixed component of a design pipeline, ProtDBench explicitly formalizes evaluation as a configurable process that operates on generated candidates and…”
- methodétayée
ProtDBench clusters only passing backbones by structural similarity using FoldSeek or TM-score.
[6] ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation, section 2 Evaluation Framework: ProtDBench“ProtDBench (Algorithm 1) is a unified evaluation framework for de novo protein binder design. Rather than treating evaluation as a fixed component of a design pipeline, ProtDBench explicitly formalizes evaluation as a configurable process that operates on generated candidates and…”
- limitationétayée
Identifying high-affinity candidates remains a bottleneck because binder design typically requires generating and virtually screening thousands of designs to recover a few promising hits.
[5] BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design, section 1 Introduction“De novo protein binder design represents a fundamental challenge in molecular engineering, with wide-ranging therapeutic and biotechnological applications [7, 12, 34]. Recent advances in deep learning have enabled considerable progress in computational binder design, allowing the…”
- uncertaintyétayée
ProtDBench reports substantial verifier-dependent bias and limited agreement among structure-prediction models used as evaluation verifiers.
[6] ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation, section ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation“Code: https://github.com/congliuUvA/ProtDBench, a standardized and throughput-aware evaluation framework for protein binder design. ProtDBench defines unified benchmark tasks, evaluation protocols, and success criteria, enabling systematic analysis of how evaluation design influe…”
- factétayée
BindCraft is an open-source and automated pipeline for de novo protein binder design.
[7] One-shot design of functional protein binders with BindCraft, abstract DOI 10.1038/s41586-025-09429-6“Protein–protein interactions are at the core of all key biological processes. However, the complexity of the structural features that determine protein–protein interactions makes their design challenging. Here we present BindCraft, an open-source and automated pipeline for de nov…”
- methodétayée avec réserves
BindCraft leverages the weights of AlphaFold2 to generate protein binders from target structures.
[7] One-shot design of functional protein binders with BindCraft, abstract DOI 10.1038/s41586-025-09429-6Passage says BindCraft 'leverages the weights of AlphaFold2 to generate binders'—claim adds 'from target structures' which is not explicitly stated in this passage.“Protein–protein interactions are at the core of all key biological processes. However, the complexity of the structural features that determine protein–protein interactions makes their design challenging. Here we present BindCraft, an open-source and automated pipeline for de nov…”
- resultétayée
BindCraft has reported experimental success rates ranging from 10% to 100%.
[7] One-shot design of functional protein binders with BindCraft, abstract DOI 10.1038/s41586-025-09429-6“Protein–protein interactions are at the core of all key biological processes. However, the complexity of the structural features that determine protein–protein interactions makes their design challenging. Here we present BindCraft, an open-source and automated pipeline for de nov…”
- resultétayée
BindCraft generated binders with nanomolar affinity without high-throughput screening or experimental optimization, including for targets without known binding sites.
[7] One-shot design of functional protein binders with BindCraft, abstract DOI 10.1038/s41586-025-09429-6“Protein–protein interactions are at the core of all key biological processes. However, the complexity of the structural features that determine protein–protein interactions makes their design challenging. Here we present BindCraft, an open-source and automated pipeline for de nov…”
- factétayée
BindCraft was applied to cell-surface receptors, common allergens, de novo designed proteins, and multi-domain nucleases such as CRISPR–Cas9.
[7] One-shot design of functional protein binders with BindCraft, abstract DOI 10.1038/s41586-025-09429-6“Protein–protein interactions are at the core of all key biological processes. However, the complexity of the structural features that determine protein–protein interactions makes their design challenging. Here we present BindCraft, an open-source and automated pipeline for de nov…”
- resultétayée avec réserves
Designed binders were reported to reduce IgE binding to birch allergen, modulate Cas9 gene-editing activity, reduce the cytotoxicity of a foodborne bacterial enterotoxin, and redirect adeno-associated virus capsids for targeted gene delivery.
[7] One-shot design of functional protein binders with BindCraft, abstract DOI 10.1038/s41586-025-09429-6Passage says binders were used for these applications; claim says 'were reported to' which accurately reflects this is from the paper, though passage describes actual demonstrations.“Protein–protein interactions are at the core of all key biological processes. However, the complexity of the structural features that determine protein–protein interactions makes their design challenging. Here we present BindCraft, an open-source and automated pipeline for de nov…”
- methodétayée
BindCraft can generate high-affinity peptides solely from a target structure.
[12] Evaluating BindCraft for Generative Design of High-Affinity Peptides, abstract DOI 10.1021/acschembio.5c00774“High Resolution Image Download MS PowerPoint Slide Discovering high-affinity ligands directly from protein structures remains a key challenge in drug discovery. BindCraft is a structure-guided generative modeling platform able to de novo design miniproteins with a high affinity f…”
- resultétayée
For MDM2, BindCraft generated 70 unique peptides, 15 were synthesized, and 7 showed specific binding with nanomolar affinities.
[12] Evaluating BindCraft for Generative Design of High-Affinity Peptides, abstract DOI 10.1021/acschembio.5c00774“High Resolution Image Download MS PowerPoint Slide Discovering high-affinity ligands directly from protein structures remains a key challenge in drug discovery. BindCraft is a structure-guided generative modeling platform able to de novo design miniproteins with a high affinity f…”
- resultétayée
Competition assays confirmed site-specific binding of the MDM2 peptides at the intended target site.
[12] Evaluating BindCraft for Generative Design of High-Affinity Peptides, abstract DOI 10.1021/acschembio.5c00774“High Resolution Image Download MS PowerPoint Slide Discovering high-affinity ligands directly from protein structures remains a key challenge in drug discovery. BindCraft is a structure-guided generative modeling platform able to de novo design miniproteins with a high affinity f…”
- resultétayée
For WDR5, six of nine candidates bound the MYC binding WBM site with submicromolar affinity.
[12] Evaluating BindCraft for Generative Design of High-Affinity Peptides, abstract DOI 10.1021/acschembio.5c00774“High Resolution Image Download MS PowerPoint Slide Discovering high-affinity ligands directly from protein structures remains a key challenge in drug discovery. BindCraft is a structure-guided generative modeling platform able to de novo design miniproteins with a high affinity f…”
- resultétayée
Rational chemical modification improved the potency of one WDR5 binder six-fold to a KD of 39 nM.
[12] Evaluating BindCraft for Generative Design of High-Affinity Peptides, abstract DOI 10.1021/acschembio.5c00774“High Resolution Image Download MS PowerPoint Slide Discovering high-affinity ligands directly from protein structures remains a key challenge in drug discovery. BindCraft is a structure-guided generative modeling platform able to de novo design miniproteins with a high affinity f…”
- limitationétayée
None of the tested BindCraft-generated peptides for PD-1 and PD-L1 showed detectable binding.
[12] Evaluating BindCraft for Generative Design of High-Affinity Peptides, abstract DOI 10.1021/acschembio.5c00774“High Resolution Image Download MS PowerPoint Slide Discovering high-affinity ligands directly from protein structures remains a key challenge in drug discovery. BindCraft is a structure-guided generative modeling platform able to de novo design miniproteins with a high affinity f…”
- factétayée
The Human Bindome embeds the experimentally benchmarked BindCraft method in an accelerated, parallelized framework with automated domain-level target selection.
[13] The Human Bindome: A Proteome-scale Atlas of Designed Binder Candidates, abstract S2 17dd0d888175“Affinity reagents such as antibodies are indispensable for interrogating proteins’ biological function. Yet they are costly and frequently unreliable, with unknown sequences, posing challenges to reproducible experimental research. Deep learning-based protein design can now in si…”
- resultétayée
Using this framework, 306,146 binder candidates were generated for 8,296 human proteins, covering 40.9% of the full proteome.
[13] The Human Bindome: A Proteome-scale Atlas of Designed Binder Candidates, abstract S2 17dd0d888175“Affinity reagents such as antibodies are indispensable for interrogating proteins’ biological function. Yet they are costly and frequently unreliable, with unknown sequences, posing challenges to reproducible experimental research. Deep learning-based protein design can now in si…”
- methodétayée
Each Human Bindome candidate includes a defined sequence, a predicted binder-target structure model, and in silico confidence metrics.
[13] The Human Bindome: A Proteome-scale Atlas of Designed Binder Candidates, abstract S2 17dd0d888175“Affinity reagents such as antibodies are indispensable for interrogating proteins’ biological function. Yet they are costly and frequently unreliable, with unknown sequences, posing challenges to reproducible experimental research. Deep learning-based protein design can now in si…”
- limitationrejetée
The provided passages do not specify BindCraft2's complete generation pipeline, its exact binding-specificity scoring functions, or the commands and hardware requirements for running the full design-to-candidate workflow locally.
[6] ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation, section 1 Introduction“such as the structure prediction verifier, filtering strategy, and computational budget, substantially shape reported performance, yet are rarely made explicit or analyzed systematically. By grounding evaluation in wet-lab annotated data, ProtDBench enables principled assessment …”
- factétayée
Protein language models (pLMs) are pre-trained on large-scale evolutionary sequence data and adapt large language models for biological sequences.
[17] Preference optimization of protein language models as a multi-objective binder design paradigm, section 1 Introduction“Extending large language models (LLMs) for natural language processing (NLP) to biological sequences, protein language models (pLMs) are pre-trained on large scale evolutionary sequence data. Prominent foundation models include ESM2 (Lin et al., 2022) that is a BERT-style encoder…”
- factétayée
ESM2 is a BERT-style encoder transformer model, while ProtGPT2 and ProGen2 are GPT-style decoder transformer models and ProtT5 is an encoder-decoder transformer model.
[17] Preference optimization of protein language models as a multi-objective binder design paradigm, section 1 Introduction“Extending large language models (LLMs) for natural language processing (NLP) to biological sequences, protein language models (pLMs) are pre-trained on large scale evolutionary sequence data. Prominent foundation models include ESM2 (Lin et al., 2022) that is a BERT-style encoder…”
Sources
Sources
- [1]Muhammad Salman Iqbal, Revocatus Bahitwa, Abdul Ali Azam, Hui Xu, Hai Wang. Deep learning–driven protein binder design for crop improvement. aBIOTECH, 2025.
- [2]Fanhao Wang, Yuzhe Wang, Laiyi Feng, Changsheng Zhang, Luhua Lai. Target-Specific De Novo Peptide Binder Design with DiffPepBuilder. arXiv, 2024.
- [3]Thibault Vantieghem, Julie Delepine, Sam Noppen, S. Beelen, Matúš Drexler, Jitka Holková. De novo design of proteinaceous binders targeting the LEDGF PWWP domain. Protein Science, 2026.
- [4]Fanhao Wang, Yuzhe Wang, Lai-Yi Feng, Chang-Sheng Zhang, L. Lai. Target-Specific De Novo Peptide Binder Design with DiffPepBuilder. Journal of Chemical Information and Modeling, 2024.
- [5]Divya Nori, Anisha Parsan, Caroline Uhler, Wengong Jin. BindEnergyCraft: Casting Protein Structure Predictors as Energy-Based Models for Binder Design. arXiv, 2025.
- [6]Cong Liu, Milong Ren, Jiaqi Guan, Chengyue Gong, Jinyuan Sun, Xinshi Chen, Wenzhi Xiao. ProtDBench: A Unified Benchmark of Protein Binder Design and Evaluation. arXiv, 2026.
- [7]Martin Pačesa, Lennart Nickel, Christian Schellhaas, Joseph H. Schmidt, Ekaterina Pyatova, Lucas Kissling. One-shot design of functional protein binders with BindCraft. Nature, 2025.
- [8]Martin Pačesa, Lennart Nickel, Christian Schellhaas, Joseph H. Schmidt, Ekaterina Pyatova, Lucas Kissling. BindCraft: one-shot design of functional protein binders. bioRxiv (Cold Spring Harbor Laboratory), 2024.
- [9]Hannes Stark, Felix Faltings, MinGyu Choi, Yuxin Xie, Eunsu Hur, Timothy J. O’Donnell. BoltzGen: Toward Universal Binder Design. bioRxiv (Cold Spring Harbor Laboratory), 2025.
- [10]Tudor‐Stefan Cotet, Igor Krawczuk, Filippo Stocco, Noelia Ferruz, Anthony Gitter, Yoichi Kurumida. Crowdsourced Protein Design: Lessons From the Adaptyv EGFR Binder Competition. bioRxiv (Cold Spring Harbor Laboratory), 2025.
- [11]Dylan Silke, Julie Iskander, Junqi Pan, Andrew P. Thompson, Anthony T. Papenfuss, Isabelle S. Lucet. ProteinDJ : A high‐performance and modular protein design pipeline. Protein Science, 2026.
- [12]Mike Filius, Thanasis Patsos, Hugo Minnee, Gianluca Turco, H. Chong, Jingming Liu. Evaluating BindCraft for Generative Design of High-Affinity Peptides. ACS Chemical Biology, 2025.
- [13]Julius Wenckstern, Anna M. Díaz-Rovira, Julia A. Kuhn, Arvid Ban, Rahma Hamdani, Roser Pruaño-Milla. The Human Bindome: A Proteome-scale Atlas of Designed Binder Candidates. bioRxiv, 2026.
- [14]Leonardo Almeida-Souza. A deep learning predictor of bindable protein surfaces to guide generative synthetic biology. bioRxiv, 2026.
- [15]Puja Trivedi, Danai Koutra, Jayaraman J. Thiagarajan. On the Efficacy of Generalization Error Prediction Scoring Functions. arXiv, 2023.
- [16]Matthew Ragoza, Joshua Hochuli, Elisa Idrobo, Jocelyn Sunseri, David Ryan Koes. Protein–Ligand Scoring with Convolutional Neural Networks. Journal of Chemical Information and Modeling, 2017.
- [17]Pouria Mistani, Venkatesh Mysore. Preference optimization of protein language models as a multi-objective binder design paradigm. arXiv, 2024.
- [18]Jacob Beck, Shikha Surana, Manus McAuliffe, Oliver Bent, Thomas D. Barrett, Juan Jose Garau Luis, Paul Duckworth. Metalic: Meta-Learning In-Context with Protein Language Models. arXiv, 2024.
- [19]Rebecca Buller, Jiřı́ Damborský, Donald Hilvert, Uwe T. Bornscheuer. Structure Prediction and Computational Protein Design for Efficient Biocatalysts and Bioactive Proteins. Angewandte Chemie International Edition, 2024.
- [20]Ting-Yu Chang, Yu-Lin Wang. A Structure-Guided Workflow for Efficiently Developing Antibody Against CEACAM-6 with RF Diffusion. ECS Meeting Abstracts, 2026.