HyperAIHyperAI

Command Palette

Search for a command to run...

Le Premier Référentiel Standardisé Pour Le Classement Des Mutations Protéiques Dans LLM ! Une Équipe De L’université Harvard Propose PG-LLM, Qui Évalue Simultanément 13 Modèles Courants Et 95 Modèles spécialisés.

Featured Image

Vous souvenez-vous de l'émerveillement ressenti lors de vos premières conversations avec ChatGPT et Doubao ? Conçus à partir d'un modèle de langage universel, ils semblaient omniscients, capables non seulement de composer de la poésie et de comprendre l'actualité, mais aussi de peindre, d'écrire des lettres et de programmer — un éventail de compétences qui laissait pantois. Cependant, face à un assistant aussi intelligent et apparemment « omnipotent » dans des domaines tels que la culture, l'art et la science, une question se pose de plus en plus aux scientifiques : dans quelle mesure un modèle de langage universel peut-il être performant dans des domaines spécialisés où les connaissances sont très pointues ?

En ingénierie des protéines, les modèles de langage généralistes sont de plus en plus utilisés dans la conception des protéines grâce à leurs performances accrues en matière de connaissances biologiques et de raisonnement. Cependant, leur capacité à évaluer les effets des mutations protéiques reste encore mal comprise. Bien que certains rapports techniques aient présenté les résultats d'évaluation de modèles de langage généralistes, comme l'évaluation de ProteinGym-Hard mentionnée dans le rapport technique du système Anthropic, qui a évalué les modèles de la série de Claude, ces études présentent encore de nombreuses lacunes, notamment un nombre limité de modèles et l'absence de validation comparative transversale.

Compte tenu de cela,Une équipe de recherche de l'Université Harvard et de Capable a proposé un banc d'essai PG-LLM basé sur l'ensemble de données ProteinGym.Pour la première fois, 13 modèles de langage généralistes et 95 outils spécialisés de prédiction de protéines ont été évalués simultanément selon une dimension d'évaluation unifiée. Grâce au test de référence PG-LLM, les scientifiques ont confirmé pour la première fois que les modèles de langage généralistes peuvent effectivement réaliser un criblage de mutations protéiques, présentant une grande valeur pratique et surpassant au moins la moitié des outils de prédiction spécialisés existants. L'introduction de ce test de référence pourrait fortement soutenir les outils émergents dans le domaine de l'ingénierie des protéines, tout en offrant des perspectives entièrement nouvelles pour la conception de protéines.

Les résultats correspondants, intitulés « PG-LLM : Évaluation comparative des modèles de langage à usage général pour le classement des variants de protéines », ont été publiés en tant que prépublication sur bioRxiv.

Points saillants de la recherche :

* Établissement du premier référentiel standardisé pour le classement des mutations protéiques dans un modèle de langage à usage général : PG-LLM 

* Mener des expériences de contrôle inter-modèles à grande échelle afin de définir clairement les limites de performance entre les modèles de langage généraux et les modèles de prédiction de protéines spécialisés.
* Offre une perspective expérimentale multidimensionnelle, révélant les différences dans les mécanismes sous-jacents des deux types de modèles et fournissant une base pour des solutions de fusion potentielles.

Lien vers l'article : https://www.proteingymllm.com/paper

Basé sur l'ensemble de données ProteinGym, cet ensemble de données couvre 217 ensembles de données expérimentales.

PG-LLM repose sur le jeu de données ProteinGym, un jeu de données de référence universellement standardisé dans le domaine de la prédiction des mutations protéiques. Cette étude utilise le jeu de données complet ProteinGym v1.3 d'analyse approfondie des mutations.Elle couvre 186 protéines différentes et un total de 217 ensembles de données expérimentales.Parmi ceux-ci, 148 groupes ont été déterminés uniquement par des expériences de mutation ponctuelle, et les 69 autres groupes ont été déterminés par des expériences de mutation composée multisite.

Afin de garantir l'équité des tests, une stratégie d'échantillonnage stratifié a été employée pour constituer l'ensemble des mutations candidates. Toutes les mutations ont été triées selon leurs valeurs fonctionnelles mesurées, de la plus faible à la plus élevée, puis réparties en 10 intervalles égaux. Un nombre approximativement égal d'échantillons de mutations a ensuite été tiré dans chaque intervalle. Ceci a permis de s'assurer que l'ensemble des candidats couvrait de manière équilibrée les échantillons de niveaux fonctionnels faibles, moyens et élevés, évitant ainsi la concentration des échantillons dans un seul intervalle et, par conséquent, tout biais de test. Parallèlement, afin d'éliminer l'aléatoire des résultats dû à un échantillonnage aléatoire, trois sous-ensembles indépendants de mutations candidates, appelés « tirages », ont été constitués pour chaque groupe expérimental. Le score de performance final du modèle correspond à la moyenne des résultats de ces trois évaluations.

Cette étude a défini trois tailles d'ensembles candidats, contenant respectivement 10, 50 et 100 mutations.Les conclusions du classement sont principalement basées sur un ensemble candidat de 50 mutations.Afin de garantir l'uniformité et l'équité des expériences, tous les scores expérimentaux ont suivi les règles d'agrégation de macros imbriquées de ProteinGym, ce qui signifie que plus le score mesuré est élevé, meilleures sont les performances fonctionnelles de la protéine mutée.

Premier banc d'essai d'évaluation standardisé pour le classement des mutations protéiques dans le cadre d'un modèle de langage général

Le benchmark PG-LLM est un ensemble standardisé d'outils de benchmark spécifiquement conçus pour évaluer les capacités de séquençage des mutations protéiques des modèles de langage généraux.Ce cadre est conçu pour fournir un flux de travail équitable et uniforme pour les tâches de séquençage de mutations sans échantillon.Concrètement, chaque tâche ne fournit au modèle que la séquence protéique d'entrée et la description du plan de détection expérimental. Sans information sur la comparaison de séquences multiples (MSA) ni sur la structure tridimensionnelle des protéines, le modèle est contraint de trier de manière autonome les 50 protéines mutantes aléatoires en fonction de leur qualité fonctionnelle.

Afin d'évaluer systématiquement les performances collectives des modèles de langage général sur la tâche de séquençage des mutations protéiques, d'éviter les conclusions biaisées tirées d'un seul modèle, et de quantifier le niveau de performance du modèle de langage général et de clarifier ses limites de capacité,Cette étude comprenait deux grandes catégories d'objets d'évaluation pour une validation complète selon les dimensions horizontale et verticale : l'une était un modèle de langage général et l'autre un modèle spécialisé de prédiction des protéines.Concernant les conditions d'entrée et les règles d'évaluation, et compte tenu des principes de fonctionnement différents des deux types de modèles, cette étude adopte des conditions d'entrée délibérément inégales pour le modèle de prédiction spécialisé par rapport au modèle de langage général. Contrairement aux conditions d'entrée plus restrictives de ce dernier, le premier peut utiliser des données d'entrée fournies nativement, telles que les alignements de séquences multiples (MSA) ou les informations sur la structure 3D des protéines. Les règles d'évaluation utilisent les mêmes métriques d'évaluation agrégées que le modèle de langage général, l'indice de score étant représenté par le coefficient de corrélation de rang de Spearman. ρ = 1 indique une cohérence parfaite dans le classement, et ρ = 0 indique une absence de corrélation de rang monotone.

Plus précisément, le modèle de langage général comprend 13 modèles actuellement largement utilisés, tels que Claude Opus 5, la série GPT, la série Gemini, GLM-5.2 et Kimi K3. Parmi les 95 modèles spécialisés de prédiction des protéines,Il inclut VenusREM, un outil de prédiction de pointe dans le domaine des mutations protéiques.Ce modèle de langage protéique open source, optimisé pour la recherche, développé sous la direction de Tan Yang, chercheur au laboratoire d'IA de Tianwu Technology, est spécifiquement conçu pour la prédiction des effets de mutations ponctuelles à partir d'un échantillon nul. Dans cette étude, il se distingue comme l'un des modèles les plus performants du domaine, surpassant même Claude Opus 5.

Auparavant, VenusREM avait obtenu des performances exceptionnelles en matière de prédiction sans exemple sur ProteinGym, un banc d'essai pour l'évaluation des effets des mutations protéiques développé par une équipe de la Harvard Medical School, surpassant ainsi des modèles représentatifs développés par des équipes telles que Meta, BioMap et Microsoft. Le modèle VenusREM et le code associé sont entièrement disponibles en open source, avec plus de 4 000 téléchargements sur la plateforme Hugging Face au cours des 30 derniers jours et plus de 250 000 téléchargements depuis sa publication.

Pour faciliter l'adoption rapide par les développeurs du modèle avancé VenusREMLa section tutoriels du site officiel d'HyperAI (hyper.ai) présente désormais « VenusREM : Prédiction de l'effet de mutation des protéines améliorée par la recherche ».La configuration de l'environnement est terminée et le déploiement est facile et ne nécessite qu'un minimum d'efforts.

Exécutez en ligne :

https://hyper.ai/cn/notebooks/venusrem-retrieval-enhanced-protein-mutation-effect-prediction
Adresse du logiciel libre VenusREM :

https://github.com/ai4protein/VenusREM

Des essais comparatifs multidimensionnels inter-modèles révèlent les différences dans les mécanismes sous-jacents entre les deux types de modèles.

Les principales conclusions de cette étude sont basées sur un ensemble de candidats de taille 50, et les résultats sont présentés dans la figure ci-dessous :

Classement de 13 modèles de langage à usage général avec N=50

Les résultats montrent que Claude Opus 5 domine le classement général des modèles de langage avec un coefficient de corrélation de Spearman ρ = 0,406, suivi de près par GPT-5.6 Sol (ρ = 0,402). Cependant, ce résultat n'est pas absolu. Lors de la comparaison d'expériences où les deux modèles ont pu mener à bien les tests, GPT-5.6 Sol a en réalité obtenu de meilleurs résultats, notamment sur 180 métriques d'évaluation communes.Le score GPT-5.6 Sol a dépassé le score GPT-5.6 de 0,409 à 0,400.

Plus révélateur encore, comparé aux modèles verticaux, Claude Opus 5 atteint également le niveau médian. Plus précisément, il surpasse 49 méthodes sur 95, dont 41 méthodes de séquence pures sur 46 et 8 méthodes composites sur 49 utilisant l'alignement multiple de séquences (MSA) ou des méthodes structurelles. Ceci se reflète dans son score, supérieur à la médiane des méthodes de séquence pures (ρ = 0,374).Il est proche de 0,411 pour le modèle de grande protéine dédié ESM2-650M, mais reste nettement en deçà de 0,523 pour VenusREM.

Afin de vérifier si l'augmentation des ressources de calcul durant la phase d'inférence pouvait améliorer les performances des modèles de langage généralistes, les chercheurs ont mené des validations supplémentaires. Les résultats ont montré qu'un temps de réflexion plus long et une production de texte d'inférence plus importante amélioraient la précision du classement des modèles GPT, Claude et Gemini. Cependant, au-delà d'un certain seuil, les gains de performance ont progressivement convergé, ne permettant finalement pas d'égaler les modèles spécialisés de prédiction de protéines. (Voir figure ci-dessous.)

Impact de la mise à l'échelle sur les rendements du modèle

Cependant, augmenter les ressources n'est pas toujours bénéfique. Accroître la taille de l'ensemble des candidats peut avoir l'effet inverse sur les modèles de langage généraux. Par exemple, lorsque le nombre de candidats passe de 10 à 100, le score de GPT-5.6 Sol sur 178 métriques partagées chute de 0,423 à 0,375. La baisse de performance des autres modèles de langage généraux est également inévitable.À l'inverse, les modèles verticaux tels que ESM2-150M, ESM2-650M et VenusREM sont presque insensibles.

De plus, les outils de prédiction de séquences pures sont plus performants sur les protéines présentant suffisamment d'informations de contraste évolutif, tandis que la précision des grands modèles généralistes est quasiment insensible à la profondeur du contraste. Par exemple, lors d'une expérience comparative portant sur 180 tests, 13 modèles de langage généralistes et 46 méthodes de séquences pures ont montré que les résultats d'agrégation des 13 modèles de langage généralistes restaient pratiquement inchangés entre les protéines à faible et à forte profondeur de contraste. Les performances ajustées pour les groupes à faible, moyenne et forte profondeur étaient respectivement de 0,313, 0,301 et 0,311, avec une différence de seulement -0,002 entre les groupes à faible et à forte profondeur. (Voir figure ci-dessous.)

Comparaison des changements entre les méthodes de séquences pures et les modèles de langage généraux en fonction de la profondeur de l'analyse syntaxique multiple (MSA)

En revanche, la valeur moyenne de la méthode de séquence pure a augmenté progressivement de 0,309 à faible profondeur à 0,380 à profondeur moyenne et à 0,411 à grande profondeur, soit une différence de +0,102. De plus, l'estimation ponctuelle de 45 des 46 méthodes a montré que les performances à grande profondeur étaient supérieures à celles à faible profondeur.

Enfin, l'étude a vérifié si la contamination des données d'entraînement affectait la précision des prédictions du modèle. Les résultats ont montré que la précision du classement des modèles capables de reconnaître les documents originaux ne s'améliorait pas systématiquement par rapport à celle des modèles incapables de les reconnaître ; dans certains cas, les scores des modèles capables de reconnaître les documents originaux étaient même inférieurs.

Les schémas de fusion potentiels offrent de nouvelles idées pour l'application des outils dans le domaine de la conception des protéines.

En résumé, les résultats de cette étude démontrent de manière fiable la capacité des modèles de langage généralistes à prédire le séquençage des mutations protéiques. Leurs performances surpassent celles de nombreux outils classiques de prédiction de séquences, ce qui souligne leur intérêt pratique. Toutefois, cette étude confirme également l'existence d'un écart significatif entre ces modèles et les principales méthodes de prédiction spécialisées, et leur incapacité à remplacer complètement ces dernières. Néanmoins, la spécialisation demeure essentielle : ni les modèles de langage généralistes ni les modèles de prédiction spécialisés ne peuvent être utilisés exclusivement pour des tâches spécifiques à un domaine particulier ; la coordination de leurs efforts constitue donc un enjeu majeur.

Il convient de noter queDans le classement principal de cette étude, VenusREM, dont le coefficient de corrélation de Spearman surpasse largement celui de VenusREM, a été développé sous la direction d'un doctorant né dans les années 2000.—Tan Yang, scientifique technique au laboratoire d'IA de Tianwu Technology, est actuellement doctorant en cotutelle à l'université Jiao Tong de Shanghai et à l'Académie d'innovation de Shanghai (promotion 2025). VenusREM, un modèle multimodal pré-entraîné pour la prédiction des effets des mutations protéiques et l'ingénierie des protéines, a pour objectif principal d'utiliser conjointement la séquence d'acides aminés, la structure tridimensionnelle et les informations d'homologie des protéines afin d'évaluer plus précisément l'impact potentiel des mutations candidates sur les propriétés fonctionnelles telles que l'activité, la stabilité et la capacité de liaison des protéines.

Contrairement aux modèles de langage protéique traditionnels qui reposent uniquement sur l'information d'une seule séquence, VenusREM encode les séquences d'acides aminés sous forme de termes de séquence et discrétise l'environnement spatial tridimensionnel local de chaque résidu sous forme de termes structuraux. Il modélise ensuite conjointement le contexte de la séquence, les caractéristiques structurales locales et les relations positionnelles relatives entre les résidus grâce à une attention croisée multi-têtes découplée. De cette manière,Le modèle peut non seulement comprendre la dépendance séquentielle d'un acide aminé dans la séquence, mais aussi identifier les interactions entre des résidus éloignés l'un de l'autre dans la séquence, mais proches les uns des autres dans l'espace tridimensionnel.

S'appuyant sur ces fondements, VenusREM introduit un module d'amélioration de la recherche permettant d'identifier, dans les bases de données protéiques, les séquences homologues à la protéine cible et d'extraire, par alignement multiple de séquences, les préférences de conservation évolutive et de substitution d'acides aminés à chaque site. Le modèle combine de manière pondérée la caractérisation conjointe de la séquence et de la structure avec les informations évolutives homologues. Même sans échantillon, sans marquage expérimental de la protéine cible ni apprentissage supplémentaire, il calcule les scores d'adaptation des mutations ponctuelles et multiples et classe les mutations candidates en comparant les scores prédits des acides aminés mutants et sauvages aux sites correspondants.

Cadre de modélisation VenusREM

Alors,Le Dr Tan Yang a dirigé le développement et la mise en œuvre de MatwingsVenus™, un agent intelligent de recherche et de développement de protéines conversationnelles, au sein de l'entreprise, basé sur VenusREM. Le principal atout de MatwingsVenus™ réside dans sa capacité à concrétiser pleinement la « recherche et développement conversationnels ». Sans nécessiter de programmation complexe ni de modélisation élaborée, il suffit de donner des instructions, comme dans une conversation informelle, pour que l'IA réalise de manière autonome la conception, la prédiction et la vérification complète du processus de synthèse des protéines. Le mois dernier, cette prouesse, véritable « intelligence artificielle scientifique », a brillé lors de la Conférence mondiale sur l'intelligence artificielle 2026, remportant le titre de « Trésor de la conférence » aux côtés de géants du secteur tels qu'Alibaba et Baidu. Elle est ainsi devenue le seul produit d'intelligence artificielle à visée scientifique sélectionné pour cet événement.

Comme l'a indiqué Tan Yang lors d'une interview, les modèles de langage général et les modèles verticaux présentent chacun leurs avantages et leurs inconvénients. Les premiers, bien qu'érudits, manquent de connaissances approfondies dans un domaine professionnel, tandis que les seconds offrent une compréhension fine des données de recherche scientifique sous-jacentes, mais sont dépourvus de capacités de réflexion et de raisonnement. L'utilisation d'un modèle de langage général pour appréhender les exigences expérimentales complexes, permettant ainsi une intervention humaine, combinée à un modèle vertical pour exploiter des informations évolutives ou structurelles et obtenir une notation précise, pourrait donner de meilleurs résultats.