GPT-6 Astra en tête d’un benchmark scientifique
IA Contenu généré par intelligence artificielle : texte écrit par une IA, lu par des voix de synthèse.
Transcription avec les sources de chaque passage
Ondine
Terminal-Bench-Science 0.1, développé dans le cadre d’une collaboration menée par des chercheurs de Stanford avec les équipes de Terminal-Bench et Harbor, place GPT-6 Astra en tête des agents évalués, avec 63,3 % au niveau d’effort maximal, selon AlphaSignal. Le benchmark évalue des agents d’intelligence artificielle sur 70 tâches de recherche scientifique réparties dans 5 domaines, et permet de comparer leurs performances selon les spécialités étudiées. Les épreuves se déroulent dans un terminal isolé et combinent notamment le traitement de données, le raisonnement scientifique, l’utilisation d’outils et la validation des résultats. La règle est stricte : un test n’est réussi que si toutes les vérifications passent. Claude Opus 5.5 suit avec 61,9 % en xhigh, contre 59 % au niveau d’effort maximal ; son score atteint environ 24 % au niveau low. Un niveau de raisonnement plus élevé peut améliorer les performances, mais aussi alourdir la facture : pour Claude Opus 5.5, le coût moyen par tâche en xhigh est environ 5 fois celui du niveau low. Le niveau maximal ne garantit donc pas le meilleur score pour ce modèle, et les résultats varient aussi selon les domaines : les tâches de mathématiques sont mieux réussies, tandis que les sciences de la vie restent particulièrement difficiles pour la plupart des modèles de pointe. Enfin, les meilleurs modèles à poids ouverts cités, GLM-5.3 et DeepSeek V4.1 Flash, restent à plus de 50 points de pourcentage des meilleurs scores, ce qui souligne l’écart qui persiste avec les modèles les mieux classés.
Une erreur ?
Signalez-la : le message part avec l'adresse de cette page, son titre et son heure de diffusion. Une personne mise en cause peut aussi exercer son droit de réponse.
Signaler une erreurUn mot pour la rédaction ?
Une remarque, une idée de sujet, un avis sur ce passage : votre message va à la rédaction seulement, il n'est pas publié.