Aller au contenu principal

GPT-6 Astra d'OpenAI atteint 100% sur ExploitBench et 99,9% sur ARC-AGI 3 : le modèle est disponible

Publié par le 3 min de lecture748 vues0 likes
Partager
Ajoutez-nous à vos favoris

Des benchmarks qui n'ont pas de précédent

OpenAI vient de lancer GPT-6 Astra. Le modèle affiche 100% sur ExploitBench, le benchmark de référence en cybersécurité offensive, 99,9% sur ARC-AGI 3 et 98% sur FrontierMath Tier 4. Trois scores qui n'ont, à ce jour, aucun équivalent publié par un concurrent.

Ces résultats méritent d'être lus un par un. Un score de 100% sur ExploitBench signifie que le modèle répond correctement à la totalité des épreuves conçues pour mesurer la capacité à identifier et exploiter des vulnérabilités dans des systèmes informatiques. Ce n'est pas un score de performance générale : c'est un score sur un terrain spécifiquement construit pour simuler des scénarios d'attaque offensive. Le 99,9% sur ARC-AGI 3 porte sur un registre différent, celui du raisonnement abstrait et de la généralisation, un domaine où les modèles précédents butaient régulièrement sur des tâches que les humains résolvent sans effort particulier. Le 98% sur FrontierMath Tier 4 concerne quant à lui des problèmes mathématiques de niveau avancé, conçus pour résister aux modèles existants. Pris ensemble, ces trois chiffres dessinent un profil de modèle qui ne domine pas un seul domaine mais plusieurs simultanément.

OpenAI présente GPT-6 Astra comme le meilleur modèle au monde sur cinq domaines : pilotage d'un ordinateur, travail professionnel, science, code et cybersécurité. Ce dernier point mérite attention. Un modèle capable de scorer parfaitement sur ExploitBench dispose, par définition, d'une capacité à identifier et exploiter des vulnérabilités à un niveau que peu d'équipes de sécurité humaines atteignent. Pour les équipes qui gèrent des actifs numériques, c'est un signal direct sur l'évolution du paysage des menaces : notre guide sécurité crypto couvre les vecteurs d'attaque à surveiller dans ce contexte.

La combinaison du pilotage d'ordinateur et de la cybersécurité offensive est particulièrement notable. Un modèle capable d'agir directement sur un système informatique tout en maîtrisant les techniques d'exploitation de vulnérabilités représente une configuration nouvelle dans le paysage des outils disponibles, aussi bien pour les défenseurs que pour les attaquants potentiels.

Un retard assumé au nom de la sûreté

La sortie n'était pas prévue à cette date. OpenAI reconnaît avoir repoussé le lancement pour se donner le temps d'atteindre ses propres standards de sûreté et d'alignement, qu'il juge proportionnels au niveau de capacité du modèle. C'est rare : un éditeur qui retarde publiquement un produit pour des raisons de sécurité et non pour des raisons commerciales.

Ce positionnement tranche avec la course aux annonces qui a dominé le secteur ces deux dernières années. Que ce discours soit entièrement sincère ou partiellement stratégique, il place OpenAI dans une posture de régulateur de facto de sa propre technologie, à un moment où les régulateurs institutionnels, en Europe comme aux États-Unis, cherchent encore leurs outils. La logique implicite est claire : plus le modèle est capable, plus les standards de sûreté requis avant déploiement doivent être élevés. OpenAI affirme avoir appliqué ce principe à la lettre pour GPT-6 Astra, en acceptant un délai de mise sur le marché que peu d'entreprises dans un secteur aussi compétitif auraient assumé publiquement.

Les marchés de prédiction suivaient de près la date de sortie d'Astra depuis plusieurs semaines, avec des questions ouvertes portant sur la semaine exacte de lancement et sur la date limite de disponibilité du modèle. La lecture de marché associée à cette annonce est haussière pour OpenAI. La question de savoir quel acteur détiendrait le meilleur modèle fin 2026 reste ouverte côté compétition, mais OpenAI vient de poser une barre très haute sur l'ensemble des dimensions qu'il a choisies pour se mesurer.

Actifs corrélés

Suivez le cours et nos analyses pour chaque actif lié.

Actifs impactés

Marchés de prédiction

Données via Hyperview

À lire ensuite