// FRANDROID — INTELLIGENZA ARTIFICIALE
« Benchmaxxing » : pourquoi les résultats du surpuissant Gemini 4 font polémique face à GPT et Claude
Google n’avait plus sorti de modèle phare depuis Gemini 3.1 Pro, il y a plus de sept mois, et avait même abandonné en route un Gemini 3.5 Pro promis pour juin. Ce mercredi 30 septembre, Koray Kavukcuoglu, vice-président senior de Google DeepMind et architecte en chef de l’IA chez Google, a donc présenté Gemini 4 Argon comme la « prochaine ère d’intelligence frontière ».
Dans le tableau qui accompagne l’annonce, le modèle arrive premier sur 13 des 19 benchmarks (des séries de tests standardisés), devant GPT-6 Astra d’OpenAI et Claude Opus 5.5 d’Anthropic. Pourtant, les évaluateurs indépendants qui ont publié leurs mesures dans la foulée ne le placent pas tous en tête, et l’un d’eux le met seulement huitième.
Argon est conçu pour les tâches longues : développement logiciel, recherche juridique et financière, cyberdéfense. Sa principale nouveauté technique tient à la longueur de ses réponses, qui peuvent atteindre 1 million de tokens (les fragments de mots que le modèle manipule), contre 64 000 jusqu’ici, de quoi mener une grosse migration de code d’un seul tenant au lieu de la découper.
Les mesures indépendantes confirment tout de même le bond. Sur l’indice du cabinet Artificial Analysis, Argon gagne 23 points par rapport à Gemini 3.1 Pro Preview, qui plafonnait à 30 points ; selon le cabinet, Google revient ainsi parmi les trois premiers laboratoires d’IA.
Artificial Analysis est un cabinet indépendant qui fait passer la même batterie d’épreuves à tous les modèles. Son Intelligence Index agrège dix tests, du code dans un terminal au raisonnement scientifique, en passant par des tâches de bureau confiées à des agents (des IA qui enchaînent seules plusieurs actions).
Sur cet indice, Argon obtient 52,6 points à son réglage « High ». Claude Opus 5.5 est premier avec 57,6 points, devant Claude Sonnet 5.5 (56) et GPT-6 Astra (52,7). En clair, Argon fait jeu égal avec le modèle d’OpenAI mais reste à cinq points de celui d’Anthropic, et se classe huitième au général, les sept premières places revenant à différents réglages des modèles d’Anthropic et à GPT-6 Astra.
Pour aller plus loin
GPT-6, Fable 5.1 : comment lire les benchmarks de Claude et GPT sans se faire avoir
Le détail des épreuves va dans le même sens. Sur GDPval-AA, qui reproduit des tâches professionnelles issues de 44 métiers, Argon obtient un score Elo (une note de classement héritée des échecs) de 1 611, devant Astra (1 542) mais loin d’Opus 5.5 (1 846). Sur Humanity’s Last Exam, un examen de connaissances et de raisonnement réputé très difficile, il fait 57,1 %, contre 54,7 % pour Astra et 61,4 % pour Opus 5.5.
Comment Google arrive-t-il alors à treize premières places ? Déjà, c’est lui qui choisit les dix-neuf épreuves de son tableau. Surtout, il n’a pas toujours mesuré les concurrents lui-même : sur Terminal-Bench 4.0, comme l’a relevé Trending Topics, Google affiche pour Opus 5.5 les 66,4 % annoncés par Anthropic, alors qu’Artificial Analysis ne mesure que 59,6 %. Le score d’Argon, en revanche, colle à la mesure indépendante, avec 57,4 % chez Google et 57,1 % chez Artificial Analysis.
Certaines victoires de Google restent nettes sur le papier. Sur DeepSWE v1.1, qui évalue des tâches de développement longues tirées de projets réels, Argon affiche 77,9 %, contre 74,2 % pour Opus 5.5 et 74,1 % pour Astra. Pour autant, ce chiffre vient du tableau de Google lui-même.