// CLUBIC — INTELLIGENZA ARTIFICIALE
Le nouveau Claude Sonnet 5.5 d'Anthropic bat Opus 5.5 sur un test de code, pour deux fois moins cher
Anthropic a dévoilé ce lundi Claude Sonnet 5.5, son nouveau modèle d'IA intermédiaire. Plus rapide et moins gourmand que Sonnet 5 pour un tarif inchangé, il se rapproche d'Opus 5.5 sur plusieurs tests, et arrive avec des protections renforcées.
L'entreprise Anthropic a présenté ce lundi 28 septembre Claude Sonnet 5.5, deuxième membre de la famille Claude 5.5 après Opus 5.5. Le nouveau modèle d'IA affiche des progrès marqués en programmation et en travail de bureau, tout en répondant plus vite et en réduisant le coût de chaque tâche. Il serait au moins 30 % plus rapide que Sonnet 5, et jusqu'à 30 % moins cher par tâche selon la firme californienne. Mais ce gain de puissance a aussi poussé l'entreprise à lui poser des garde-fous jusqu'ici réservés à ses modèles les plus costauds.
C'est en programmation, autrement dit dans l'écriture et la correction de code informatique, que Sonnet 5.5 creuse le plus l'écart avec son prédécesseur. Sur Terminal-Bench 4.0, un test où l'IA doit mener seule des tâches complexes dans la ligne de commande, cette fenêtre de texte où les développeurs tapent leurs instructions à l'ordinateur, Sonnet 5.5 atteint 70,6 % de réussite, contre un maigre 10,3 % pour Sonnet 5. Il dépasse même les 66,4 % d'Opus 5.5, le haut de gamme maison. Sur FrontierCode, qui juge si ses modifications de code pourraient être intégrées à un projet sans la moindre retouche humaine, il gagne dix points sur son prédécesseur à niveau de réflexion identique, tout en coûtant environ quinze fois moins cher par tâche. Chez Epic Games, il a jonglé avec des dizaines de milliers de lignes de code dédiées à l'architecture d'un jeu, et tenu la distance sur des tâches de plusieurs heures.
Concernant les tarifs, Anthropic ne touche à rien. Sur sa plateforme pour développeurs, Sonnet 5.5 coûte toujours 2 dollars par million de tokens envoyés au modèle (la question, les documents fournis) et 10 dollars par million de tokens qu'il rédige en réponse. Ces tokens, qui sont de petits morceaux de mots, servent d'unité de facturation, on le rappelle. Sonnet 5.5 est assez sobre, puisqu'il en consomme généralement bien moins pour le même travail, d'où une note jusqu'à 30 % plus légère par tâche, selon Anthropic. Il s'organise aussi mieux, en regroupant plus souvent plusieurs actions en une seule fois, ce qui lui permet de boucler le travail en moins d'étapes. Du côté de Slack, sans retoucher une seule consigne, il a fait mieux que Sonnet 5 sur la quasi-totalité des tests de l'assistant maison, en rédigeant environ 14 % de tokens en moins.
Sonnet 5.5 gagne aussi en nervosité, peut-on dire, dans le sens où le modèle écrit ses réponses au moins 30 % plus vite que Sonnet 5, ce qui en fait le Sonnet le plus rapide à ce jour. Dans les applications Claude, il fonctionne par défaut avec un niveau d'effort « moyen », un réglage ajustable qui privilégie soit des réponses rapides et économes, soit une réflexion plus longue et mieux vérifiée, qui consomme davantage sur son forfait. Il soigne aussi la présentation. Lors d'un test interne par exemple, Anthropic lui a confié les résultats trimestriels d'une entreprise cotée en Bourse, la transcription de sa conférence avec les investisseurs et un modèle de diaporama. Deux experts ont jugé son premier jet de dix diapositives prêt à être envoyé tel quel. Et, détail intéressant, c'est le premier Sonnet à terminer Pokémon version Rouge, le classique de la Game Boy, en se guidant uniquement grâce à des captures d'écran.
Faut-il pour autant délaisser Opus 5.5, le modèle le plus puissant de la famille ? On en doute. Sur GDPval-AA, un test qui soumet l'IA à des tâches concrètes issues de 44 métiers et de neuf grands secteurs d'activité, Sonnet 5.5 fait quasiment jeu égal avec lui, et devance Sonnet 5 d'environ 400 points au classement. Anthropic tempère et nous montre que pour les travaux complexes aux contours flous, qui demandent de faire preuve de jugement sur la durée, Opus 5.5 garde une nette avance. Mais Sonnet 5.5