Claude Sonnet 5.5 : l'IA d'Anthropic qui mise sur l'efficacité (et finit Pokémon Rouge)

La Terre vue à travers le hublot d'un vaisseau spatial, sous le titre Claude Sonnet 5.5 et l'étincelle orange de Claude
Sommaire
  1. L’efficacité avant la surenchère
  2. Plus fort qu’Opus 5.5 en code
  3. La sécurité
  4. Mon avis

Moins d'une semaine après le lancement de son surpuissant Opus 5.5, Anthropic dégaine déjà Claude Sonnet 5.5. En pleine guerre des annonces face aux tout nouveaux GPT-6 Sol et GPT-6 Luna d'OpenAI, sortis le 22 septembre, la firme californienne propose un modèle intermédiaire redoutablement efficace. Son credo ? Ne pas chercher l'esbroufe, mais optimiser le quotidien.

C'est un rythme effréné qui secoue la planète tech en cette fin septembre 2026. Ce lundi 28 septembre, Anthropic a présenté Claude Sonnet 5.5, la nouvelle itération de son modèle d'intelligence artificielle taillé pour les tâches quotidiennes. Plutôt que de promettre une révolution technologique démesurée, l'entreprise assume une approche pragmatique : rendre l'IA plus rapide, moins chère et plus fiable.

L'efficacité avant la surenchère

L'honnêteté est rare dans la course effrénée à l'intelligence artificielle, mais Anthropic joue cartes sur table. La firme reconnaît volontiers que ce nouveau modèle « ne fait pas progresser la frontière des capacités » de ses IA. Le véritable gain se trouve sous le capot, au niveau de l'optimisation pure.

Côté tarif, rien ne bouge : Sonnet 5.5 coûte toujours 2 $ par million de tokens en entrée et 10 $ en sortie, soit la moitié du prix d'Opus 5.5. Le gain se joue ailleurs, sur la facture de chaque tâche. Le modèle consomme en effet beaucoup moins de tokens et regroupe ses appels d'outils, si bien qu'Anthropic annonce jusqu'à 30 % de coût en moins par tâche accomplie. Le gestionnaire d'actifs Balyasny en donne un exemple sur 2 441 tâches financières : environ 121 000 tokens par réponse, contre 497 000 pour Sonnet 5, avec un meilleur score.

Encore faut-il régler le modèle correctement. Anthropic propose un réglage de l'effort sur cinq niveaux, de faible à maximal. Artificial Analysis, une société indépendante qui évalue et compare les modèles d'IA, classe Sonnet 5.5 deuxième de son indice d'intelligence, juste derrière Opus 5.5, et l'a testé à l'effort maximal. Le modèle y produit près de 193 000 tokens de sortie par tâche en moyenne, le volume le plus élevé que cette société ait jamais mesuré, tous modèles confondus. Chaque tâche coûte alors 7,60 $, environ 50 % de plus qu'avec Sonnet 5.

Aux niveaux faible et moyen, le calcul s'inverse : selon Anthropic, Sonnet 5.5 dépasse sur plusieurs tests le meilleur score de son prédécesseur pour environ un dixième du coût par tâche. Par défaut, ce réglage est placé sur « moyen » dans les applications Claude et dans Claude Code, mais sur « élevé » dans l'API.

Il surpasse Opus 5.5 sur un test de code (et excelle sur Game Boy)

Ne vous fiez pas à son positionnement « milieu de gamme » : Sonnet 5.5 a du répondant. Sur les benchmarks publiés par Anthropic, il talonne de très près son grand frère. Sur le test GDPval-AA, mesurant le travail réel dans 44 métiers, il n'échoue qu'à deux petits points d'Opus 5.5.

Mieux encore, il parvient à le dépasser sur un test spécifique de codage agentique. Sur le Terminal-Bench 4.0, Sonnet 5.5 atteint le score faramineux de 70,6 %, contre 66,4 % pour Opus 5.5 (au réglage très élevé) et seulement 10,3 % pour l'ancien Sonnet 5. Cette prouesse confirme l'ADN de la gamme Sonnet, historiquement plébiscitée par les programmeurs.

Ce bond en performance s'illustre déjà concrètement en entreprise. Chez Slack, sans changer une seule consigne, le modèle offre de meilleurs résultats que Sonnet 5 sur presque toutes les évaluations, tout en économisant environ 14 % de tokens de sortie. Chez Zendesk, testé sur des centaines de demandes réelles, le modèle a traité les tickets d'assistance 20 % plus vite, avec moins de mauvaises décisions. Atlassian rapporte que ses agents Rovo sont jusqu'à 30 % plus rapides, tandis que Box mesure une vitesse multipliée par 2,4, soulignant que l'IA prend désormais le soin de revérifier les chiffres dans les documents sources, repérant des erreurs que Sonnet 5 laissait passer. Pour parachever le tableau professionnel, deux experts ont d'ailleurs jugé qu'une présentation de dix diapositives générée au premier jet par le modèle était suffisamment qualitative pour être envoyée telle quelle, sans la moindre retouche humaine.

Mais l'anecdote qui fascine le plus la communauté tech vient du monde vidéoludique. Claude Sonnet 5.5 est devenu le premier Sonnet à terminer intégralement Pokémon Version Rouge, le jeu classique de la Game Boy, en se guidant de manière autonome uniquement à partir de captures d'écran. Au-delà du clin d'œil rétro, cette démonstration ludique illustre ce qu'Anthropic met en avant : sa compréhension des images et sa tenue sur les tâches longues.

Un élève modèle dans son « bac à sable »

La puissance brute n'est rien sans le contrôle. Face aux garde-fous toujours plus stricts exigés par l'industrie, Sonnet 5.5 s'impose comme un élève particulièrement discipliné. C'est le tout premier Sonnet à être lancé avec les protections de cybersécurité jusqu'ici réservées aux modèles Opus. L'entreprise juge en effet ses capacités cyber comparables à celles d'Opus 5. Si la correction de bugs courante reste tout à fait possible, les demandes à haut risque basculent désormais de façon visible vers Sonnet 5 pour éviter tout dérapage.

C'est également le premier Sonnet doté de filtres actifs contre la distillation, cette technique où des milliers de faux comptes aspirent les capacités d'une IA. Seuls les garde-fous concernant la biologie restent identiques à la génération précédente. Lors d'un audit comportemental automatisé portant sur environ 1 850 scénarios, Sonnet 5.5 a égalé ou dépassé Sonnet 5 sur la plupart des critères. Lors de tests d'évaluation internes, il s'est même révélé être le modèle le moins enclin à sonder les limites de son propre environnement de test (son fameux bac à sable). Sans oublier que, tout comme Opus 5.5 et Sonnet 5, il est proposé avec la rassurante option zéro rétention des données.

Côté disponibilité, la bascule est déjà opérée. Depuis ce 28 septembre, le modèle est disponible sur l'API, Amazon Web Services, Google Cloud, Microsoft Azure, et arrive progressivement dans les offres payantes de GitHub Copilot. Les développeurs devront toutefois se méfier lors de la migration : ceux qui utilisaient Sonnet réflexion coupée doivent passer au nouveau paramètre « between_tools ». Anthropic détaille d'ailleurs ces changements dans son guide de migration.

Avec ce lancement réussi, Anthropic consolide intelligemment son offre face à la déferlante d'OpenAI. La famille Claude 5.5 accueillera d'ailleurs d'ici quelques semaines le petit dernier, Claude Haiku 5.5, pensé pour traiter de gros volumes à moindre coût.

Mon avis

Il ne faut pas s'y tromper : l'absence de bond technologique spectaculaire n'est pas un aveu de faiblesse, c'est un choix stratégique d'une redoutable lucidité.

Nous sommes arrivés à un point d'inflexion où la course aux benchmarks théoriques commence à fatiguer l'industrie. Empiler des milliards de paramètres supplémentaires pour grappiller deux points sur un test académique ne résout plus les vrais défis du terrain. Ce dont le secteur a cruellement besoin aujourd'hui, ce sont des modèles capables de tenir la cadence dans des chaînes de production réelles sans faire exploser la facture d'API ni saturer la latence. À ce jeu, Sonnet 5.5 tape exactement là où ça fait mal.

Concrètement, les entreprises disposent désormais d'un modèle qui talonne Opus 5.5, à deux points sur les tâches professionnelles du test GDPval-AA, pour moitié prix. Le fait qu'il dépasse Opus 5.5 sur un test de code agentique n'est pas un détail : c'est la preuve qu'un modèle deux fois moins cher peut battre le haut de gamme sur certaines tâches de code. Pour faire tourner des agents autonomes capables d'exécuter des boucles de feedback et d'auto-corriger des scripts, la réactivité et la cohérence logique priment sur la simple érudition.

Quant à l'anecdote de Pokémon Rouge, elle dépasse largement le cadre du clin d'œil nostalgique. Elle démontre que la compréhension des images et la tenue sur les tâches longues commencent enfin à sortir du laboratoire pour devenir viables sur des interfaces dynamiques et non structurées.

Reste un piège sur la facture : le réglage le plus élevé n'est pas forcément le plus performant. Sur le test de code FrontierCode publié par Anthropic, Sonnet 5.5 obtient 52,1 % au réglage très élevé pour 1,59 $ par tâche, mais seulement 46,2 % au réglage maximal, pour 20,78 $, soit treize fois plus cher pour un moins bon résultat. Le bon réglage se choisit donc tâche par tâche, en le mesurant sur vos propres usages. Une mise à niveau sobre, chirurgicale et diablement efficace.

Sources

Contactez-nous

Envoyer un message