Ce qu’Anthropic annonce

Selon Anthropic, Claude Sonnet 5 représente une amélioration substantielle par rapport à Sonnet 4.6 en raisonnement, utilisation d’outils, programmation et travail de connaissance, avec des performances « proches de celles d’Opus 4.8, à un prix inférieur ». L’éditeur le décrit comme son Sonnet le plus agentique : il peut « faire des plans, utiliser des outils comme les navigateurs et les terminaux, et travailler de manière autonome », et, avec un effort de raisonnement plus élevé, égaler Opus 4.8 sur certaines tâches.

Côté disponibilité, Sonnet 5 devient le modèle par défaut des offres Free et Pro, reste accessible aux offres Max, Team et Enterprise, et s’appelle claude-sonnet-5 dans l’API. Il est proposé sur la plateforme d’Anthropic, sur AWS et sur Microsoft Foundry, Google Vertex étant annoncé « bientôt ». Le journal des modifications de GitHub indique sa disponibilité générale dans GitHub Copilot dès le 30 juin.

« Agentique », concrètement

Un modèle agentique ne se contente pas de répondre : il planifie une suite d’étapes, utilise des outils (un navigateur, un terminal, une API), observe le résultat et recommence jusqu’à atteindre l’objectif. Pour une entreprise, cela change la nature de ce qu’on lui confie : non plus « rédige-moi une réponse », mais « trouve les factures en retard, prépare les relances et dis-moi lesquelles envoyer ».

Cela change aussi le risque. Un modèle qui exécute des commandes dans un terminal peut supprimer un fichier ; un modèle qui navigue peut lire une page piégée. La capacité à agir doit donc s’accompagner d’un cadre : environnement isolé, droits limités, validation humaine des actions irréversibles et journal de ce qui a été fait.

Un choix de conception à noter : des capacités cyber volontairement limitées

Anthropic indique que Sonnet 5 présente un taux de comportements indésirables plus faible que Sonnet 4.6 et une capacité « bien plus faible » à réaliser des tâches de cybersécurité que ses modèles Opus du moment, avec des protections activées par défaut. Autrement dit, l’éditeur a cherché à rendre le modèle très bon pour le travail courant sans en faire un outil offensif facilement accessible.

Pour un utilisateur, la conséquence pratique est simple : un modèle moins performant sur certaines tâches de sécurité n’est pas un défaut si votre usage est la gestion, la rédaction ou le développement courant. Si, à l’inverse, votre métier est l’audit de sécurité, il faut le tester spécifiquement sur ce type de tâche avant de l’adopter.

Exemple : une tâche agentique bien cadrée

Exemple concret, que l’on peut confier à un modèle agentique sur un dépôt de code : « mettre à jour les dépendances du site vitrine et vérifier que rien ne casse ». Bien cadrée, la mission précise :

  1. Le périmètre : seulement les dépendances signalées comme obsolètes, pas de refonte ni de changement de version majeure sans accord.
  2. L’environnement : une copie du dépôt sur une branche dédiée, sans accès aux secrets de production.
  3. Les vérifications : les tests existants, le build, puis un contrôle visuel des pages principales.
  4. Les conditions d’arrêt : s’arrêter et demander dès qu’un test échoue deux fois de suite, ou qu’une modification touche plus de fichiers que prévu.
  5. Le rapport : ce qui a été fait, les sorties réelles des tests, ce qui n’a pas été vérifié.

Ce cadrage prend dix minutes à écrire. Il transforme un agent capable de tout en un agent qui fait une chose, la fait bien et le prouve. Sans lui, un modèle très capable peut produire un résultat impressionnant et difficile à relire.

L’adopter sans risque : la démarche AXDIA

  1. Commencer par un environnement de test : un dépôt copié, un compte de démonstration, des données fictives.
  2. Donner les outils un par un, en commençant par la lecture seule ; l’écriture et l’exécution viennent ensuite, quand le comportement est connu.
  3. Écrire la mission avec les garde-fous : périmètre, interdits, tests à faire passer, retour arrière. C’est ce que produit Prompt OS.
  4. Mesurer sur dix à vingt tâches réelles, puis comparer avec votre modèle actuel ; le moins cher qui atteint votre niveau de qualité est souvent le bon choix (nous détaillons la méthode dans notre article sur GPT-5.6).
  5. Garder la revue humaine pour tout ce qui part chez un client ou en production.

Conclusion

Avec Sonnet 5, la capacité d’agir n’est plus réservée aux modèles les plus chers. C’est une bonne nouvelle pour les petites structures, à une condition : traiter un modèle agentique comme un nouveau collaborateur à qui l’on donne des droits progressivement, et non comme un simple outil de rédaction.