Claude Code détecte 89 % des actions dangereuses : Anthropic active le mode automatique le 14 août
Anthropic bascule Claude Code en mode automatique par défaut à partir du 14 août, pour les comptes Pro, Max et Team. L'outil de programmation assisté par IA, piloté chez Anthropic par Boris Cherny, cessera de réclamer une validation à chaque étape. Seules les actions jugées irréversibles ou destructrices déclenchent encore une demande d'approbation. Anthropic justifie ce changement par un chiffre : le mode automatique repère 89 % des actions dangereuses, contre 13,6 % pour la révision humaine.
Une fatigue d'approbation qui coûte cher
Anthropic a testé les deux méthodes auprès de 1 053 testeurs rémunérés. La révision manuelle échoue largement : les utilisateurs approuvent 97 % des demandes de permission, quel que soit le risque réel. Anthropic parle de fatigue d'approbation pour désigner ce réflexe qui use la vigilance humaine. Le mode automatique, testé en version bêta depuis mars, s'appuie sur des règles fixes plutôt que sur un clic systématique.
« L'équipe et moi utilisons exclusivement le mode automatique, et ce depuis de nombreux mois. Je ne pourrais pas imaginer revenir aux invites d'autorisation ! » — Boris Cherny, responsable de Claude Code chez Anthropic
Des filets de sécurité en plus
Le passage au tout-automatique s'accompagne de nouvelles protections. Anthropic détaille ces ajouts dans son annonce officielle.
- Filtrage des injections d'invite
- Règles de refus strictes personnalisables
- Classificateur de sécurité basé sur un modèle
- Deux couches de défense, une à l'entrée et une à la décision
Ces garde-fous visent surtout à bloquer la fuite de données, un risque accru quand l'IA agit sans validation humaine à chaque pas.
Entreprises et API pour l'instant à l'écart
Le changement ne touche pas tous les usages. Chez plusieurs offres professionnelles, le mode automatique reste optionnel, pour l'instant.
- Claude Enterprise
- API Claude
- Anthropic Platform
- Amazon Bedrock
- Google Cloud's Agent Platform
- Microsoft Foundry
Face à Intent Security
D'autres acteurs de la sécurité des agents IA suivent une logique différente. Intent Security, un cadre spécialisé, applique des limites définies par le propriétaire de l'application plutôt que des règles fixes. Anthropic mise sur des règles personnalisables, propres à chaque environnement de codage, jugées plus adaptées que le filtrage par mots-clés ou les listes blanches statiques face aux injections d'invite.
Reste à voir ce que cela donnera à l'usage, une fois le mode automatique généralisé aux comptes Pro, Max et Team le 14 août.