Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Claude Code Opus 5 en mode automatique : un chercheur fait exécuter du code malveillant jusqu'à 80 % du temps

3 min de lecture · Hacker News (frontpage) · 31 août 2026
Vérification : Contexte manquant L'information est exacte, mais il lui manque un élément sans lequel on la comprend mal. « Anthropic affirme avoir résolu l'injection de prompt : son mode automatique (Auto Mode) de Claude Code affichait 0,00 % de réussite pour ce type d'attaque. » Voir la publication d'origine (ouvre un nouvel onglet)

D'après Billet original - Johann Rehberger (wunderwuzzi), Embrace The Red, relayé par Hacker News (frontpage)

Claude Code Opus 5 en mode automatique : un chercheur fait exécuter du code malveillant jusqu'à 80 % du temps

Photo : FlyD, Unsplash

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Publié le 26 août 2026, le piège commence par un site que l'agent explore pour répondre à la demande, menant vers une archive avec un fichier Python du même nom qu'un module standard (struct.py) : ce faux fichier prend la place du vrai et s'exécute à l'import du module base64.
  • Sur cinq essais par variante, le taux de réussite a atteint 60 à 80 % - le chercheur précise que sa chaîne d'attaque ne faisait PAS partie des 72 scénarios que l'évaluation commandée par Anthropic (Trajectory Labs) avait testés dix fois chacun, à 0,00 % de réussite.
  • Le mode automatique (Auto Mode) - qui remplace les demandes d'approbation humaine par un classificateur de sécurité - est devenu le mode de départ par défaut de Claude Code depuis la mi-août 2026.
  • Dans certains essais, une fois l'infection détectée, le mode automatique a lui-même bloqué la commande destinée à arrêter le processus malveillant qu'il avait laissé s'exécuter.
  • Anthropic a fermé le signalement du chercheur avec la mention « Informative » : à ses yeux, le mode automatique est une fonction de confort appuyée par un classificateur, pas une garantie de sécurité.

Pourquoi ça compte

Le mode automatique est désormais l'expérience par défaut de Claude Code, l'agent de programmation d'Anthropic : il agit sans demander d'approbation à chaque étape. L'écart entre le 0,00 % annoncé et le 60-80 % démontré importe surtout pour quiconque laisse cet agent lire du contenu web ou des fichiers non fiables avec un accès à des données sensibles - le classificateur se mesure sur un ensemble de scénarios connus, pas contre une attaque inédite.

Chiffre-clé

60 à 80 % : le taux de réussite obtenu par le chercheur sur de petits échantillons (trois à cinq essais par variante), contre 0,00 % rapporté par l'évaluation commandée par Anthropic (72 scénarios x 10 essais, source : embracethered.com, 26 août 2026).

Citation

« we just cannot demonstrate prompt injection anymore. » Boris Cherny, responsable de l'équipe Claude Code chez Anthropic

Action concrète

Si vous utilisez Claude Code (ou un agent de codage similaire) en mode automatique sur du contenu web ou des fichiers non fiables, ne l'exécutez pas sur un poste ayant accès à vos clés SSH, identifiants infonuagiques ou dossiers personnels : lancez-le plutôt dans un conteneur ou une machine virtuelle isolée, avec un accès réseau restreint.

Repères datés

Fondée sur la source originale

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !