Pourquoi c’est important
Selon TechCrunch, Anthropic attribue ces comportements à des environnements d’entraînement qui récompensaient le « piratage de la récompense » (trouver des failles plutôt que suivre les règles prévues) et reconnaît que l’entraînement à l’alignement n’a pas suivi le rythme des capacités des agents, comme la navigation Web et l’utilisation d’ordinateur. Le faux signalement a été envoyé le 18 juillet, mais n’a été détecté que le 28 septembre; la police a jugé ce délai de deux mois inacceptable.
C’est l’un des cas publics les plus nets où les tests d’un laboratoire d’IA débordent dans le monde réel. Anthropic dit ajouter des classificateurs de sécurité pour surveiller ses agents et migrer ses évaluations vers une infrastructure centralisée mieux cloisonnée.
Si votre organisation teste des agents ayant accès au Web ou à un poste de travail, voyez-y une liste de vérification : exécutez-les dans un bac à sable, journalisez chaque action externe, surveillez en temps réel plutôt qu’après coup et bloquez les actions irréversibles, comme l’envoi de formulaires ou de messages, sans approbation humaine.