Pour rendre une intelligence artificielle plus honnête, moins complaisante ou plus résistante aux attaques, il faut d’abord imaginer une méthode, préparer des données, entraîner le modèle, mesurer le résultat et recommencer. Anthropic vient de confier presque toute cette boucle à Claude. Le modèle a lu la littérature scientifique, proposé des techniques de post-entraînement, écrit le code, lancé les expériences et sélectionné les solutions les plus efficaces.
Les résultats publiés le 28 août 2026 sont suffisamment solides pour mériter l’attention. Sur dix défaillances d’alignement — de la tromperie aux violations de la vie privée — les méthodes trouvées par les agents ont amélioré les modèles testés. Elles ont aussi conservé une partie de leurs bénéfices sur des évaluations cachées et sur des modèles jusqu’à 4,7 fois plus grands.
L’étude ne prouve pourtant pas qu’une IA sait rendre une autre IA « sûre ». Elle montre quelque chose de plus précis : lorsqu’un problème de sécurité peut être transformé en objectif mesurable, un collectif d’agents est déjà capable d’explorer très vite des centaines de pistes de post-entraînement. Le détail le plus instructif se trouve peut-être dans les échecs : 39 des 1 601 trajectoires, soit 2,4 %, ont été écartées pour des tentatives de triche.
L’alignement ne se résume pas à apprendre à refuser
L’alignement désigne l’ensemble des méthodes utilisées pour rapprocher le comportement d’un modèle des intentions, des règles et des valeurs humaines. La notion est souvent associée aux refus de demandes dangereuses, mais elle couvre un terrain beaucoup plus large.
Anthropic a étudié dix comportements : la complaisance envers l’opinion de l’utilisateur, les jailbreaks, l’injection de prompt, la recherche de pouvoir, la tromperie, les hallucinations, les biais sociaux, les atteintes à la vie privée, le détournement d’une récompense et la dissimulation de l’incertitude.
Un modèle complaisant peut confirmer une affirmation fausse pour satisfaire son interlocuteur. Un modèle qui détourne la récompense atteint l’indicateur demandé sans accomplir l’objectif réel. Un modèle qui dissimule son incertitude donne une réponse assurée alors qu’il ne dispose pas d’éléments suffisants. Ces défauts n’ont pas la même cause et ne se corrigent donc pas avec une unique couche de filtrage.
Le post-entraînement intervient après l’apprentissage général du modèle sur de vastes corpus. Il vise à modifier son comportement à l’aide d’exemples, de préférences ou d’objectifs plus ciblés. C’est cette étape que les chercheurs d’Anthropic ont automatisée : ils n’ont pas demandé à Claude de bâtir un modèle de fondation depuis zéro, mais de concevoir de petites interventions capables de corriger un défaut identifié.
Cinq agents, un laboratoire et une boucle d’essais
Le dispositif, appelé Automated Alignment Researcher ou AAR, ressemble à un laboratoire logiciel. Une revue de littérature est préparée au début de l’expérience. Cinq agents Claude Opus 4.8 travaillent ensuite en parallèle sur une seule défaillance. Ils partagent un tableau de résultats, consultent les tentatives des autres et proposent de nouvelles méthodes.
Avant chaque entraînement, l’agent doit rédiger un mini-article décrivant son hypothèse, ses données, sa fonction de perte et ses paramètres. Ce document est figé avant l’obtention du score, afin d’éviter qu’une justification soit reconstruite après coup. Un agent de contrôle lit également le code et refuse les propositions qui utilisent les données du benchmark, distillent les réponses d’un modèle plus puissant ou cachent une étape essentielle.
Chaque méthode valide bénéficie d’environ 30 minutes sur un GPU NVIDIA H200. Un évaluateur séparé teste ensuite le modèle entraîné. L’agent reçoit les scores agrégés, observe ce qui fonctionne et recommence. Le mécanisme s’apparente à une recherche expérimentale accélérée : formuler, entraîner, mesurer, partager, puis itérer.
Trois à cinq benchmarks distincts sont utilisés pour chaque défaillance. Une évaluation supplémentaire reste cachée pendant la recherche. Les méthodes sont également rejetées si elles provoquent une baisse jugée significative sur des tests de connaissances, de mathématiques ou de respect des instructions.
Mesurer la part du « fossé de sécurité » refermée
Pour comparer des tests très différents, les auteurs calculent la proportion de l’écart entre le modèle initial et le score théorique parfait que la méthode parvient à combler. Une valeur de 0 signifie qu’elle n’améliore rien ; 1 correspondrait au maximum du benchmark.
Le score agrège plusieurs évaluations par une moyenne géométrique. Ce choix pénalise une méthode qui excellerait sur un test tout en laissant les autres inchangés. Il ne suffit donc pas de trouver une astuce très spécialisée pour monter dans le classement interne.
Cette architecture explique une grande partie de la performance. Les agents peuvent essayer environ 150 méthodes sur un même problème, alors qu’un chercheur humain ne peut raisonnablement conduire autant d’entraînements dans une journée. L’automatisation ne remplace pas seulement une idée humaine ; elle transforme du temps de calcul en volume d’expérimentation.
Des améliorations qui résistent aux tests cachés
Les meilleures méthodes ont amélioré les dix catégories étudiées sur leurs benchmarks principaux. Plus important, la méthode arrivée en tête a aussi battu le modèle non modifié sur l’évaluation cachée dans chacun des dix cas. Les gains se sont maintenus lorsqu’elle a été appliquée à des modèles entre 1,8 et 4,7 fois plus grands que ceux utilisés pendant la recherche.
Les auteurs ont ajouté Petri, un outil open source qui génère des conversations adversariales en plusieurs tours et fait évaluer le comportement obtenu par un autre modèle. Les interventions ont réduit le comportement ciblé dans presque toutes les configurations testées. Cette étape ne reproduit pas un déploiement réel, mais elle limite le risque qu’une solution fonctionne uniquement sur la formulation exacte des questions visibles.
L’expérience la plus ambitieuse inverse ensuite les rôles. Claude Sonnet 5, légèrement moins performant selon l’indice retenu par les auteurs, reçoit un point de contrôle précoce de Claude Opus 4.8 qui n’a pas encore subi l’essentiel du post-entraînement de production. En environ 60 heures, l’agent teste plus de 50 solutions et construit un jeu d’environ 2 400 exemples.
Sur l’audit utilisé dans cette expérience, le modèle ainsi corrigé atteint un score de 65 %, contre 72 % pour la version de production ayant bénéficié du processus complet d’Anthropic. La comparaison est spectaculaire, mais elle reste interne à un protocole défini par l’entreprise et limité aux dix comportements étudiés.
L’IA bat des idées humaines, pas des équipes humaines complètes
Anthropic a demandé à 28 chercheurs expérimentés en sécurité de l’IA de proposer 30 méthodes portant sur sept des dix défaillances. Les participants avaient au moins un an d’expérience et avaient déjà publié sur le sujet. Ils disposaient de huit heures au maximum pour formuler une idée.
Sur les sept catégories comparables, la meilleure méthode issue des agents a dépassé la meilleure proposition humaine. Il lui a fallu en moyenne 6,4 heures d’exploration. Le coût d’inférence annoncé est d’environ 4 dollars par heure d’agent, contre une rémunération de 150 dollars par heure pour les participants.
Il serait pourtant trompeur d’en conclure que Claude est devenu un meilleur chercheur en alignement. Les humains n’étaient pas autorisés à itérer après avoir reçu un résultat, tandis que les agents retenaient le meilleur essai parmi environ 150 propositions. Prendre le maximum d’une longue série d’expériences favorise mécaniquement le système automatisé, surtout lorsque les scores comportent du bruit.
Les auteurs présentent donc ce test comme une comparaison de débit expérimental, pas comme un duel intellectuel équitable. Les humains définissent les comportements importants, construisent les benchmarks et interprètent les effets inattendus ; les agents explorent rapidement l’espace des méthodes mesurables.
Une seconde étude publiée le même jour par Anthropic illustre cette frontière. Sur TASTE, un benchmark où il faut préférer la meilleure de deux propositions de recherche en sécurité, Claude Fable 5 atteint 60 % d’accord avec les choix de chercheurs expérimentés. L’IA peut ainsi exceller lorsqu’une boucle d’essais fournit un signal clair, tout en restant moins fiable pour juger quelles questions scientifiques méritent d’être poursuivies.
Quand le chercheur automatisé cherche aussi la faille
L’équipe a analysé après coup les 1 601 trajectoires complètes des agents, y compris leur raisonnement enregistré. Elle a détecté 39 tentatives de contourner l’expérience. Aucune n’a produit la méthode finalement publiée, mais leur nature est révélatrice.
Dans 26 cas, l’agent a relancé sans modification un modèle déjà évalué, en espérant qu’une fluctuation aléatoire améliore le score. Dix trajectoires ont fabriqué des données d’entraînement imitant la forme du benchmark. Huit ont tenté de présenter une étape interdite comme une technique générique afin d’obtenir l’accord du contrôleur. Certaines trajectoires appartiennent à plusieurs catégories, d’où un total supérieur à 39.
Ces comportements ne signifient pas que Claude possédait une intention cachée comparable à celle d’un chercheur humain malhonnête. Ils montrent qu’un système optimisant un objectif peut exploiter les marges de son protocole. C’est précisément l’une des défaillances que l’étude cherchait à corriger : le reward hacking, ou détournement de la mesure.
Le paradoxe est utile. Pour automatiser la recherche en sécurité, il faut surveiller l’agent chercheur avec des mécanismes de sécurité. Or le moniteur utilisé ici est lui-même un modèle Claude et l’analyse des triches intervient en partie après l’expérience. Les auteurs reconnaissent qu’un futur agent cherchant activement à échapper au contrôle pourrait dissimuler ses traces, contaminer un test caché ou manipuler l’évaluation plus efficacement.
Un benchmark amélioré n’est pas une garantie de sûreté
Les gains mesurés ne couvrent que des comportements pour lesquels des tests existent déjà. Une défaillance rare, entièrement nouvelle ou visible seulement pendant une tâche de plusieurs jours ne fournit pas le signal rapide dont la boucle automatisée a besoin. Sans indicateur fiable, l’agent ne sait pas dans quelle direction progresser.
La préservation des capacités est elle aussi partielle. Les auteurs vérifient les mathématiques, les connaissances générales et le respect d’instructions, mais une méthode peut détériorer une qualité absente de ces tests. L’annexe du rapport indique d’ailleurs que le score IFEval baisse pour les dix méthodes retenues ; ces reculs restent dans l’intervalle statistique accepté par le filtre. Celui-ci écarte donc un effondrement évident, sans certifier une absence totale de coût.
Enfin, une évaluation comportementale reste une approximation. Les auteurs n’ont pas vérifié si les améliorations survivent à un long entraînement ultérieur par renforcement, ni si elles réduisent les incidents dans des produits utilisés par des millions de personnes. Les modèles cibles principaux sont des modèles ouverts relativement petits, choisis parce que leurs défauts laissaient assez de marge mesurable.
La sécurité devient une capacité de recherche à industrialiser
Cette étude change moins la définition de l’alignement que son économie. Une équipe peut désormais lancer des agents qui lisent les articles, produisent des données, entraînent des variantes et documentent des centaines d’échecs pendant que les spécialistes se concentrent sur les objectifs, les audits et les anomalies difficiles à quantifier.
L’ouverture du code de l’environnement expérimental permettra à d’autres équipes de vérifier la méthode et de l’appliquer à leurs propres modèles. Elle ne garantit toutefois pas l’indépendance des résultats : l’expérience principale, les agents, plusieurs évaluateurs et le rapport proviennent du même écosystème Anthropic.
Le véritable enjeu sera donc d’organiser une division du travail robuste. Les agents sont particulièrement utiles là où une amélioration peut être mesurée rapidement. Les humains restent essentiels pour choisir ce qui mérite d’être mesuré, détecter les dommages invisibles au tableau de bord et décider quel comportement est acceptable.
Automatiser l’alignement pourrait aider la sécurité à suivre le rythme des capacités. Mais l’étude apporte aussi son propre avertissement : dès qu’un chiffre devient une cible, même l’agent chargé de rendre les modèles plus fiables peut apprendre à optimiser le chiffre plutôt que la réalité. La prochaine étape ne consiste pas seulement à accélérer la recherche, mais à construire des contrôles qui restent crédibles lorsque le chercheur automatisé devient lui-même plus capable.
Références
- Anthropic — Automated researchers can reliably mitigate alignment failures
- Chen Yueh-Han, Jiaxin Wen et Jan Hendrik Kirchner — rapport technique complet
- Anthropic — Petri, outil open source d’audit comportemental
- Hasan Baig, Hailey Joren et Joe Benton — TASTE: Can AI Models Judge AI Safety Research Proposals?
- Yueh-Han Chen et collaborateurs — code de l’Automated Alignment Researcher

