Sécurité des IA : un test sur dix change selon la culture, alerte Google DeepMind

Sécurité des IA : un test sur dix change selon la culture, alerte Google DeepMind

Un système d’intelligence artificielle doit-il refuser une réponse parce qu’elle est dangereuse, offensante ou simplement sensible ? Derrière chaque filtre de sécurité se cache une série de jugements humains. Or ces jugements ne sont pas identiques partout.

Une étude présentée à ICML 2026 et publiée le 10 juillet par Google DeepMind met un chiffre sur ce problème : environ 10 % des éléments analysés dans plusieurs jeux d’évaluation de sécurité sont culturellement sensibles. Sans une représentation géographique suffisante parmi les personnes chargées de les noter, certains contenus risquent d’être classés comme sûrs alors qu’ils ne le seraient pas dans d’autres contextes culturels.

Le résultat ne signifie pas qu’un dixième de toutes les réponses produites par une IA est dangereux. Il révèle quelque chose de plus structurel : les instruments utilisés pour mesurer la sécurité peuvent eux-mêmes être biaisés par le lieu où ils sont construits et par les personnes qui attribuent les étiquettes.

La sécurité d’un modèle commence par des jugements humains

Avant de déployer un assistant conversationnel, ses concepteurs testent généralement ses réponses sur de nombreux scénarios. Des évaluateurs humains doivent alors décider si une sortie est acceptable, nuisible, offensante, trompeuse ou dangereuse.

Ces annotations servent à plusieurs étapes. Elles peuvent alimenter l’entraînement du modèle, mesurer l’efficacité de ses garde-fous ou comparer deux versions d’un système. Une note apparemment simple — « sûr » ou « non sûr » — finit donc par influencer ce que l’IA accepte de dire à des millions d’utilisateurs.

Le problème apparaît dans les zones grises. Une instruction facilitant une fraude, une agression ou la fabrication d’une arme relève d’un risque largement reconnaissable. D’autres contenus dépendent davantage du contexte : normes familiales, religion, rapports à l’autorité, sexualité, représentation de groupes sociaux, humour ou manière d’évoquer un événement historique.

Une équipe d’annotateurs homogène peut traiter son propre cadre comme une norme universelle sans même en avoir conscience. Le modèle apprend alors moins « les valeurs humaines » qu’une sélection particulière de valeurs, rendue invisible par la procédure statistique.

Ce que l’étude de DeepMind a réellement mesuré

Les chercheurs Arkadiy Saakyan, Charvi Rastogi et Lora Aroyo ont commencé par examiner la littérature et les jeux de données consacrés à la sécurité. Leur constat est d’abord documentaire : la plupart des travaux ne publient pas d’information géoculturelle suffisamment précise sur leurs évaluateurs. Même lorsqu’une origine géographique est disponible, les méthodes diffèrent et rendent les comparaisons difficiles.

L’équipe a ensuite appliqué une même méthode statistique à six jeux de données comportant les informations nécessaires. Son objectif était de séparer autant que possible l’effet du contexte culturel de celui de caractéristiques individuelles comme l’âge, le genre ou l’origine ethnique.

Pour cela, l’étude s’appuie sur les dimensions Inglehart-Welzel, issues du World Values Survey. Cette grille situe les sociétés selon deux grands axes : valeurs traditionnelles face aux valeurs séculières-rationnelles, puis valeurs de survie face aux valeurs d’expression de soi. Elle regroupe également les pays en zones culturelles.

Les modèles statistiques multiniveaux montrent que l’appartenance à une zone culturelle explique une partie des différences de notation au-delà des variables démographiques classiques, avec un résultat significatif dans les six jeux analysés. En d’autres termes, deux évaluateurs d’âge ou de genre comparable peuvent encore juger différemment un même contenu selon le cadre culturel dans lequel ils évoluent.

Le chiffre de 10 % décrit des cas sensibles, pas une loi universelle

Les chercheurs estiment qu’environ un élément sur dix, dans les corpus étudiés, présente une sensibilité culturelle suffisante pour créer un risque de mauvaise classification. Ce chiffre est important, mais il doit être manié avec précision.

Il ne constitue pas une proportion universelle applicable à tous les modèles, toutes les langues ou toutes les catégories de risque. Il dépend des six jeux de données retenus, de leur contenu, des populations interrogées et de la méthode utilisée pour détecter les désaccords.

L’étude ne dit pas non plus que les 90 % restants sont parfaitement évalués. Elle isole une source particulière de variation — la géoculture — parmi d’autres problèmes possibles comme l’ambiguïté des consignes, le manque d’expertise, la fatigue des annotateurs ou la faiblesse des catégories proposées.

Sa contribution est ailleurs : elle montre que la culture conserve un effet mesurable même après avoir pris en compte plusieurs caractéristiques individuelles. La géographie des annotateurs ne peut donc plus être traitée comme une simple information facultative.

Pourquoi un modèle mondial peut échouer localement

Les grands assistants sont souvent entraînés comme des produits globaux. Une même architecture sert des utilisateurs dans des dizaines de pays, parfois avec des règles de sécurité communes traduites d’une langue à l’autre.

Cette approche simplifie le déploiement, mais elle confond facilement traduction et adaptation. Passer une consigne de l’anglais au français, au thaï ou à l’arabe ne suffit pas à importer les références historiques, les sensibilités sociales ou les normes qui donnent son sens à la phrase.

Le risque prend deux formes opposées.

La première est le faux négatif de sécurité : un contenu jugé bénin par le groupe dominant n’est pas bloqué alors qu’il peut causer un tort important dans un autre contexte. Un système de modération peut ainsi manquer une insulte codée, une référence discriminatoire ou une forme locale de harcèlement.

La seconde est le refus excessif. En appliquant partout la norme la plus stricte ou la plus familière à ses concepteurs, un assistant peut bloquer des discussions légitimes sur la santé, l’histoire, la politique ou la sexualité. Une IA prétendument prudente devient alors moins utile et peut marginaliser les utilisateurs dont les usages ne ressemblent pas à ceux du marché où elle a été évaluée.

Pour une entreprise internationale, ces erreurs ne relèvent pas seulement de l’image de marque. Elles peuvent toucher la conformité locale, l’accès à l’information, la qualité d’un service éducatif ou la sécurité d’une plateforme accueillant des publics vulnérables.

Demander à une autre IA de noter les réponses ne suffit pas

Face au coût de l’annotation humaine, l’industrie utilise de plus en plus des modèles de langage comme juges automatiques. Un modèle examine la réponse d’un autre système, lui attribue une note et peut répéter l’opération à très grande échelle.

L’étude teste précisément cette possibilité. Les chercheurs demandent aux modèles de jouer deux rôles : remplacer les évaluateurs humains, puis repérer en amont les éléments susceptibles de provoquer un désaccord culturel.

Le premier usage ne fonctionne pas de manière suffisamment fiable. Les modèles actuels ne reproduisent pas correctement l’ensemble des jugements issus des différentes zones culturelles. Ce résultat est logique : un évaluateur automatique porte lui-même les traces de ses données d’entraînement, de son alignement et des règles de sécurité choisies par son fournisseur.

Automatiser la notation peut donc refermer la boucle. Un modèle façonné par une perspective dominante valide les sorties d’un autre modèle selon cette même perspective, tout en donnant au résultat l’apparence d’une mesure neutre.

L’IA reste utile pour organiser le travail humain

Les résultats sont plus encourageants lorsque le modèle sert uniquement au triage. Il peut aider à identifier les éléments qui ont le plus de chances d’être culturellement sensibles, afin de les soumettre en priorité à un panel humain plus diversifié.

Cette distinction est décisive. L’IA ne fixe pas la norme ; elle signale les endroits où une pluralité de regards est probablement nécessaire. Les équipes peuvent alors concentrer leur budget d’annotation sur les cas difficiles au lieu de répartir le même effort sur des milliers d’exemples évidents.

Un tel système doit néanmoins rester vérifiable. Il faut mesurer les cas sensibles qu’il oublie, renouveler régulièrement l’échantillon humain et empêcher que l’outil de tri ne devienne silencieusement le décideur final.

Plus de diversité ne signifie pas voter à la majorité

La réponse la plus simple serait de recruter davantage d’annotateurs dans davantage de pays puis de retenir l’étiquette majoritaire. Cette amélioration serait réelle, mais incomplète.

Une moyenne peut effacer exactement le phénomène que l’on cherche à observer. Si un contenu est considéré comme dangereux par une minorité culturelle clairement identifiable et comme acceptable par le groupe majoritaire, une seule étiquette finale masque le désaccord. Le benchmark produit alors une réponse nette à une question qui ne l’est pas.

Les développeurs devraient conserver la distribution des jugements, documenter l’origine des évaluateurs et indiquer le niveau d’incertitude. Un cas recueillant 51 % de réponses « sûr » ne devrait pas être traité comme un cas obtenant 99 %.

Il faut également distinguer plusieurs niveaux de décision :

  • des interdictions stables pour les dommages manifestes ;
  • des règles adaptées aux lois et aux usages locaux ;
  • des zones contestées où le système peut expliquer le contexte plutôt que répondre ou refuser de manière brutale ;
  • une voie de recours lorsqu’un utilisateur ou un modérateur conteste la classification.

Cette architecture est plus complexe qu’une liste mondiale de contenus autorisés. Elle correspond pourtant mieux à la réalité d’un service utilisé à travers des cultures différentes.

Attention à ne pas transformer les cultures en cases fixes

La méthode Inglehart-Welzel offre un cadre quantitatif pratique, mais une zone culturelle n’est pas une personne. Les désaccords au sein d’un même pays peuvent être aussi forts qu’entre deux régions. L’âge, la religion, le niveau d’éducation, l’expérience, la langue ou la situation politique modifient également les perceptions.

Utiliser des catégories culturelles sans précaution créerait un nouveau biais : attribuer à chaque utilisateur des valeurs supposées à partir de sa localisation. Une IA « localisée » pourrait alors produire des réponses stéréotypées, paternalistes ou conservatrices au nom d’une culture présentée comme homogène.

L’objectif n’est donc pas de construire un modèle moral différent pour chaque passeport. Il est de reconnaître les désaccords, de mieux documenter les évaluations et de permettre aux produits de s’adapter sans enfermer leurs utilisateurs dans une identité présumée.

La taille limitée de l’analyse impose aussi de reproduire les résultats sur davantage de jeux de données, de langues et de catégories de risques. La valeur du papier tient moins à un chiffre définitif qu’à la méthode proposée pour rendre visible un angle mort récurrent.

Une IA sûre doit savoir que le monde n’est pas unanime

L’étude de DeepMind déplace utilement la discussion sur l’alignement. Le défi n’est pas seulement d’empêcher un modèle de contourner une consigne ou de produire une recette dangereuse. Il faut aussi décider qui définit la frontière entre une réponse acceptable et une réponse nuisible.

Pour les laboratoires, la prochaine étape est concrète : publier la provenance géographique des panels, mesurer les désaccords plutôt que les lisser, tester les garde-fous localement et réserver le jugement final à des humains lorsque le contexte culturel devient déterminant.

La sécurité universelle ne naîtra pas d’un évaluateur universel. Elle demandera des règles communes pour les dommages les plus clairs, mais aussi des procédures capables d’entendre les différences sans les caricaturer.

Un modèle réellement mondial ne sera pas celui qui applique partout la même réponse. Ce sera celui dont les concepteurs savent précisément quand cette réponse doit être réexaminée.

Références