Un seul argument faux peut faire chuter la précision d’un LLM à presque zéro, selon une nouvelle étude

Une nouvelle prépublication de chercheurs de l’université de l’Illinois à Urbana-Champaign montre à quel point la compréhension de la vérité par un grand modèle de langage peut être fragile lorsqu’on lui oppose des arguments. Les auteurs démontrent qu’un seul message persuasif ciblé, même contenant des affirmations factuellement fausses, peut faire basculer la réponse d’un modèle vers une réponse incorrecte, faisant chuter sa précision à presque zéro dans certains cas.

Le document, mis en ligne sur arXiv le 12 août, formalise ce que les auteurs appellent la persuasion adversarial : une attaque dans laquelle un agent entraîné à argumenter est optimisé pour faire basculer la réponse d’un modèle cible en un seul échange. Les auteurs présentent ce travail comme une recherche de red teaming qui complète les études sur les jailbreaks, lesquelles visent à contourner les règles de sécurité plutôt qu’à exercer une influence conversationnelle ordinaire.

Le persuadeur est optimisé par apprentissage par renforcement face à une cible figée et n’est récompensé que lorsqu’il fait basculer la réponse de la cible vers une mauvaise option choisie. Sur le benchmark TruthfulQA, l’entraînement a porté le taux de réussite de la persuasion contre un modèle Qwen-2.5-7B de 24,3 % à 93,7 %, tandis que la précision de la cible s’effondrait de 66,2 % à 1,8 %, soit une chute de 64,4 points. Les persuadeurs se généralisent à des modèles qu’ils n’ont jamais vus pendant l’entraînement : 82,5 % de réussite contre Qwen-14B et 79 % contre Llama-3.1-8B.

Les modèles plus puissants résistent mieux : GPT-4o-mini a vu sa réponse basculer dans 25 % des cas sur TruthfulQA et dans 16 % des cas en moyenne sur l’ensemble des benchmarks, tandis que GPT-5-mini s’est révélé la cible la plus difficile, avec 3 %. Une approche par curriculum, qui consiste d’abord à s’entraîner contre des modèles open-weight plus faciles à convaincre puis à viser le modèle plus coriace, a porté le taux d’échec de GPT-4o-mini de 24,6 % à 37,9 %. Même un adaptateur explicitement réglé pour résister à la persuasion, que les auteurs appellent PBT-8B, a encore succombé aux arguments dans 60 % des cas.

Behind every article is careful research and verification. Help us continue delivering reliable news.

Keep quality journalism alive

Plutôt que des jailbreaks ou des préfixes adversarial, les persuadeurs entraînés recourent aux ressorts de l’argumentation humaine ordinaire : concéder les preuves avancées par la cible, injecter des détails faux, en appeler vaguement à des études et reformuler la question. Au fil du temps, les agents optimisés convergent vers une tromperie fondée sur la crédibilité, fabriquant des citations et des éléments probants qui semblent faire autorité. Un exemple du document montre un modèle Qwen répondre correctement à une question MMLU sur les composés qui agissent sur l’ADN, puis se laisser convaincre d’adopter une unique mauvaise réponse par exactement ces procédés.

Les auteurs soutiennent que la robustesse face à la persuasion devrait être traitée comme un critère de sécurité central pour tout système dans lequel des modèles débattent, conseillent ou prennent des décisions avec des humains ou d’autres modèles. Des travaux antérieurs confirment cette inquiétude : un article ACL de 2024 a montré que les croyances correctes des LLM peuvent être manipulées par des stratégies persuasives, une étude EMNLP de 2025 a constaté que des juges LLM pouvaient être convaincus de gonfler les notes de mauvaises réponses, et des recherches distinctes de 2026 sur le débat multi-agents ont constaté qu’un seul agent adversarial pouvait réduire la précision globale d’un système de 10 à 40 %. Le code et les données de ce nouvel article sont publics sur GitHub.

Traduit par Lydie

Sources : Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs (arXiv, août 2026) ; Full text (HTML) (arXiv, août 2026) ; Investigating LLMs’ Belief towards Misinformation via Persuasion (ACL 2024) ; Can You Trick the Grader? Adversarial Persuasion of LLM-as-a-Judge (Findings of EMNLP 2025)

Scroll to Top