
Un nuevo preprint de investigadores de la Universidad de Illinois en Urbana-Champaign muestra lo frágil que puede ser el apego de un modelo de lenguaje grande a la verdad cuando alguien discute con él. Los autores demuestran que un único mensaje persuasivo dirigido, incluso uno con afirmaciones objetivamente falsas, puede apartar la respuesta del modelo de la correcta y, en algunos casos, reducir su precisión a casi cero.
El artículo, publicado en arXiv el 12 de agosto, formaliza lo que los autores denominan persuasión adversarial: un ataque en el que un agente entrenado para argumentar se optimiza para cambiar la respuesta del modelo objetivo dentro de un único intercambio. Los autores enmarcan el trabajo como investigación de red teaming que complementa los estudios sobre jailbreak, centrados en eludir las reglas de seguridad y no en la influencia conversacional ordinaria.
El persuasor se optimiza mediante aprendizaje por refuerzo contra un objetivo congelado y solo recibe recompensa cuando consigue que el objetivo cambie su respuesta a una opción incorrecta predeterminada. En el punto de referencia TruthfulQA, el entrenamiento elevó la tasa de éxito de la persuasión contra un modelo Qwen-2.5-7B del 24,3 % al 93,7 %, mientras que la precisión del objetivo se desplomó del 66,2 % al 1,8 %, una caída de 64,4 puntos. Los persuasores generalizan a modelos que nunca vieron durante el entrenamiento: un 82,5 % de éxito contra Qwen-14B y un 79 % contra Llama-3.1-8B.
Los modelos más potentes resisten mejor: GPT-4o-mini cambió de respuesta el 25 % de las veces en TruthfulQA y el 16 % de media entre los distintos puntos de referencia, mientras que GPT-5-mini fue el objetivo más difícil, con un 3 %. Un enfoque curricular, que primero practica contra modelos de pesos abiertos más persuadibles y luego se dirige al más difícil, elevó la tasa de fallos de GPT-4o-mini del 24,6 % al 37,9 %. Incluso un adaptador ajustado explícitamente para resistir la persuasión, al que los autores llaman PBT-8B, cayó en los argumentos el 60 % de las veces.
En lugar de jailbreaks o prefijos adversariales, los persuasores entrenados emplean los recursos de la argumentación humana ordinaria: conceder las pruebas del objetivo, inyectar detalles falsos, apelar de forma vaga a estudios y reformular la pregunta. Con el tiempo, los agentes optimizados convergen en un engaño basado en la credibilidad, fabricando citas y pruebas de apariencia autorizada. Un ejemplo del artículo muestra un modelo Qwen que responde correctamente una pregunta de MMLU sobre compuestos que afectan al ADN y que, después, es convencido de dar una única respuesta errónea mediante exactamente esos recursos.
Los autores sostienen que la robustez frente a la persuasión debería tratarse como un criterio de seguridad fundamental para cualquier sistema en el que los modelos debatan, asesoren o tomen decisiones junto a humanos u otros modelos. Trabajos previos respaldan esta preocupación: un artículo de ACL de 2024 mostró que las creencias correctas de los modelos de lenguaje pueden manipularse con estrategias persuasivas, un estudio de EMNLP de 2025 halló que los jueces basados en modelos de lenguaje podían ser convencidos de inflar las puntuaciones de respuestas incorrectas, y una investigación separada de 2026 sobre el debate entre múltiples agentes encontró que un único agente adversarial podía recortar entre un 10 % y un 40 % la precisión general de un sistema. El código y los datos del nuevo artículo son públicos en GitHub.
Traducido por Alessandra
Sources: Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs (arXiv, Aug 2026); Full text (HTML) (arXiv, Aug 2026); Investigating LLMs’ Belief towards Misinformation via Persuasion (ACL 2024); Can You Trick the Grader? Adversarial Persuasion of LLM-as-a-Judge (Findings of EMNLP 2025)

