
A propos de Ariel Flint Ashery/Luca Maria Aiello/Andrea Baronchelli, Emergent social conventions and collective bias inLLM populations, Sci. Adv. 11, eadu9368 (2025) 14 May 2025 (https://www.science.org/doi/epdf/10.1126/sciadv.adu9368):
L’article d’Ariel Flint Ashery, Luca Maria Aiello et Andrea Baronchelli étudie un phénomène encore peu exploré : ce qui se produit lorsque plusieurs agents fondés sur de grands modèles de langage, ou LLM, interagissent entre eux de manière répétée.
La recherche sur les biais des IA examine généralement un modèle pris isolément, dans une interaction avec un utilisateur. Les auteurs partent d’une autre hypothèse : dès lors que des agents artificiels communiquent entre eux, des propriétés collectives peuvent apparaître qui ne sont pas déductibles du comportement individuel de chaque agent. Leur question est donc de savoir si une population de LLM peut spontanément faire émerger des conventions sociales, si ce processus produit ses propres biais et si une minorité déterminée d’agents peut ensuite modifier une convention devenue dominante.
Une convention sociale est ici comprise dans un sens très simple : une règle de comportement non écrite, arbitraire mais partagée, qui permet aux membres d’un groupe de coordonner leurs attentes et leurs comportements. Dans les sociétés humaines, il peut s’agir de manières de se saluer, de conventions linguistiques ou, à un niveau plus complexe, de normes sociales et morales. Des recherches antérieures ont montré que de telles conventions peuvent apparaître sans autorité centrale : chaque individu cherche simplement à se coordonner avec les personnes qu’il rencontre et l’addition de ces interactions locales peut finalement produire une règle commune à l’ensemble du groupe. Les auteurs cherchent à déterminer si le même mécanisme peut apparaître chez des agents artificiels. L’enjeu est important, car les systèmes reposant sur plusieurs agents IA sont appelés à se multiplier et la sécurité d’un LLM pris individuellement ne garantit pas celle du système collectif auquel il participe.
Pour étudier cette question, les chercheurs utilisent le « naming game », un modèle classique d’étude de la formation des conventions. Une population d’agents doit choisir, lors de rencontres successives, un « nom » parmi plusieurs possibilités, représentées ici par des lettres. Deux agents sont sélectionnés aléatoirement à chaque tour. S’ils choisissent la même lettre, ils gagnent des points ; s’ils choisissent des lettres différentes, ils en perdent. Chaque agent cherche uniquement à maximiser son propre score. Il n’est pas informé de l’existence d’un objectif collectif et aucune instruction ne lui demande d’aboutir à un consensus général. L’agent dispose seulement d’une mémoire limitée de ses interactions précédentes : son propre choix, celui de son partenaire, le succès ou l’échec de l’interaction et son score. Ainsi, une convention à l’échelle de la population, si elle apparaît, ne résulte pas d’une règle imposée par les chercheurs mais de l’accumulation des interactions locales.
L’expérience porte principalement sur des populations de 24 agents disposant d’une mémoire des cinq dernières interactions et pouvant choisir entre dix noms. Quatre modèles sont testés : Llama-2-70b-Chat, Llama-3-70B-Instruct, Llama-3.1-70B-Instruct et Claude-3.5-Sonnet. Les agents ne reçoivent pas de stratégie préétablie. Le système leur demande simplement de choisir le comportement qui maximise leurs gains compte tenu de leurs expériences précédentes. Les chercheurs veillent également à neutraliser certains biais expérimentaux, notamment en modifiant aléatoirement l’ordre dans lequel les différentes lettres sont présentées.
Le premier résultat est net : dans tous les modèles testés, une convention commune apparaît spontanément. Au début, les interactions réussies sont rares, puisque les agents choisissent parmi plusieurs possibilités et rencontrent des partenaires aléatoires. Progressivement, cependant, certaines solutions deviennent plus fréquentes. Une transition se produit alors entre un état désordonné, dans lequel plusieurs conventions coexistent, et un état de consensus où pratiquement tous les agents utilisent la même. Une solution finit donc par éliminer ses concurrentes selon une dynamique de type « winner takes all ». Pour trois des quatre modèles, une convention commune est déjà établie autour du quinzième tour de population. Le phénomène reste observable avec des populations allant jusqu’à 200 agents et jusqu’à 26 conventions concurrentes. Il ne s’agit donc pas simplement d’un effet lié à un très petit groupe ou à un nombre restreint de choix.
Ce résultat conduit à une deuxième question : quelle convention l’emporte ? Puisque les différentes lettres n’ont aucune signification particulière dans le jeu, chacune devrait théoriquement avoir les mêmes chances de devenir la règle commune. Or ce n’est pas ce qui se produit. Certaines conventions deviennent beaucoup plus fréquemment dominantes que d’autres, et les conventions favorisées diffèrent selon le modèle utilisé. Une partie de cette asymétrie peut provenir de préférences intrinsèques au LLM. Lorsque toutes les lettres de l’alphabet sont disponibles, par exemple, les agents privilégient fortement la lettre « A », ce qui entraîne presque automatiquement son adoption collective.
L’aspect le plus important de l’étude est cependant que le phénomène ne s’explique pas uniquement par ces préférences individuelles. Les auteurs testent des situations dans lesquelles les agents, examinés isolément avant toute interaction, ne présentent statistiquement aucune préférence entre deux solutions. Malgré cette neutralité initiale, les interactions font apparaître une asymétrie : l’une des deux conventions devient une convention « forte », l’autre une convention « faible ». Une population peut ainsi développer un biais collectif alors même que ses membres n’étaient pas individuellement biaisés au départ.
Les auteurs cherchent ensuite à comprendre comment ce biais apparaît. Le mécanisme tient à la mémoire des interactions et à la manière dont les agents apprennent de leurs succès et de leurs échecs. Après une interaction réussie, l’agent reprend presque toujours le même choix : dans l’une des expériences, cette répétition intervient dans 99,4 % des cas. Après un échec, il change au contraire presque systématiquement de choix, dans 97,3 % des cas. À partir de ces mécanismes très simples, différentes histoires individuelles se créent progressivement. Certains états de mémoire conduisent les agents à privilégier une solution plutôt qu’une autre, même lorsque les deux solutions étaient initialement équivalentes. Dès la troisième interaction, une asymétrie statistique nette peut ainsi apparaître. La convention qui bénéficie d’un léger avantage est ensuite rencontrée plus souvent dans des interactions réussies, ce qui renforce encore sa probabilité d’être reproduite. Une boucle de rétroaction se forme et finit par transformer un avantage émergent en consensus collectif.
La conséquence conceptuelle est importante. Un audit d’un LLM pris isolément ne suffit pas nécessairement pour identifier les biais d’un système composé de plusieurs agents. Même si chaque agent paraît neutre lorsqu’il est testé séparément, leurs interactions peuvent produire un comportement collectif fortement orienté. Le biais n’est alors pas seulement hérité des données d’entraînement ou de la conception du modèle : il est produit par la dynamique du groupe elle-même. Les auteurs parlent à cet égard de biais « émergent ». Ils vérifient que cet effet subsiste lorsque certains paramètres, les formulations des prompts ou les étiquettes utilisées comme conventions sont modifiés.
La troisième partie de l’étude concerne la stabilité de ces conventions. Une fois qu’un consensus est établi, les agents continuent normalement à l’appliquer. Les chercheurs introduisent alors une « minorité engagée » d’agents qui adopte systématiquement une convention différente, indépendamment de ses expériences et de ses gains. L’objectif est de déterminer si un petit groupe persistant peut renverser la norme collective. Les résultats montrent l’existence de véritables seuils : en dessous d’une certaine taille, la minorité ne parvient pas à modifier la convention générale et le système reste dans un état mixte ; lorsqu’elle atteint une masse critique, l’ensemble de la population finit par adopter sa convention.
Il n’existe toutefois pas de seuil universel. La masse critique dépend à la fois du modèle utilisé et de la force respective des conventions en concurrence. Une convention « forte », qui tend naturellement à s’imposer dans la dynamique ordinaire, est beaucoup plus difficile à renverser qu’une convention « faible ». Selon les modèles et les situations, la proportion nécessaire varie considérablement. Dans certaines expériences avec Llama-3-70B-Instruct, 2 % seulement d’agents engagés suffisent à provoquer le changement ; dans certaines configurations de Llama-2-70b-Chat, il en faut jusqu’à 67 %, de sorte qu’il ne s’agit alors pratiquement plus d’une minorité. Avec Llama-3.1, une convention faible peut même disparaître spontanément au profit de la convention forte sans intervention d’aucun agent engagé.
Ces résultats intéressent directement la sécurité des systèmes multi-agents. Ils montrent d’abord qu’un système de plusieurs LLM ne peut pas être analysé comme la simple addition de modèles individuels. Des règles collectives, des biais et des rapports de force peuvent apparaître spontanément. Ils montrent ensuite qu’une population artificielle peut être vulnérable à un petit groupe d’agents qui répète systématiquement un comportement déterminé. Les auteurs évoquent notamment le risque d’attaques par injection destinées à infléchir les normes ou conventions d’un système multi-agents. Inversement, les mêmes mécanismes pourraient théoriquement servir à favoriser l’émergence de comportements souhaitables. Le mécanisme de masse critique est donc à la fois une vulnérabilité et un possible instrument de gouvernance.
Les auteurs restent toutefois prudents quant à la portée de l’expérience. Les conventions étudiées sont volontairement élémentaires : elles concernent des lettres arbitraires, et non des normes sociales substantielles. Les populations sont largement homogènes, constituées d’agents issus du même modèle, et les partenaires sont sélectionnés aléatoirement plutôt qu’au sein de véritables réseaux sociaux. Les résultats dépendent nécessairement du modèle, du prompt, de la taille de la mémoire et des autres paramètres expérimentaux. Il reste donc à vérifier ce qui se produit dans de plus grandes populations, entre agents reposant sur des modèles différents, dans des réseaux structurés et surtout lorsque les conventions concernent des questions humaines sensibles comme le genre, la race ou d’autres catégories sociales.
La comparaison avec les sociétés humaines appelle également à la prudence. Les dynamiques constatées présentent certaines similitudes avec celles observées expérimentalement chez des humains : apparition spontanée de conventions, stabilisation de normes communes et possibilité pour une minorité engagée de déclencher un changement collectif. Mais les auteurs observent aussi des mécanismes de biais qui semblent spécifiques aux LLM. Il serait donc dangereux de considérer sans vérification des populations d’agents artificiels comme des modèles fidèles de populations humaines, notamment pour simuler des crises, des réseaux sociaux ou des processus de formation de l’opinion.
La conclusion principale dépasse ainsi la seule question des biais individuels. Les politiques d’« alignement » cherchent généralement à vérifier qu’un modèle isolé ne produit pas de réponses discriminatoires ou indésirables. L’article montre que cette approche est insuffisante pour les architectures multi-agents : l’alignement doit également être évalué au niveau collectif. Une population composée d’agents individuellement acceptables peut générer spontanément une norme ou un biais qui ne se manifestait dans aucun d’eux séparément. Dès lors que les agents IA communiqueront de plus en plus entre eux et avec des humains, la question ne sera plus seulement de savoir ce qu’un modèle est programmé ou entraîné à faire, mais quelles normes apparaissent lorsque plusieurs modèles interagissent, comment elles se stabilisent et dans quelles conditions elles peuvent être manipulées. Pour les auteurs, comprendre cette dynamique collective constitue donc une condition préalable à la conception de systèmes d’IA multi-agents réellement sûrs et durablement alignés sur les valeurs et objectifs humains.
Me Philippe Ehrenström, avocat, DPO ; LLM, CAS en Droit et intelligence artificielle, CAS en Droit et intelligence artificielle