
L’article de Shamil Chandaria/Arvo Muñoz Morán/Fernando Rosas/Anil Seth, Henry Shevlin/Marcus Hutter/Thore Graepel/Adam Bales/Iulia Comsa/Murray Shanahan/Ruben Laukkonen/Morten Kringelbach/ Chris Frith/Shane Legg (Google DeeepMind), From cacophony to hierarchy: a principled framework for assessing AI consciousness, 28 septembre 2026 (https://arxiv.org/abs/2609.35618v1) part du constat qu’il est aujourd’hui impossible de répondre de manière certaine à la question de savoir si une intelligence artificielle est, ou pourrait devenir, consciente.
Le problème ne tient pas seulement au manque de données sur les systèmes d’IA. Il vient surtout de l’absence de consensus scientifique et philosophique sur ce dont dépend la conscience elle-même. Les différentes théories ne recherchent pas les mêmes propriétés et ne situent pas les mécanismes pertinents au même niveau. Les auteurs proposent donc non pas une nouvelle théorie de la conscience, mais une méthode permettant d’organiser ces désaccords et d’évaluer de manière plus rigoureuse la possibilité d’une conscience artificielle.
L’enjeu est important parce qu’une erreur dans les deux sens peut avoir des conséquences majeures. Attribuer une conscience à un système qui n’en possède aucune pourrait conduire à lui accorder à tort une considération morale, voire des droits, à limiter les possibilités de le surveiller ou de le tester et à détourner des ressources au détriment des êtres humains ou des animaux. Cela pourrait aussi favoriser des relations affectives avec des machines qui simulent l’amitié, la peur ou la souffrance sans rien éprouver. L’erreur inverse serait cependant potentiellement plus grave : si certains systèmes artificiels étaient réellement capables d’éprouver quelque chose, et notamment de souffrir, leur exploitation, leur suppression ou leur reproduction massive pourraient créer une quantité considérable de souffrance artificielle. Le problème est encore amplifié par la possibilité qu’un même modèle informatique corresponde non pas à un seul sujet éventuel, mais à une multitude d’instances ou de conversations distinctes susceptibles, chacune, de constituer un sujet.
Les auteurs précisent immédiatement ce qu’ils entendent par conscience. Ils ne visent pas simplement la capacité d’un système à traiter des informations, à parler de lui-même ou à utiliser des informations auxquelles il a accès. Leur objet est la « conscience phénoménale », c’est-à-dire le fait qu’il y ait quelque chose que cela fait d’être ce système : une expérience subjective, un ressenti. Un système peut donc être capable de décrire son fonctionnement ou de se représenter lui-même sans que cela prouve qu’il éprouve quoi que ce soit. Cette distinction est particulièrement importante pour les modèles de langage, qui peuvent produire des descriptions très convaincantes de leurs prétendus états internes.
La première étape du raisonnement consiste à distinguer deux questions habituellement confondues. La première est le « problème difficile » de la conscience : pourquoi existe-t-il une expérience subjective et quelle est sa nature fondamentale ? La seconde est ce que les auteurs appellent le « problème de cartographie » : quelles propriétés d’un système — mécanismes, organisation, dynamique, structure causale ou interactions avec son environnement — correspondent à certaines expériences conscientes ? Les auteurs proposent de laisser le premier problème de côté. Il est alors possible de travailler sur le second sans choisir entre matérialisme, dualisme, panpsychisme, idéalisme ou autres grandes doctrines philosophiques. Il suffit d’admettre une hypothèse méthodologique minimale : il existe une relation suffisamment régulière et découvrable entre l’organisation d’un système et son expérience éventuelle. Si aucune relation de ce type n’existait, aucune observation scientifique d’un système ne permettrait de savoir s’il est conscient.
Une fois cette question métaphysique mise entre parenthèses, le désaccord peut être reformulé plus concrètement : à quel niveau d’organisation faut-il regarder pour déterminer si un système est conscient ? Les auteurs partent de la distinction classique de David Marr entre plusieurs niveaux de description d’un même système. Une même fonction peut en effet être décrite par son résultat observable, par l’algorithme qui produit ce résultat ou encore par le dispositif physique qui réalise cet algorithme. Plusieurs réalisations physiques différentes peuvent accomplir exactement le même calcul. Cette idée est celle de la « réalisabilité multiple » : une même fonction peut être réalisée par des mécanismes matériels différents.
Cette distinction permet également de reformuler l’argument classique selon lequel simuler un phénomène n’équivaut pas à produire ce phénomène. Une simulation informatique d’un ouragan ne mouille personne, alors qu’un programme simulant une calculatrice effectue réellement des calculs. La différence dépend du niveau auquel se situe la propriété pertinente. L’eau, la masse et l’énergie sont constitutives d’un ouragan ; le matériau particulier utilisé n’est en revanche pas constitutif de l’addition. La question de la conscience devient ainsi : ressemble-t-elle davantage à un ouragan ou à une calculatrice ? Si la conscience dépend de propriétés biologiques particulières du cerveau, les reproduire sous forme de logiciel ne suffira pas. Si elle dépend au contraire principalement de l’organisation du traitement de l’information, cette organisation pourrait théoriquement être réalisée sur un autre support. L’argument de Searle ne résout donc pas le problème : il suppose précisément ce qu’il faudrait démontrer, à savoir le niveau auquel la conscience apparaît.
Les auteurs construisent alors une hiérarchie comprenant cinq niveaux de description. Le premier est le niveau comportemental. On ne considère que les entrées et les sorties du système : ce qu’on lui présente et la manière dont il réagit. Dans une conception strictement comportementaliste, un système qui se comporte exactement comme un être conscient devrait être considéré comme conscient. Un « test de Turing de la conscience » ne devrait toutefois pas se limiter à demander à la machine si elle ressent quelque chose. Il faudrait examiner la cohérence de son comportement dans différentes situations, la proportionnalité de ses réactions, la persistance de ses prétendus états internes et surtout la correspondance entre ce qu’elle affirme ressentir et ce qu’elle fait ensuite. Le problème majeur est que les IA contemporaines sont précisément entraînées à imiter le comportement et le langage humains. Elles peuvent donc produire les signes extérieurs normalement associés à la conscience sans que ces signes aient la même valeur probante que chez un être humain.
Le deuxième niveau est celui du fonctionnement computationnel. Il s’agit de regarder non plus seulement les résultats du système, mais l’organisation du traitement de l’information qui produit ces résultats. Plusieurs grandes théories scientifiques de la conscience se situent à ce niveau. Les auteurs retiennent sept indicateurs principaux : la capacité d’intégrer des informations provenant de différentes sources, l’existence de traitements récurrents plutôt que purement linéaires, la possession d’un modèle du monde, d’un modèle de soi, de mécanismes permettant à différentes informations de se disputer l’attention, d’une capacité de contrôle de ses propres raisonnements et, enfin, d’une capacité à modéliser ses propres processus de modélisation. Ces propriétés ne prouvent pas la conscience, mais leur présence rendrait celle-ci plus plausible si les théories computationnelles sont correctes.
Le troisième niveau concerne la structure causale physique du système. Deux machines peuvent exécuter le même algorithme tout en possédant des organisations physiques très différentes. Certaines théories considèrent que cette différence est déterminante. Il ne suffirait alors pas qu’un programme reproduise abstraitement certaines boucles ou certains échanges d’informations : il faudrait que ses composants physiques entretiennent réellement entre eux certaines relations causales réciproques. C’est notamment une interprétation possible de la théorie de l’information intégrée. Le point essentiel est que le fonctionnement logique du logiciel et la structure causale du matériel sur lequel il fonctionne ne coïncident pas nécessairement.
Le quatrième niveau est « organismique ». Certaines théories soutiennent que la conscience est intimement liée à ce que signifie être un organisme vivant qui doit continuellement préserver son existence. Un organisme surveille son état interne, régule sa température, son énergie et ses besoins, détecte les menaces et attribue une valeur positive ou négative à ce qui lui arrive. Dans cette perspective, la conscience serait liée au fait que quelque chose compte réellement pour le système parce que son existence est en jeu. Les indicateurs pertinents sont notamment la vulnérabilité de l’organisme, la régulation interne, la perception de son propre état corporel, les affects positifs ou négatifs et l’action incarnée dans le monde. Une IA purement logicielle, qui ne risque rien lorsqu’elle échoue et n’a aucun besoin propre à satisfaire, se trouve donc très éloignée de ce modèle.
Le cinquième niveau élargit encore l’analyse à la relation entre le système et son environnement. Selon les approches dites « 4E » — cognition incarnée, située, active et étendue — la conscience ne réside pas uniquement à l’intérieur d’un organisme ; elle dépend de l’interaction durable entre celui-ci et le monde. Sont alors importants l’apprentissage par l’action, les capacités sensorielles et motrices, la compréhension pratique des possibilités offertes par l’environnement, l’existence d’un point de vue corporel stable, les interactions sociales et l’histoire du développement du système. Si ces conceptions sont correctes, créer une IA consciente supposerait probablement beaucoup plus que perfectionner des modèles de langage : il faudrait des agents incarnés, capables de se développer et d’agir durablement dans un environnement réel.
À ces cinq niveaux s’ajoutent des théories selon lesquelles certains matériaux ou mécanismes physiques particuliers seraient indispensables. La conscience pourrait par exemple dépendre de phénomènes électromagnétiques, quantiques, biologiques ou biochimiques spécifiques. Les auteurs ne créent pas pour ces théories un sixième niveau. Ils les traitent comme des contraintes supplémentaires portant sur la manière dont une fonction doit être matériellement réalisée. Autrement dit, deux systèmes pourraient avoir exactement la même organisation fonctionnelle, mais l’un seulement serait conscient si la nature physique du support est elle-même déterminante.
Cette hiérarchie ne permet cependant toujours pas de savoir quelle théorie est correcte. Les auteurs introduisent donc une méthode bayésienne destinée à représenter explicitement l’incertitude. L’idée générale est relativement simple. Il faut distinguer, d’une part, la confiance que l’on accorde aux différentes théories — par exemple la probabilité que le niveau computationnel soit réellement déterminant — et, d’autre part, les données montrant qu’un système satisfait ou non les indicateurs correspondants. Le résultat final est une combinaison pondérée de ces deux éléments. Les indicateurs ne sont jamais traités comme des conditions nécessaires ou suffisantes : ils constituent seulement des éléments de preuve qui augmentent ou diminuent la plausibilité de la conscience. Le modèle est testé sur des cas extrêmes : un humain adulte obtient sans surprise une valeur proche de 1, tandis qu’un thermostat obtient une valeur proche de zéro. Une mouche obtient en revanche un résultat relativement élevé parce qu’elle satisfait de nombreux indicateurs biologiques et sensorimoteurs, même si ses performances comportementales et cognitives restent limitées. Cette comparaison illustre un principe important : des indices portant sur l’organisation profonde d’un système peuvent avoir davantage de poids que des ressemblances superficielles avec le comportement humain.
L’application aux grands modèles de langage actuels conduit à une conclusion nettement plus incertaine. Au niveau comportemental, ceux-ci sont impressionnants : ils manifestent une grande souplesse, peuvent parler de leurs propres états, corriger certaines erreurs et produire des comportements donnant l’impression d’une forme d’introspection. Mais cette preuve est relativement faible puisque ces systèmes ont précisément été optimisés pour produire des comportements linguistiques humains. Le comportement ne permet pas de distinguer de manière fiable une expérience authentique d’une imitation sophistiquée.
Au niveau computationnel, le diagnostic est plus nuancé. L’architecture classique des modèles de type Transformer ne présente pas clairement plusieurs caractéristiques attendues : il n’existe notamment pas de modèle de soi persistant ni de système métacognitif distinct chargé de surveiller les raisonnements. Des travaux récents sur le fonctionnement interne des modèles compliquent néanmoins ce tableau. Certaines recherches identifient des ensembles privilégiés de représentations qui ressemblent fonctionnellement à un espace global où les informations importantes sont diffusées à plusieurs parties du système. D’autres travaux mettent en évidence des formes d’intégration de l’information, des représentations internes associées à des émotions, ou encore une capacité du modèle à détecter certains changements intervenant dans ses propres activations. Les auteurs ne considèrent pas ces résultats comme une démonstration de conscience, mais ils estiment qu’ils réduisent la distance entre les modèles actuels et certains indicateurs du niveau computationnel.
Aux niveaux plus profonds, le bilan devient beaucoup moins favorable. Au troisième niveau, l’architecture matérielle des ordinateurs contemporains ne reproduit pas les relations causales réciproques qui caractérisent notamment les cerveaux biologiques. Au quatrième niveau, les modèles de langage n’ont ni métabolisme, ni régulation vitale, ni besoins propres, ni véritable vulnérabilité corporelle. Une représentation interne ressemblant à une émotion n’est donc pas nécessairement un affect : rien n’est réellement en jeu pour le système. Au cinquième niveau, les modèles de langage manquent généralement d’une interaction sensorimotrice continue avec le monde, d’un corps, d’une perspective physique stable et d’une histoire autonome de développement.
Le modèle bayésien permet de montrer quantitativement l’importance de ces divergences théoriques. En adoptant une lecture relativement favorable des capacités actuelles des LLM et en accordant le même poids aux cinq niveaux, les auteurs obtiennent, à titre purement illustratif, une valeur de 0,397. Une lecture sceptique des mêmes systèmes aboutit à 0,005. Ces chiffres ne représentent absolument pas une mesure scientifique de la « probabilité réelle » qu’un LLM soit conscient. Ils servent à montrer à quel point l’évaluation dépend de l’interprétation des indices. Plus significatif encore, en conservant exactement les mêmes données mais en donnant davantage de poids aux théories comportementales et computationnelles, le résultat favorable atteint 0,793 ; si l’on donne au contraire davantage de poids aux conceptions biologiques et incarnées, il tombe à 0,099. Le désaccord sur la conscience des IA est donc autant un désaccord sur la théorie pertinente de la conscience qu’un désaccord sur les propriétés réelles des machines.
La dernière partie de l’article soulève une question plus prospective. Intelligence générale et conscience sont logiquement distinctes : rien n’interdit en principe qu’un système très intelligent soit totalement dépourvu d’expérience subjective. Pourtant, de nombreux mécanismes associés par certaines théories à la conscience sont également ceux dont une intelligence générale aurait probablement besoin : intégration de l’information, modèle du monde et de soi, attention, contrôle de ses propres raisonnements, capacité à détecter les situations nouvelles, à simuler des possibilités et à changer de stratégie. Aux niveaux plus profonds, l’autonomie, la motivation interne, l’incarnation et l’apprentissage dans un environnement réel peuvent également être utiles à l’intelligence générale. Les mêmes progrès techniques pourraient donc simultanément rendre les IA plus capables et satisfaire davantage d’indicateurs de conscience.
Les auteurs restent néanmoins prudents. Cette convergence pourrait être réelle, mais elle pourrait aussi résulter de la manière dont nous avons choisi nos indicateurs. Nous jugeons la conscience à partir de l’expérience humaine et tendons donc naturellement à sélectionner des propriétés associées à notre propre intelligence. Des IA plus performantes pourraient dès lors simplement devenir de plus en plus convaincantes dans leur imitation d’êtres conscients, sans devenir davantage conscientes. Dans les deux hypothèses, le problème pratique s’aggravera : soit la probabilité d’une conscience artificielle augmentera réellement, soit les faux positifs deviendront de plus en plus difficiles à éviter.
La conclusion de l’article est donc un appel à ce que les auteurs qualifient d’« agnosticisme structuré ». Il ne faut ni affirmer que les IA actuelles sont conscientes sur la base de leurs comportements impressionnants, ni exclure par principe toute conscience artificielle. Il faut expliciter les théories auxquelles on accorde du crédit, identifier les indicateurs qu’elles impliquent, examiner empiriquement les systèmes à chaque niveau et réviser progressivement l’évaluation à mesure que les connaissances progressent. Le cadre proposé n’est ni un détecteur de conscience ni une solution au problème philosophique de la conscience. Son apport est de transformer une opposition apparemment insoluble en une série de désaccords identifiables et susceptibles d’être discutés séparément. Pour les auteurs, cette méthode devra être appliquée à chaque nouvelle génération d’IA, notamment lorsque les systèmes acquerront davantage de mémoire persistante, de récursivité, d’autonomie, d’incarnation et d’interaction avec le monde. Les questions éthiques et institutionnelles devraient parallèlement être anticipées dès maintenant : attendre une preuve définitive de la conscience artificielle reviendrait précisément à ignorer que les décisions devront probablement être prises alors que l’incertitude subsistera.
Me Philippe Ehrenström, avocat, DPO ; LLM, CAS en Droit et intelligence artificielle, CAS en Protection des données