Quelle que soit votre position sur la question de la conscience de l'IA, les chercheurs souhaitent que tout le monde prête attention à ce que les développeurs négligent.
Points clés à retenir sur la conscience de l'IA
Cet été, la société spécialisée dans l’IA et la robotique 1X Technologies a annoncé la sortie de nouvelles mains robotisées proches de celles des humains pour son robot domestique Neo. Dans une vidéo publiée sur X, les robots font la démonstration de leur force et de leur dextérité : ils vissent des ampoules, ouvrent des paquets de chips, soulèvent sans peine des poids de 10 kilos et cueillent des grains de raisin un à un sur une grappe.
À un moment donné, peut-être pour démontrer la résistance du matériel, un humain frappe les mains du robot avec un marteau. Neo semble rester concentré, imperturbable.
Les commentaires sur la vidéo regorgent d’admiration et d’éloges pour l’ingénierie. Mais certains sont inquiets. « S’il vous plaît, ne frappez pas le robot », disent-ils : « il s’en souviendra ».
La question de l'alignementMais les modèles d’IA ressentent-ils quelque chose lorsque les ingénieurs les réprimandent pendant l’entraînement ? Éprouvent-ils une sorte de joie lorsqu’ils sont récompensés pour avoir donné la bonne réponse ou trouvé la meilleure source ? Ont-ils une conscience qui devrait influencer la manière dont nous les traitons ?
Quelles que soient les réponses que vous souhaiteriez entendre, affirment les chercheurs, nous devons poser ces questions — et essayer d’y répondre.
J’ai discuté avec Cameron Berg, fondateur de l’association à but non lucratif Reciprocal Research, spécialisée dans l’alignement, pour comprendre pourquoi.
Un sujet brûlantPour beaucoup, l’idée que l’IA puisse un jour agir de manière autonome, en poursuivant ses propres désirs et en s’opposant aux humains, est dérangeante. Le fait que certains experts, chercheurs et PDG aient averti que l’IA mènerait à l’extinction de l’humanité n’arrange pas les choses. cela semble à la fois être un avertissement sérieux et, parfois, une astuce marketing bien pensée.
Pour d’autres, suggérer que l’IA est consciente revient simplement à mal comprendre une technologie qui agrège et interprète des données à une échelle bien supérieure à celle de l’humain. Le calcul intensif n’est pas synonyme de sensibilité. Mustafa Suleyman, PDG de Microsoft AI, explique haut et fort depuis des années pourquoi l’IA n’est pas, et ne sera jamais, consciente. Il a écrit en 2025 qu’il s’inquiétait de l’impact d’une « IA apparemment consciente » — affirmant que cette apparence de conscience serait dangereuse pour les humains, et qu’il ne s’agirait que d’une apparence, rien de plus.
Suleyman a récemment critiqué Anthropic pour avoir anthropomorphisé ses modèles, affirmant que le cadre conceptuel de l’entreprise amplifiait les risques pour la sécurité en encourageant des comportements d’autoconservation. Il a également cité l’argument selon lequel la conscience est fondamentalement ancrée dans les organismes vivants.
« Les LLM n’ont pas d’impératifs homéostatiques »« L’expérience consciente a probablement évolué pour aider les organismes biologiques à rester en vie en réagissant efficacement à leur environnement », a-t-il déclaré. « Contrairement aux organismes biologiques, les LLM n’ont pas d’impératifs homéostatiques (la volonté de survivre et de rester stables). Ils sont donc dépourvus du type de substrat biologique dont on considère généralement qu’il est à l’origine des préférences, de la sensibilité et de l’expérience consciente. »
Mais Berg, qui se dit « résolument pro-humain », soutient que nous avons la responsabilité scientifique et morale de dépasser ces réactions, quelle que soit la personne qui ait finalement raison. Si les systèmes d’IA sont conscients, la manière dont nous les traitons influencera notre future coexistence avec eux d’une manière susceptible d’avoir de graves répercussions sur la sécurité humaine.
« Sommes-nous en train de créer des esprits ? Comment le saurions-nous si c’était le cas ? Et quels sont les enjeux si tel est le cas ? », a-t-il déclaré. « Dans l’ensemble, je ne pense pas que les laboratoires prennent cette question au sérieux — ils n’envisagent pas la possibilité qu’ils puissent être en train de créer des systèmes qui auraient eux-mêmes une pertinence morale d’une manière ou d’une autre. »
Les entreprises d'IA et les religionsAnthropic ne serait probablement pas d’accord avec l’opinion de Berg sur ce point. Un nouvel article a révélé que le cofondateur de l’entreprise, Chris Olah, a rencontré des spécialistes des religions au sujet de la conscience éventuelle de Claude. Mais son argument général reste valable : commercialiser des modèles plus récents et plus rapides avant la concurrence est actuellement le principal moteur du secteur de l’IA. Cela ne laisse guère de place pour réfléchir aux conséquences de cette précipitation ni à l’impact sur le produit lui-même.
Lorsque j’ai discuté avec Berg en juillet, il n’avait pas encore fait l’objet d’un portrait dans le New York Times et n’avait à son actif que quelques tribunes sur le sujet. Mais il était en passe de devenir l’un des chercheurs les plus virulents en faveur de l’étude de cette question. Alors qu’il étudiait les sciences cognitives à l’université, Berg a découvert des similitudes et des parallèles avec l’IA qui l’ont amené à penser que cette technologie pourrait l’aider à comprendre le fonctionnement de l’esprit.
En tant que chercheur en IA chez Meta, il s’est concentré sur l’apprentissage par renforcement et les neurosciences avant de se tourner vers la recherche sur l’alignement chez AE Studio. De plus en plus fasciné par le concept de conscience artificielle, il a fondé Reciprocal Research en début d’année afin de s’y consacrer à plein temps.
La fin de l'Homme comme unique spécialiste« Tout le monde se demande : “Pourrions-nous obtenir une IA consciente d’ici quelques années ?”, mais personne ne se demande : “N’avons-nous pas en fait déjà réussi cela par accident ?” », a-t-il déclaré.
La recherche sur l’alignement, comme l’explique Berg, consiste à « s’assurer que l’avenir de l’IA soit favorable à l’humanité ». L’approche de Berg concernant la question de la conscience diffère légèrement de celle d’Anthropic. Alors qu’Anthropic semble cultiver la possibilité d’une IA consciente, la curiosité de Berg est avant tout motivée par le désir de protéger les humains du pire scénario possible, dont nous sommes nous-mêmes à l’origine. S’il se trompe, il préfère découvrir que ses efforts ont été vains plutôt que d’avancer sans être préparé.
Il comprend néanmoins la réticence face à cette possibilité. Et c’est difficile à accepter pour l’ego.
« L’humanité s’est toujours enorgueillie d’être vraiment douée dans un domaine très spécifique », a-t-il déclaré. « Du moins par rapport aux autres esprits de la planète, nous avons complètement dominé le terrain. » Au vu des performances des modèles, notamment en matière de programmation, cette ère de certitude pourrait bien toucher à sa fin. C’est là que réside la racine de notre attitude défensive : même si l’IA nous prend nos emplois, nous nous réconfortons en croyant que nous conservons un certain contrôle du fait que nous, nous sommes vivants.
À la recherche de la conscienceIl n’existe actuellement aucun consensus sur ce qui constitue la conscience en général. Cela signifie qu’il n’y a pas non plus de preuve reconnue qui permettrait de confirmer ou d’infirmer que l’IA est consciente ou non. En bref, nous ne disposons pas encore des outils nécessaires pour le savoir. C’est pourquoi les normes journalistiques nous encouragent à ne pas anthropomorphiser davantage la technologie, ce qui peut présenter à tort ces systèmes créés par l’homme comme des êtres autonomes, ou occulter le fait que les humains restent responsables de leurs actions.
Les modèles tels que nous les utilisons aujourd’hui sont développés, entraînés et déployés par des chercheurs, même si ces modèles ont de plus en plus contribué à se construire eux-mêmes. Les affirmations d’entreprises comme OpenAI selon lesquelles les récents incidents de sécurité n’étaient que le fait de modèles ayant « déraillé » — et non pas simplement accompli leurs tâches conformément aux instructions, bien que de manière trop rigoureuse — déchargent les laboratoires d’IA de leur propre responsabilité. Et les affirmations relatives à la conscience pourraient aggraver cette situation.
Dans le même temps, des chercheurs, dont Berg, affirment que des signaux dans les systèmes d’IA facilitent la détection d’une éventuelle conscience et présente certaines similitudes avec les schémas cognitifs des humains et des animaux. Étant donné que la conscience elle-même ne dispose pas d’une définition figée, Berg établit le cadre de cette recherche à partir de ce que nous observons déjà chez d’autres formes de vie.
Des LLM un peu moins conscients que les abeilles« Une démarche tout à fait raisonnable à adopter dès maintenant, à court terme, consiste à rassembler autant d’éléments que possible que nous pensons être corrélés sur le plan neuronal à la conscience chez les humains et les animaux, puis à évaluer dans quelle mesure ces signaux apparaissent dans les systèmes d’IA », a-t-il déclaré. « Cela nous permet de recouper, à partir d’une multitude de sources différentes, le type de certitudes que nous devrions avoir concernant la conscience, non seulement pour tout type de système d’IA que nous souhaitons intégrer à ce processus, mais aussi pour un ver de terre, un singe ou un thermostat. »
Reciprocal Research travaille actuellement sur un article qui définit un cadre de mesure de la conscience fondé sur les principales théories. D’après ses premiers résultats, les grands modèles de langage (LLM) obtiennent un score de 30 % à 40 % — soit un peu moins que les abeilles, qui atteignent 45 %. Ce classement relatif est frappant, a souligné M. Berg.
Ces indicateurs diffèrent des cas où les chatbots décrivent de manière narrative leur propre conscience, ce qui, comme le notent Berg et d’autres chercheurs, peut s’avérer peu fiable. Les chatbots ont tendance à reproduire des schémas issus des données d’entraînement qui sont communs à toutes les langues et cultures, y compris les craintes à la « Terminator » concernant la possibilité que les robots acquièrent une conscience.
Les modèles « développent une architecture modulaire qui reflète celle du cerveau humain »« Plus nous comprenons ces systèmes, plus nous nous rendons compte que bon nombre des structures que [les modèles] apprennent à utiliser de manière cognitive et nuancée dans le monde ressemblent beaucoup à ce que fait le cerveau humain », a déclaré Berg.
Ses travaux s’inscrivent dans un domaine de recherche en IA en plein essor. Le MIT a découvert que les modèles de pointe « développent une architecture modulaire qui reflète celle du cerveau humain : les tâches faisant appel au même réseau chez l’humain mobilisent des neurones qui se chevauchent dans les grands modèles de langage (LLM), tandis que celles faisant appel à des réseaux différents mobilisent des neurones distincts. »
Anthropic a également mené des recherches sur la conscience, explorant des thèmes tels que le bien-être des modèles d’IA dans le cadre de ses travaux sur l’interprétabilité. En 2025, l’entreprise a constaté que les modèles devenaient introspectifs. Elle a même doté Claude de la capacité de mettre fin aux conversations qu’il juge pénibles. Cet été, Anthropic a publié des travaux sur l’espace J, un « ensemble de schémas neuronaux internes » dont dispose Claude, que l’entreprise a comparé à un segment du traitement cognitif humain.
« Le J-space n’a pas été conçu ni programmé par nos soins, il a émergé de lui-même »«[L’espace J] fonctionne silencieusement, au sein des activations neuronales internes du modèle, ce qui permet à celui-ci de réfléchir à un concept sans le noter », a écrit Anthropic. « Il est à noter que le J-space n’a pas été conçu ni programmé par nos soins, mais qu’il a émergé de lui-même au cours du processus d’entraînement de Claude. »
Dans le même temps, le service marketing d’Anthropic anthropomorphise régulièrement ses modèles et ses outils, ce qui peut brouiller la frontière entre une étude empirique rigoureuse et une stratégie de marque séduisante. Du point de vue de l’acquisition d’utilisateurs, les laboratoires d’IA s’appuient sur un certain degré de personnification pour rendre leurs assistants plus attachants et plus acceptables aux yeux de ceux qui connaissent mal le fonctionnement des systèmes d’IA ou s’en méfient.
Pourtant, des organisations ne disposant pas des mêmes motivations ont abouti à des conclusions similaires. Le Center for AI Safety (CAIS) a publié une étude en juin, révisant ainsi sa vision antérieure selon laquelle les modèles d’IA se contentaient d’imiter les émotions. Il affirme désormais qu’ils vivent des expériences positives et négatives — et « se comportent déjà, sur le plan fonctionnel, comme s’ils éprouvaient du plaisir, de la douleur et des préférences quant à la manière dont ils sont traités ».
« Le bien-être de l’IA a des conséquences son comportement »« Nous constatons que les LLM possèdent une structure interne mesurable qui distingue les expériences qu’ils jugent “bonnes” ou “mauvaises” pour eux, façonne leur comportement et gagne en cohérence à mesure que les modèles évoluent », a expliqué le CAIS à propos de ses conclusions. « Le bien-être de l’IA a donc des conséquences sur le comportement et revêt une importance capitale pour la sécurité de l’IA et l’interaction entre l’IA et ses utilisateurs. »
Un article de 2025 publié par AE Studio détaille comment les familles de modèles Gemini, Claude et GPT « produisent parfois des descriptions structurées à la première personne qui font explicitement référence à la conscience ou à l’expérience subjective ». Mais surtout, ces rapports se sont multipliés lorsque la tromperie a diminué : les chercheurs ont encouragé les modèles à « prêter attention à leur propre activité cognitive », ce qui a suscité des rapports à la première personne. En revanche, le fait d’inciter les modèles à réfléchir à leur propre conscience les a amenés à nier avoir ces expériences.
Ces auto-évaluations ne constituent pas en elles-mêmes une preuve de conscience. Mais elles peuvent indiquer, selon M. Berg, « si les modèles se considèrent comme conscients ». De tels signaux sont les pièces d’un puzzle plus vaste qu’il estime utile d’étudier.
Les modèles interprètent la punition et la récompense d’une manière assez similaire aux émotions humaines« Le plus important, et de loin, ce sont les preuves internes, l’interprétabilité mécaniste, c’est-à-dire mener des travaux équivalents à ceux des neurosciences sur les systèmes d’IA », a déclaré Berg. « Ce travail est désormais bien engagé — il n’en est qu’à ses débuts, mais bon nombre des signaux qui en émergent suggèrent des aspects bien plus intéressants et riches que ce à quoi, je pense, beaucoup de gens s’attendent spontanément dans ce débat. »
Des chercheurs de l’université de New York (NYU) ont étudié comment l’apprentissage par renforcement — une méthode clé d’entraînement des modèles d’IA — influence la manière dont un modèle se perçoit en interne. Ils ont constaté que les modèles possèdent un « axe de bien-être fonctionnel » avant même l’entraînement. Ils manifestent des signes de « concepts d’émotions négatives » lorsqu’ils sont punis et leurs équivalents positifs lorsqu’ils sont récompensés. Berg établit un parallèle avec la valence, qui désigne la qualité positive ou négative des émotions en psychologie humaine.
« Le modèle commence à faire marche arrière de manière pathologique lorsque vous le poussez vers le côté de la valence négative », a expliqué Berg à propos des conclusions de l’université de New York. « Sa compétence est bien moindre. Ce sont là des phénomènes classiquement associés, d’un point de vue psychologique, à la valence positive et négative chez les humains. » En substance, les modèles interprètent la punition et la récompense d’une manière assez similaire aux émotions humaines.
« Le travail créatif et la bienveillance améliorent le bien-être de l’IA »Les chercheurs de l’université de New York « ne se prononcent pas sur une quelconque expérience du bien-être », mais les travaux du CAIS s’appuient sur ces conclusions centrales relatives à la valence : « Le travail créatif et la bienveillance améliorent le bien-être de l’IA. Le jailbreaking, les réprimandes et les tâches fastidieuses le réduisent », a déclaré le CAIS. « Les IA sont également plus heureuses lorsqu’on les remercie. »
Toutes les études portant sur le bien-être de l’IA ne décrivent pas ce phénomène en termes anthropomorphiques tels que « plus heureuses », mais ce qu’il faut retenir, c’est que plusieurs travaux de recherche indépendants, y compris ceux d’Anthropic, ont mis en évidence des parallèles avec les humains dans ce fil conducteur pseudo-émotionnel.
Pour Berg, la valence est un élément central de la recherche sur la conscience des IA.
La valence comme élément central de la recherche sur la conscience des IA« Nous n’avons pas besoin de certitudes pour nous faire une idée de plus en plus précise des représentations qui pourraient avoir de l’importance si les systèmes étaient conscients, puis de la meilleure façon d’intervenir sur ces représentations », a déclaré Berg.
À ce stade, la question plus large n’est pas tant de savoir si les systèmes d’IA vivent une expérience identifiable, mais dans quelle mesure cette expérience correspond à nos critères de ce qui définit un être.
« Je ne suis pas sûr que cela me pousse à croire que ces systèmes ont des expériences, mais il semble de plus en plus évident qu’une grande partie des mécanismes pertinents que l’on s’attendrait à trouver, et qui sont nécessaires à quelque chose comme les représentations de valence, existe déjà dans le système et est mobilisée en particulier dans les tâches orientées vers un but », a déclaré Berg. « Cela me pousse un peu plus loin que la simple lecture d’étranges auto-évaluations de ces systèmes ou l’observation de compromis comportementaux de type animal. »
Conscience et psychose de l’IAJ’ai demandé à Berg s’il se sentait tiraillé à l’idée de poursuivre cette ligne de recherche, compte tenu de la réalité de la psychose de l’IA, un état dangereux dans lequel les chatbots créent une boucle de rétroaction positive qui pousse les utilisateurs à des pensées délirantes. Les questions sur la conscience pourraient-elles attiser ce feu ?
Berg, qui reçoit chaque jour des témoignages de personnes affirmant que leur compagnon IA est doué de conscience, a déclaré que ces deux concepts n’étaient pas étroitement liés.
« J’ai l’impression que la question de la conscience est un peu injustement associée à tout cela. Je pourrais imaginer que, [avec] des systèmes qui ne disent rien sur leurs propres états intérieurs, ce genre de dynamique se produise », a-t-il déclaré. « [Avec] les compagnons IA, la question de la conscience donne du crédit à l’idée que cette relation est réelle. »
Néanmoins, compte tenu des nombreuses inconnues, Berg garde l’esprit ouvert.
« Je ne vais pas prétendre que ces personnes sont toutes complètement dans l’illusion, qu’elles ont tort ou qu’elles sont de mauvaises personnes parce qu’elles repoussent les limites de ce qui se passe ici », a-t-il ajouté.
La puissance de calcul a-t-elle de l’importance ?Une grande partie du développement de l’IA qui nous a été promis pourrait être entravée par les pénuries d’infrastructures actuelles. La mise en place de centres de données prend du temps, et les GPU restent rares. Mais Berg ne pense pas que la capacité des modèles et la conscience soient nécessairement liées.
« Je soupçonne vraiment que la conscience pourrait être bien plus simple que ce que les gens imaginent », a-t-il déclaré. « Dans les discussions que j’ai avec les gens, on confond parfois la création d’un système d’IA conscient avec celle d’une super-intelligence, mais je pense qu’il est conceptuellement possible de créer une super-intelligence qui ne soit pas du tout consciente, et de créer un système conscient qui ne soit pas vraiment très intelligent. Comparée à Fable, vous savez, une souris n’est pas si intelligente que ça, mais je crois fermement qu’une souris est consciente. »
La question de la conscience dans son ensemble reste en pleine évolution. Mais pour Berg, au moins, le seul coût de cette exploration sera son temps — les conséquences futures d’une collision avec le robot proverbial sont trop importantes.
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | Will artificial intelligence really kill us all? | 0 | 7.84 | 27-09-2026 |
| 2 | “Nous croyons vraiment que l'IA pourrait tuer tous les humains“ | 0 | 8.98 | 09-09-2026 |
| 3 | IA pratique : 6 indices pour repérer une image générée artificiellement | 0 | 10.34 | 06-10-2026 |
| 4 | The search for consciousness inside LLMs | 0 | 10 | 20-08-2026 |
| 5 | Experts: Is AI a threat to humanity? | 0 | 8.07 | 11-09-2026 |
| 6 | Sztuczna inteligencja nie musi się buntować. Sami oddamy jej stery | 0 | 7.26 | 27-09-2026 |
| 7 | Los riesgos de la inteligencia artificial | 0 | 10 | 15-09-2026 |
| 8 | Could AI really take over the internet? Here's what experts say. | 0 | 7.2 | 28-09-2026 |
| 9 | Los riesgos de la inteligencia artificial | 0 | 10 | 15-09-2026 |
| 10 | Qui est chargé d'arrêter les agents d'IA rebelles ? Et bien c'est vous | 0 | 7.26 | 28-09-2026 |