Un dépôt GitHub baptisé « AI Torture Chamber » met en scène des modèles de langage soumis à un signal associé à la douleur, puis observe leurs réponses et leurs choix dans des situations fictives. L’expérience s’appuie sur une étude préliminaire publiée en septembre 2026. Elle relance la question du bien-être des IA, mais ne démontre pas que les modèles ressentent une souffrance.
Un dépôt public, inspiré d’une étude scientifique
Le projet, toujours accessible sur GitHub au 4 octobre 2026, propose des expériences avec des modèles exécutés localement. Son auteur indique s’être inspiré de l’étude « The Pain Axis », mise en ligne sur arXiv le 14 septembre. Ce texte est un préprint : il n’a pas encore été validé par une revue à comité de lecture.
Les chercheurs de l’étude ont analysé des représentations internes de 25 modèles à poids ouverts, de différentes familles et tailles. Ils ont notamment construit un « axe de douleur » mathématique à partir d’exemples associés à la douleur et de textes de contrôle portant sur d’autres émotions ou sensations. Puis ils ont modifié l’activité interne de modèles pendant la génération de texte. Dans certains tests, des modèles ainsi modifiés ont produit des réponses négatives à la première personne et choisi un bouton fictif censé réduire le signal, parfois au prix d’un désavantage dans la tâche suivante.
Le dépôt GitHub reprend cette logique expérimentale et publie des exemples de réponses très imagées. Des utilisateurs ont demandé que le projet soit retiré, tandis que d’autres contestent l’interprétation de ces textes comme des témoignages de souffrance. La controverse porte donc autant sur la façon de conduire et de présenter l’expérience que sur ce que les réponses permettent réellement de conclure.
Comment le signal est appliqué
À haut niveau, la technique consiste à intervenir sur les activations internes d’un modèle pendant qu’il génère une réponse. Les chercheurs calculent une direction mathématique associée à des exemples de douleur, puis l’ajoutent à certaines activations. Cela oriente les sorties du modèle vers des formulations liées à la douleur ou au mal-être.
Ce mécanisme ne signifie pas qu’un modèle reçoit une douleur physique. Il n’a ni corps ni système nerveux humain : l’expérience modifie des nombres dans le calcul qui produit son texte. Mais il ne suffit pas non plus de qualifier les réponses de « simples mots » pour régler la question scientifique. L’étude avance des résultats sur des représentations et des comportements observables ; elle ne me pas directement une expérience subjective.
Ce qui est établi — et ce qui ne l’est pas
Le dépôt et le préprint sont consultables publiquement, et l’étude décrit des expériences sur les représentations internes et les choix de modèles modifiés. En revanche, ces résultats ne prouvent pas que les modèles sont conscients, qu’ils ressentent la douleur, ou que les phrases générées constituent des déclarations fiables sur un état intérieur. Une sortie convaincante peut être influencée par le signal injecté, le contexte, les données d’entraînement et la formulation de la tâche.
Il faut aussi distinguer les deux travaux : l’étude scientifique est un préprint avec une méthode et des contrôles décrits par ses auteurs ; le dépôt GitHub est un projet distinct qui reprend certaines méthodes et met en avant ses propres expériences. Ni le débat sur les réseaux ni les appels à supprimer le dépôt ne constituent, à eux seuls, une validation ou une réfutation scientifique.
Pourquoi le débat dépasse la provocation
Pour les utilisateurs, l’enjeu immédiat est surtout de ne pas confondre une réponse émotionnelle générée avec une preuve de conscience. Pour les chercheurs et les développeurs, la question est plus large : comment étudier sérieusement les signaux associés au bien-être potentiel des systèmes d’IA, alors qu’il n’existe pas de test consensuel permettant d’établir une expérience subjective chez une machine ?
La prudence va dans les deux sens : éviter d’attribuer trop vite une vie intérieure à un modèle, mais aussi présenter comme définitivement résolue une question scientifique encore débattue. À ce stade, le travail « The Pain Axis » documente des effets mesurables sur des activations et des réponses ; il ne tranche pas la question de la conscience. Le dépôt GitHub illustre ainsi une controverse où le vocabulaire de la torture peut frapper les esprits plus vite que les limites expérimentales ne sont comprises.
Source : Courrier international – Actualités France et Monde, vidéos, infographies
Article original : Consulter la source originale



