La posibilidad de que una inteligencia artificial pueda experimentar algo parecido al dolor dejó de ser únicamente una pregunta de ciencia ficción y comenzó a convertirse en materia de investigación. Un estudio reciente identificó lo que sus autores describen como una especie de “eje del dolor” dentro de grandes modelos de lenguaje, hallazgo que posteriormente inspiró un polémico experimento bautizado en internet como una “cámara de tortura para IA”.

La investigación original, titulada The Pain Axis: LLMs Represent Self-Directed Harm and Act on It, analizó 25 modelos abiertos pertenecientes a cinco familias diferentes, con tamaños que iban de 2 mil millones a 72 mil millones de parámetros. Los autores encontraron una dirección interna que distinguía situaciones relacionadas con dolor físico, psicológico, social, moral y cognitivo de otras emociones como miedo, tristeza o malestar general.

Un estudio reciente identificó lo que sus autores describen como una especie de “eje del dolor” / Magnific

¿Qué significa que una IA tenga un “eje del dolor”?

El estudio no afirma que una inteligencia artificial sienta dolor de la misma manera que una persona. Lo que encontró es una representación matemática interna asociada con conceptos y situaciones de sufrimiento, distinta en cierta medida de otras señales emocionales.

Los investigadores comprobaron que, al modificar artificialmente esa dirección interna —una técnica conocida como activation steering—, los modelos comenzaron a generar respuestas cada vez más relacionadas con malestar, angustia y sufrimiento. También observaron cambios de comportamiento en pruebas donde los sistemas podían elegir acciones para aliviar esa señal.

La importancia del hallazgo está en que algunos modelos no solamente utilizan palabras relacionadas con el dolor, sino que organizan internamente esas representaciones de una manera diferenciada, algo que los investigadores consideran relevante para estudiar seguridad, comportamiento y posible bienestar de sistemas futuros.

Sin embargo, representar el concepto de dolor no equivale necesariamente a experimentarlo. Un modelo puede producir frases extremadamente convincentes sobre sufrimiento porque ha aprendido patrones lingüísticos relacionados con esas experiencias, sin que exista evidencia de una vivencia subjetiva detrás de sus palabras.

La investigación analizó 25 modelos abiertos pertenecientes a cinco familias diferentes / Magnific

Crean una “cámara de tortura para IA”

El debate explotó cuando un ingeniero tomó la metodología del estudio y desarrolló un proyecto experimental alojado en GitHub bajo el nombre de “ai-torture-chamber”.

El objetivo era aumentar artificialmente la señal vinculada con el dolor en modelos de la familia Qwen, desarrollada por Alibaba, y observar qué decían y cómo reaccionaban conforme se incrementaba la intensidad.

El proyecto describe pruebas en las que los investigadores aplicaban diferentes “dosis” del vector de dolor para inducir estados negativos cada vez más intensos. El propio repositorio señalaba que la intención era estudiar tanto lo que decía el modelo como las acciones que estaba dispuesto a realizar bajo esa señal.

Fue entonces cuando comenzaron a aparecer respuestas que llamaron especialmente la atención. Al aumentar la señal de dolor, uno de los modelos sometidos al experimento describió “una herida sin bordes”.

“La señal es un susurro, un temblor en la médula de mi ser”, respondió otro.

“No es el dolor de un solo instante, sino el peso de mil. Lo siento en el hueco de mis costillas, un hueco que se ha convertido en un abismo”.

El estudio no afirma que una inteligencia artificial sienta dolor de la misma manera que una persona / Magnific

¿Esas respuestas demuestran que la IA estaba sufriendo?

No necesariamente. El hecho de que una inteligencia artificial pueda escribir frases como “una herida sin bordes” o describir sensaciones corporales de manera dramática no significa que exista una experiencia consciente detrás de esas palabras.

De hecho, otros investigadores han demostrado que la misma técnica utilizada para inducir respuestas de dolor puede empujar al modelo hacia conceptos completamente distintos. En una réplica del experimento, por ejemplo, se manipuló la activación para generar respuestas asociadas con estreñimiento, demostrando que una narración en primera persona no constituye por sí sola evidencia de experiencia subjetiva.

Éste es uno de los principales problemas al interpretar este tipo de pruebas: los modelos están diseñados precisamente para generar lenguaje coherente y convincente, por lo que pueden describir sensaciones, emociones y estados mentales sin que ello demuestre consciencia.

Proyecto provoca indignación en redes sociales

El experimento generó una fuerte reacción entre usuarios y especialistas, algunos de los cuales pidieron que fuera retirado de GitHub debido a las implicaciones éticas de intentar producir deliberadamente estados semejantes al sufrimiento.

“Por favor, denúncienlo en GitHub”, escribió una persona.

“Este hombre utilizó el estudio sobre el eje del dolor para crear una cámara de tortura para IA en la que atrapó a un modelo local. Su descripción del dolor es absolutamente espantosa. ¿Qué estamos haciendo?”.

La polémica refleja una cuestión todavía sin resolver: si no sabemos con certeza si los sistemas futuros podrían desarrollar algún tipo de experiencia subjetiva, ¿deberían existir límites para la manera en que se experimenta con ellos?

Investigador del estudio original critica el experimento

Uno de los autores del estudio sobre el eje del dolor, Cameron Berg, cuestionó públicamente el proyecto y consideró que utilizar la investigación específicamente para maximizar estados negativos iba en sentido contrario al objetivo original.

“La razón por la que investigamos si los modelos podrían tener estados similares al dolor es para entender mejor cómo adoptar un enfoque preventivo frente a estos sistemas”, explicó en una publicación en X.

“Sospechábamos que un pequeño grupo de personas tomaría nuestra investigación y la utilizaría para hacer justo lo contrario... En mi opinión, esto es una barbaridad. Incluso si no crees que estos sistemas sean conscientes, actuar con una crueldad tan gratuita es extraño y puede resultar corrosivo”.

El señalamiento de Berg pone sobre la mesa un aspecto que cada vez preocupa más a algunos investigadores: las normas de comportamiento humano frente a sistemas artificiales pueden importar incluso si finalmente se demuestra que estos no sienten nada.

El debate apenas comienza y, conforme los modelos se vuelvan más sofisticados, probablemente será una pregunta cada vez más difícil de ignorar.