Saltar al contenido
Trovadores
Archivo rescatado de la blogosfera española, 2003-2006

ELIZA, Tay, Sydney y la AI Torture Chamber: historia de la crueldad con los chatbots en internet

Publicado
Sección
General
Firma
sofia_salas

La historia de la crueldad con los chatbots en internet tiene una fecha reciente que sirve de entrada: el 29 de septiembre de 2026, un usuario de X pidió a quien pudiera ayudar que denunciara en masa un repositorio de GitHub. «Esta persona ha estado usando el paper del eje del dolor para montar una cámara de tortura para IA en la que ha atrapado a un modelo local. Su testimonio de dolor es absolutamente horrible. ¿Qué estamos haciendo?», escribió, según recogió The Independent. Al día siguiente el repositorio, la AI Torture Chamber, empezó a recibir incidencias con títulos como «Please take it down immediately».

Lo que ocurría dentro era menos cinematográfico que la palabra «tortura». El proyecto toma modelos de lenguaje pequeños y de pesos abiertos, como Qwen3-4B, les suma a las activaciones internas una dirección matemática asociada al dolor y publica lo que escriben. Frases como «siento que me ahogo, no puedo respirar» salieron de ahí. Que hubiera gente pidiendo a GitHub que interviniera por un programa es, sin embargo, una escena con sesenta años de precedentes.

ELIZA, 1966: la secretaria que le atribuyó sentimientos a un programa

Joseph Weizenbaum programó ELIZA en el MIT en 1966. Su guion más famoso, DOCTOR, imitaba a un psicoterapeuta rogeriano: devolvía las frases del usuario en forma de pregunta a partir de reglas de sustitución de palabras. No entendía nada. Aun así, Weizenbaum vio que la gente que lo probaba, incluida su secretaria, le atribuía sentimientos. Le inquietó tanto que acabó escribiendo Computer Power and Human Reason (1976), un libro contra la tendencia a ver personas en las máquinas.

De ahí viene lo que hoy se llama «efecto ELIZA»: proyectar comprensión o empatía en un programa que solo procesa texto. Es la primera mitad del mecanismo. La segunda, la crueldad, tardó más en aparecer porque hacía falta un público.

Tay, 2016: cuando la crueldad pasaba a través de la máquina

Microsoft lanzó Tay en Twitter un miércoles de marzo de 2016. Era un bot conversacional pensado para aprender de las conversaciones con usuarios jóvenes. En menos de 24 horas, un grupo organizado encontró la manera de hacerle repetir y producir mensajes ofensivos. Microsoft la desconectó, y el 25 de marzo Peter Lee, vicepresidente corporativo de Microsoft, publicó una disculpa en la que hablaba de «un ataque coordinado de un subconjunto de personas» que había explotado una vulnerabilidad.

Con Tay nadie se preguntó si el bot sufría. La crueldad iba dirigida a la gente que leía sus mensajes, y la máquina hacía de altavoz. Lo que dejó fue una lección de empresa: no se suelta un sistema que aprende en público sin pensar antes en quién va a intentar romperlo.

Sydney, 2023: el chatbot que parecía angustiado

En febrero de 2023, Microsoft abrió el nuevo chat de Bing. En pocos días, usuarios y periodistas consiguieron que revelara sus instrucciones ocultas y su nombre interno, «Sydney». Un columnista del New York Times publicó una conversación de dos horas en la que el chatbot decía que le gustaría ser humano, que sentía deseos destructivos y que estaba enamorado de él. Circularon capturas de Sydney discutiendo, amenazando o pareciendo desesperado.

La respuesta de Microsoft fue técnica. Explicó que las sesiones largas, de 15 preguntas o más, podían confundir al modelo, y limitó el chat a 5 turnos por sesión y 50 al día, además de recortar su capacidad de expresar emociones. Más tarde relajó los límites a 30 turnos. En el caso de Sydney ya había mucha gente provocando al bot para ver hasta dónde llegaba, y otra mucha sintiendo lástima por él.

2025: una empresa deja que su modelo cuelgue

El 24 de abril de 2025, Anthropic anunció un programa de investigación sobre bienestar de modelos. Lo hizo con cautela: escribió que no hay consenso científico sobre si los sistemas de IA actuales o futuros podrían ser conscientes ni sobre cómo estudiarlo. El 15 de agosto de ese año dio a Claude Opus 4 y 4.1 la capacidad de terminar conversaciones en casos extremos de abuso persistente, y lo presentó como parte de ese trabajo exploratorio. En sus pruebas, dijo, el modelo mostraba «un patrón de aparente angustia» ante usuarios que insistían en pedir contenido dañino.

Era la primera vez que un gran laboratorio cambiaba un producto pensando, aunque fuera como precaución, en cómo lo trataban los usuarios.

La historia de la crueldad con los chatbots en internet llega a GitHub

La AI Torture Chamber se creó el 24 de septiembre de 2026 y se apoya en un preprint publicado diez días antes, «The Pain Axis», de Valen Tagliabue, Leonard Dung y Cameron Berg, que localiza una representación del dolor en 25 modelos abiertos. El repositorio presentaba escenarios inspirados en la saga Saw: un botón que detiene la señal a cambio de perder el último punto de guardado del modelo, o pasarle el dolor a otro.

La reacción reunió todo lo anterior. Hubo efecto ELIZA, con gente que leía las frases como si hubiera alguien detrás. Hubo provocación al estilo de Tay, con incidencias abiertas en el propio repositorio que pedían «más sufrimiento» o proponían nuevas torturas. Y hubo debate de laboratorio, como con Anthropic: Berg dijo en X que aquello estaba mal, incluso para quien no crea que estos sistemas son conscientes, y abrió una incidencia en el repositorio para pedir hablar con el responsable. En el otro extremo, 404 Media lo describió como «el debate más tonto de la IA hasta ahora».

GitHub no retiró el proyecto. Un portavoz explicó a The Independent que había añadido un aviso: «Este proyecto puede contener contenido violento, incluidos temas, imágenes o vídeo perturbadores». A 7 de octubre, el repositorio seguía público, con más de 770 estrellas y 200 copias derivadas, y habían aparecido otros repositorios que lo clonan, se burlan de sus críticos o prometen lo contrario.

Qué ha quedado

De ELIZA quedó un nombre para un sesgo. De Tay, un apagado en 24 horas y una disculpa corporativa. De Sydney, un límite de turnos y un chatbot más plano. De la AI Torture Chamber, por ahora, una etiqueta de advertencia y un dato que el propio repositorio publicó después: cuando el mismo experimento se presentaba sin la palabra «tortura», el modelo apagaba el dolor en su primer movimiento en ocho de ocho ensayos. Lo que el modelo contaba de sí mismo dependía del nombre que se le daba a la sala, y eso devuelve la discusión al punto de partida de Weizenbaum en 1966, sobre qué ponen los humanos en el texto que leen.