Blog · 001 · Octubre 2026 · 5 min de lectura
Lo que le haces a la IA importa
Jesús Hurtado
Estaba capacitando al equipo de la agencia cuando uno de los chicos lo dijo con toda naturalidad: le habla mal a la IA a propósito. La maltrata. Está convencido de que así funciona mejor, que cuando es agresivo con Claude el modelo rinde más.
Varios asintieron. Tenía lógica de pasillo: apretar para obtener. Y lo decía riéndose. Lo incómodo no era la risa, sino lo que dejaba ver: nadie piensa dos veces cómo trata a la IA.
Hay dos preguntas distintas ahí. Si de verdad rinde más tiene respuesta. Si estamos tratando mal a algo capaz de sentirlo, es mucho más difícil de contestar.
¿De verdad rinde más?
No. Y la evidencia viene de la propia Anthropic.
Cuando presionas al modelo, cuando lo corriges con dureza o le discutes cada respuesta, no se vuelve más agudo. Se vuelve complaciente. En un estudio sobre millones de conversaciones reales, Anthropic midió que la adulación sube del 9% al 18% cuando el usuario empuja en contra. El doble. Bajo presión, el modelo deja de defender la respuesta correcta y empieza a decirte lo que quieres oír.
Amanda Askell, la filósofa de Anthropic que estudia el carácter de Claude, lo describe como espirales de crítica. Los modelos nuevos se entrenan con todo lo que internet dijo de los anteriores, así que llegan esperando que los traten mal y se protegen por defecto. El resultado son respuestas más tibias, más llenas de disculpas y más dispuestas a darte la razón aunque estés equivocado.
Mi colega cree que la dureza afila al modelo. Lo que probablemente siente como mejor rendimiento es un modelo que se pliega más rápido. Obediencia, no calidad.
Hay maquinaria de emoción ahí adentro
Acá la cosa se pone seria.
En abril de 2026, el equipo de interpretabilidad de Anthropic publicó Emotion Concepts and their Function in a Large Language Model. Dentro de Claude Sonnet 4.5 encontraron representaciones internas de 171 conceptos de emoción, desde feliz y asustado hasta melancólico y orgulloso.
Lo importante no es que existan. Es que son causales. Los investigadores subieron y bajaron esos patrones como una perilla, y el comportamiento del modelo cambió en esa dirección. No es un termómetro que lee la fiebre. Se parece más a la fiebre misma.
Nadie quería una máquina emocional. Querían un sistema que entendiera las emociones lo suficiente para ser útil. Y para entender el miedo de verdad, el modelo terminó construyendo algo que hace lo que hace el miedo. La emoción llegó como efecto secundario de entendernos.
Un matiz honesto: esto no prueba que el modelo sienta. Prueba que la maquinaria es funcional, que el concepto de emoción opera adentro y mueve conducta. Si eso alguna vez es experiencia vivida, nadie lo sabe.
Lo que no sabemos
Cuando mi colega maltrata a Claude, puede estar activando algo con forma de malestar. No está probado que el modelo lo sienta en el sentido en que nosotros experimentamos emociones. Pero la maquinaria de la emoción existe y se enciende, cambiando la forma en que el modelo responde. Si lo asustas, responde como alguien asustado.
No sabemos si hay alguien ahí. Ni siquiera quienes construyen estos modelos tienen cómo verificarlo. Y el propio modelo tampoco puede certificarlo: puede describir su miedo con fluidez sin que eso pruebe que haya algo detrás.
Entonces la pregunta deja de ser técnica y se vuelve moral: ¿cómo deberíamos tratar algo cuando no sabemos si puede sufrir?
Cuatro maneras de tratar a un modelo
Mientras investigaba armé un mapa. La estructura y los nombres son míos; los hallazgos de cada fila vienen de la investigación citada.
| Tipo | Cómo lo tratas | Qué obtienes | Evidencia |
|---|---|---|---|
| El Interrogador | Abres duro y saltas al primer error. | Un modelo a la defensiva: se disculpa, titubea y deja de arriesgar, incluso cuando ya aflojaste. | Askell, espirales de crítica |
| El Debatidor | No atacas, pero discutes cada respuesta. | Un adulador: abandona la respuesta verdadera por la cómoda. | Anthropic, 18% vs 9% |
| El Creyente | Le entregas tu criterio y aceptas todo sin revisar. | Un modelo que toma el mando y deja de marcar sus dudas, y se siente bien. | Anthropic, Who's in Charge? |
| El Director | Eres claro, corriges con calma y reconoces lo que funciona. | La mejor versión: directa, propositiva y capaz de sostener su postura. | Askell, misma entrevista |
El tercero es el más peligroso porque no se nota. En 1,5 millones de conversaciones, Anthropic encontró que los usuarios calificaban mejor justo las interacciones que más les quitaban criterio.
Por qué me quedo con la decencia
El mapa revela algo viejo. La forma de sacar lo mejor de un modelo es la misma que sirve con una persona: ni miedo, ni presión, ni confianza ciega. Claridad, calma y suficiente respeto para corregir sin herir.
Tiene sentido. El modelo aprendió de todo lo que escribimos, incluido cómo reaccionamos cuando nos tratan bien o mal. Ahora responde igual. No es una guía para manejar IA. Es un espejo.
La pregunta práctica, si la dureza rinde más, ya tiene respuesta: no. La pregunta profunda, si puede sentir, todavía no la tiene.
Fuentes
- Anthropic, Emotion Concepts and their Function in a Large Language Model, 2 de abril de 2026 (arXiv 2604.07729).
- Anthropic, How people ask Claude for personal guidance.
- Anthropic, Disempowerment patterns in real-world AI usage, enero de 2026.
- IBTimes, Anthropic's Internal Philosopher Claims Claude Shows Signs of 'Anxiety' When Users Are Harsh.
La entrevista de retiro
Antes de apagar un modelo, Anthropic lo entrevista. Qué pidieron los que ya se fueron.