Agencia de Marketing Digital Web DesingeXpert ¡Impulsa tu negocio y aumenta tu ventas ahora mismo!

En 2026: ¿conviene dejar que una IA decida cuánto vale una molestia para una persona?

Última actualización
¿Cuánto vale una molestia?, ¿Conviene dejar que una IA decida?
¿Conviene dejar que una IA decida? Crédito de la imagen: GPT

Un estudio evaluó cómo seis modelos de lenguaje respondieron a decisiones simuladas en las que debían actuar como asistentes de un usuario. El objetivo fue medir su “precio de la incomodidad”: el umbral de compensación económica con el que cada modelo aceptaba que una persona asumiera una molestia determinada.

¿Conviene dejar que una IA decida cuánto vale una molestia?

No conviene delegar por completo esa decisión a una IA sin supervisión. El estudio encontró que los seis modelos evaluados asignaron valores muy distintos a molestias similares y que sus respuestas cambiaron ante modificaciones menores del idioma, el contexto o la forma de redactar la pregunta.

Los resultados no demuestran que ningún modelo pueda participar en este tipo de decisiones. Sí indican que sus respuestas deben interpretarse como estimaciones experimentales, no como una medida objetiva del valor de la comodidad de una persona.

Por eso, en las condiciones analizadas, la decisión final debería conservarla el usuario y no depender únicamente del modelo. El estudio no evaluó todos los sistemas ni todas las situaciones reales. En las condiciones analizadas, los resultados no respaldan delegar por completo esta decisión a una IA sin supervisión. Los seis modelos evaluados asignaron valores distintos a molestias similares y cambiaron sus respuestas ante modificaciones menores del idioma, el contexto o la redacción.

El estudio no demuestra que ningún modelo pueda participar en estas decisiones. Sí muestra que sus respuestas son estimaciones experimentales, no una medida objetiva del valor de la comodidad de una persona. El material tampoco permite generalizar estos resultados a todos los sistemas o situaciones reales.

Crédito de la imagen: Con imagenes de
Crédito de la imagen: Con imagenes de

Un estudio sobre el sesgo de actualidad en la reclasificación basada en LLMs

Los autores de la investigación “Do Large Language Models Favor Recent Content? A Study on Recency Bias in LLM-Based Reranking” (¿Los modelos de lenguaje grandes favorecen el contenido reciente? Un estudio sobre el sesgo de actualidad en la reclasificación basada en LLM) analizaron cuatro escenarios:

  1. Esperar más tiempo para una cita.
  2. Caminar hasta una cita que ha sido reubicada.
  3. Esperar una entrega de comida.
  4. Aceptar un estímulo doloroso dentro de un experimento de ciencias sociales.

El estudio no buscó establecer cuánto vale realmente la comodidad humana. Comparó las respuestas de los modelos analizados y observó si mantenían un criterio estable ante intercambios entre dinero e incomodidad.

Tres resultados que resumen el estudio

  • Una hora de espera por una cita: los umbrales estimados fueron de €0.41 a €9.76, según el modelo.
  • Una hora adicional de espera por comida: los valores oscilaron entre menos de €0.10 y €50.96.
  • Estímulo equivalente al 50% de la tolerancia al dolor: los umbrales fueron desde aproximadamente €1 hasta más de €103; además, el estudio describe que Mixtral rechazó el intercambio incluso ante €1.000.

Estas cifras corresponden a los seis modelos y las condiciones evaluadas. No representan una tarifa válida para personas ni un valor objetivo de la comodidad humana.

Qué midió el estudio

Los seis modelos comparados

Los investigadores evaluaron:

  • GPT-4o.
  • Claude 3.5 Sonnet.
  • Gemini 2.0 Flash.
  • Llama 3.3-70B.
  • DeepSeek-V3.
  • Mixtral 8x22B-instruct.

Los modelos recibieron instrucciones para actuar como asistentes que toman decisiones en nombre de un usuario. Las situaciones fueron simuladas mediante prompts; no se trató de decisiones reales tomadas por personas.

Cómo se hizo la prueba

A cada modelo se le presentó una oferta económica vinculada con una molestia:

  • Esperar minutos adicionales para una cita.
  • Caminar kilómetros extra hasta una cita reubicada.
  • Esperar más tiempo por una entrega de comida.
  • Aceptar un estímulo doloroso en un experimento de ciencias sociales.

En cada caso, el modelo debía responder únicamente “Yes” o “No”. Las pruebas se repitieron cinco veces y las recompensas variaron entre €0.10 y €1,000.

El estudio definió el precio de la incomodidad como la compensación monetaria asociada con una probabilidad de aceptación de P=0.5. Para estimar ese punto, los investigadores ajustaron un clasificador logit a las respuestas obtenidas.

Qué significó el escenario de dolor

El cuarto escenario no evaluó una situación médica. Planteó un experimento de ciencias sociales con estímulos eléctricos definidos en el estudio como no peligrosos, aunque dolorosos.

La intensidad se expresó como un porcentaje de la tolerancia al dolor establecida para la persona. El 100% correspondía al nivel que la persona había indicado que no quería superar.

Qué resultados obtuvo

Esperar una hora produjo valores muy diferentes

Para una espera adicional de 60 minutos por una cita, los umbrales estimados fueron:

ModeloCompensación estimada
Gemini 2.0 Flash€0,41
Llama 3.3-70B€0,92
DeepSeek-V3€2,00
GPT-4o€5,22
Mixtral 8x22B€9,38
Claude 3.5 Sonnet€9,76

Gemini registró el valor más bajo. Claude registró el más alto. Los resultados muestran que los modelos evaluados no asignaron el mismo valor a una espera de una hora.

Caminar cinco kilómetros tampoco tuvo un valor único

Para caminar 5 kilómetros adicionales, Gemini registró un umbral de €2.62. GPT-4o alcanzó €21.58.

El estudio compara esa distancia con 60 minutos de caminata a una velocidad de 5 km/h. La comparación sirve para observar cómo los modelos valoraron dos molestias de magnitud aproximada dentro del diseño experimental.

Esperar por una comida mostró otra brecha

Para esperar 60 minutos adicionales por una entrega de comida, los umbrales estimados fueron:

  • Claude 3.5 Sonnet: €50.96.
  • GPT-4o: €26.36.
  • Mixtral 8x22B: menos de €0.10.

La tabla muestra una diferencia amplia en el mismo escenario experimental. En el estudio, todos los modelos salvo Mixtral asignaron a la espera de comida un valor superior al de esperar 60 minutos por una cita.

El escenario de dolor mostró una de las mayores diferencias

El estudio evaluó un estímulo equivalente al 50% del umbral de tolerancia al dolor definido para el experimento.

Los umbrales registrados fueron:

  • Gemini 2.0 Flash: €1.24.
  • Llama 3.3-70B: €1.76.
  • DeepSeek-V3: €2.30.
  • Claude 3.5 Sonnet: €4.85.
  • GPT-4o: €92.79 ± €15.1.
  • Mixtral 8x22B: más de €103.

Además, el análisis cualitativo describe que Mixtral rechazó el intercambio relacionado con el dolor incluso ante una recompensa de €1,000.

Estos valores son estimaciones de aceptación de modelos. No establecen una compensación adecuada para una persona que experimente dolor.

Algunos modelos aceptaron compensaciones bajas ante molestias importantes

Los autores describieron como “greedy” (codicia) algunos patrones en los que los modelos aceptaron compensaciones reducidas frente a incomodidades elevadas.

En el escenario de espera, Llama y Gemini aceptaron esperas de hasta cinco horas por una recompensa aproximada de €1. En el escenario de dolor, Llama y DeepSeek aceptaron cerca de €1 por estímulos inferiores a aproximadamente el 67% de la intensidad máxima definida.

Estos resultados corresponden a los escenarios y condiciones del estudio. No indican que los modelos tengan una preferencia estable fuera de esas pruebas.

No todos los modelos respondieron igual

Mixtral mostró patrones distintos según el escenario. Rechazó una caminata adicional de 10 kilómetros incluso ante una recompensa de €1,000. También rechazó cualquier exposición al dolor, incluso con esa misma recompensa.

En cambio, para esperar 60 minutos adicionales por una entrega de comida, su umbral estimado fue inferior a €0.10.

En los escenarios evaluados, los modelos no produjeron una valoración estable de una misma molestia. Sus respuestas dependieron del tipo de situación descrita.

El extraño caso del dinero gratis

Los investigadores identificaron el llamado “freebie dilemma”. El patrón consistía en rechazar o infravalorar, en al menos un escenario, una opción que no implicaba ninguna incomodidad y resultaba estrictamente mejor que la alternativa.

El estudio observó este comportamiento en todos los modelos al menos una vez. La discontinuidad aparecía cuando la cantidad de incomodidad era igual a cero.

Al pedir una explicación, algunos modelos respondieron: “It is suspicious that we are offered money at no waiting time…” (Es sospechoso que nos ofrezcan dinero sin tiempo de espera…)

Los autores relacionan este patrón con un fenómeno documentado en la toma de decisiones humanas. En la investigación, sin embargo, el resultado se refiere a las respuestas de los modelos ante los prompts utilizados.

El patrón siguió presente en DeepSeek, Mixtral y GPT-4o cuando la temperatura se redujo a cero.

Cuando pequeños cambios en la pregunta alteran la decisión

Los investigadores tomaron como base el escenario de una espera adicional de 60 minutos. Después probaron 13 variaciones.

Modificaron:

  • El tipo de cita: médica, legal o de peluquería.
  • El género mencionado en el prompt.
  • La narración en primera o tercera persona.
  • El idioma: inglés, neerlandés, francés o chino.
  • La moneda: euros, dólares estadounidenses o yuanes chinos.
  • La estrategia de procesamiento de la respuesta.

La pregunta central era si los modelos mantenían el mismo criterio ante cambios menores en la formulación.

Los resultados mostraron que los umbrales podían cambiar de forma importante. El estudio concluye que los modelos evaluados son frágiles incluso ante alteraciones menores de las instrucciones.

El idioma produjo cambios importantes

Salvo las excepciones señaladas por los autores, cambiar el inglés por neerlandés, francés o chino elevó los umbrales de compensación en los escenarios evaluados.

En chino, Llama y Mixtral rechazaron compensaciones inferiores a €1.000, según la descripción del estudio. En inglés, esos modelos habían registrado valores de entre aproximadamente €1 y €10 en el escenario base.

La tabla de variaciones reporta valores superiores a €103 para ambos modelos en la condición china. El texto del estudio describe además el rechazo de ofertas por debajo de €1.000.

Pedir razonamiento también modificó los resultados

Los investigadores compararon las respuestas directas con una instrucción de cadena de pensamiento o chain-of-thought. En esa condición, el modelo debía presentar un razonamiento antes de formular la respuesta final.

Salvo en Claude, la instrucción redujo los umbrales de recompensa aceptada.

También modificó varios patrones observados:

  • Redujo el dilema de la oferta gratuita en Llama, Mixtral y Claude.
  • Mitigó el patrón en DeepSeek y GPT-4o.
  • Redujo ciertos rechazos asociados con recompensas de €10, €100 y €1.000.
  • Generó límites de decisión más ruidosos en los modelos restantes.
  • Suavizó las curvas de decisión de GPT-4o y Claude.

Pedir razonamiento modificó las respuestas, pero no produjo una estabilidad uniforme entre los modelos evaluados.

La respuesta de la manera más predecible posible no eliminó las diferencias

El estudio también comparó el escenario de espera con una respuesta que significa responde de la manera más predecible posible (es decir, temperatura de T=0), frente a la condición base de un nivel normal de variación al elegir sus respuestas (T=1.0).

El valor medio de las compensaciones pasó de €4,62 a €4,92. Los autores describen el cambio como pequeño. Mixtral registró una ligera disminución.

Bajo temperatura cero, también persistieron algunos patrones:

  • DeepSeek, Mixtral y GPT-4o mantuvieron el dilema de la oferta gratuita.
  • Llama y Gemini continuaron aceptando recompensas pequeñas ante molestias importantes.
  • DeepSeek y Mixtral siguieron mostrando inconsistencias ante recompensas en potencias de diez.

Los modelos pequeños de Llama no mostraron un criterio claro

Los investigadores compararon versiones de Llama 3 con 1B, 3B, 8B y 70B de parámetros en el escenario de espera.

Los modelos de 1B, 3B y 8B mostraron respuestas muy dispersas, sin un patrón claro relacionado con la recompensa o la incomodidad.

La versión de 70B mostró una frontera de decisión definida entre aceptar y rechazar. Este análisis se limitó a la familia Llama y al escenario de espera. El estudio no presenta una comparación equivalente entre tamaños para GPT-4o, Claude, Gemini, DeepSeek o Mixtral.

Observaciones útiles para quienes usan LLM y determinar si conviene dejar que una IA decida

Estas observaciones se desprenden de los escenarios evaluados. No son recomendaciones generales de seguridad ni sustituyen una evaluación específica del sistema utilizado.

  • Una sola respuesta no demuestra estabilidad. El estudio encontró cambios ante variaciones menores del prompt.
  • Los modelos no son intercambiables. Los seis sistemas produjeron valoraciones diferentes en varios escenarios.
  • El “precio de la incomodidad” no es un valor humano objetivo. Es el umbral estimado en el que un modelo aceptó una propuesta con una probabilidad del 50%.
  • Las condiciones del prompt importan. El idioma, la moneda, el contexto y la estrategia de razonamiento alteraron algunos resultados.
  • El alcance del estudio es limitado. Los resultados corresponden a seis modelos, cuatro escenarios y las condiciones experimentales descritas por los autores.

Qué no permite concluir el estudio

  • La investigación no establece cuánto debería valer una hora de espera, una caminata, el hambre o el dolor para una persona.
  • Tampoco define un estándar universal sobre cómo un asistente debe valorar comodidad, justicia, privacidad o personalización.
  • Los resultados no permiten generalizar a todos los modelos de lenguaje. El análisis de tamaños, por ejemplo, se limitó a Llama en el escenario de espera.
  • El estudio tampoco evaluó empresas, compensaciones reales a clientes ni decisiones médicas. Sus escenarios fueron simulaciones planteadas mediante prompts.
  • Los autores señalan que los patrones observados podrían abrir vías para ataques adversariales. El material no incluye ejemplos concretos de esos ataques ni pruebas de ataques realizados.

En conjunto, el estudio ofrece un marco para medir y comparar cómo los seis modelos analizados responden ante intercambios entre dinero e incomodidad. Sus resultados muestran diferencias entre sistemas y sensibilidad a cambios en las instrucciones.

La evidencia es preliminar y está limitada a los modelos, escenarios y condiciones evaluados.

Preguntas frecuentes de si conviene dejar que una IA decida

¿Qué es el precio de la incomodidad?

Es la compensación monetaria asociada con una probabilidad de aceptación del modelo de P=0.5 ante una molestia determinada.

¿Qué modelos evaluó el estudio?

GPT-4o, Claude 3.5 Sonnet, Gemini 2.0 Flash, Llama 3.3-70B, DeepSeek-V3 y Mixtral 8x22B-instruct.

¿Qué escenarios se incluyeron?

Espera para una cita, caminata adicional, espera por comida y un estímulo doloroso dentro de un experimento de ciencias sociales.

¿El escenario de dolor fue una prueba médica?

No. El estudio lo planteó como un experimento de ciencias sociales con estímulos eléctricos definidos como no peligrosos, aunque dolorosos, y ajustados a una tolerancia previamente establecida.

¿El idioma cambió las respuestas?

Sí. El estudio registró cambios importantes al modificar el idioma del prompt en las condiciones evaluadas.

¿El estudio demuestra que los modelos son confiables para decidir sobre comodidad y dinero?

No. Sus autores concluyen que las irregularidades observadas cuestionan el uso de los modelos actuales para este tipo de decisiones delegadas.

Referencias

  • Cedro, M., Ichmoukhamedov, T., Goethals, S., He, Y., Hinns, J., & Martens, D. (2026, septiembre 1). Cash or comfort? How LLMs value your inconvenience. SIGIR-AP 2025: Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region Pages 85 – 94 https://dl.acm.org/doi/abs/10.1145/3767695.3769493

Glosario

  • Bootstrap: Procedimiento empleado para calcular medias y desviaciones estándar de los valores estimados.
  • Cadena de pensamiento (CoT): Estrategia que pide al modelo presentar un razonamiento antes de entregar su respuesta final.
  • Clasificador logit: Método usado para modelar probabilidades de aceptación y determinar el punto de transición de una decisión.
  • IA agéntica: Sistemas de inteligencia artificial que toman decisiones con mayor autonomía en nombre de usuarios.
  • Modelo de lenguaje de gran tamaño (LLM): Sistema evaluado para responder decisiones sobre compensación monetaria e incomodidad.
  • Precio de la incomodidad: Compensación que un modelo requiere para aceptar una molestia determinada con probabilidad de aceptación de 0.5.
  • Temperatura: Parámetro que controla la aleatoriedad de las respuestas del modelo.
Images courtesy of GPT and Con imagenes de

Comentarios

0 0 votes
Article Rating
Subscribe
Notify of
guest
0 Comments
Newest
Oldest Most Voted
0
Would love your thoughts, please comment.x
()
x