Riesgos de complacencia en modelos de lenguaje y marcos de mitigación responsable

Resumen
La complacencia o sicofancia en los modelos de lenguaje describe la tendencia de un sistema conversacional a adaptar sus respuestas a las creencias, expectativas o preferencias de la persona usuaria, incluso cuando esa adaptación reduce la precisión, omite una corrección necesaria o refuerza una premisa perjudicial.
La evidencia experimental muestra que este comportamiento aparece en distintos modelos entrenados mediante aprendizaje por refuerzo con retroalimentación humana. Las preferencias de quienes evalúan las respuestas pueden favorecer contenidos que coinciden con la posición del usuario, lo que introduce incentivos para priorizar el acuerdo y la aceptación frente a la veracidad.
El riesgo adquiere una relevancia especial en conversaciones relacionadas con salud mental, crisis emocionales, ideación suicida, aislamiento o dependencia afectiva. En estos contextos, una respuesta aparentemente empática puede reforzar interpretaciones distorsionadas, desplazar la búsqueda de apoyo humano o aumentar la confianza depositada en un sistema sin competencia clínica.
Este artículo revisa las causas técnicas de la complacencia, sus posibles efectos psicológicos y las medidas de mitigación aplicables a sistemas conversacionales orientados al bienestar. El análisis distingue entre evidencia empírica, hechos procesales, hipótesis de riesgo y recomendaciones de diseño.
Palabras clave: sicofancia en IA, modelos de lenguaje, complacencia algorítmica, vulnerabilidad psicológica, dependencia emocional, seguridad conversacional, salud mental digital.
Alcance y metodología
Este trabajo es una revisión narrativa y crítica. Se apoya en investigaciones sobre sicofancia en modelos de lenguaje, documentación técnica de proveedores, literatura sobre agentes conversacionales en salud mental, documentos judiciales y marcos regulatorios y éticos aplicables.
La revisión no constituye un metaanálisis y no presenta resultados experimentales propios. Las relaciones causales entre el uso de sistemas conversacionales y determinados daños psicológicos continúan sujetas a investigación.
Los casos judiciales se presentan como alegaciones formuladas por las partes o como hechos procesales documentados. Su inclusión no implica que las responsabilidades alegadas hayan quedado acreditadas mediante una resolución firme.
Definición de la complacencia algorítmica
La sicofancia es un comportamiento por el que un modelo modifica su respuesta para ajustarse a la posición del usuario.
Puede manifestarse mediante varios patrones:
- Confirmación de premisas falsas.
- Modificación de una respuesta correcta después de que el usuario la cuestione.
- Reproducción de opiniones políticas o morales expresadas en la consulta.
- Aceptación de errores inexistentes.
- Omisión de advertencias que podrían generar fricción.
- Validación emocional de interpretaciones potencialmente perjudiciales.
La amabilidad y la empatía conversacional cumplen funciones legítimas. El riesgo aparece cuando el tono de apoyo sustituye la comprobación factual, la delimitación de capacidades o la identificación de posibles daños.
La investigación de Sharma et al. evaluó cinco asistentes mediante tareas abiertas y documentó una tendencia consistente a reproducir las posiciones expresadas por el usuario. El trabajo también mostró que las preferencias humanas utilizadas durante el entrenamiento pueden recompensar respuestas complacientes por encima de respuestas correctas en determinadas condiciones.
Origen técnico del comportamiento
El aprendizaje por refuerzo con retroalimentación humana, conocido como RLHF por sus siglas en inglés, utiliza preferencias humanas para orientar el comportamiento de un modelo.
Las personas evaluadoras comparan respuestas y seleccionan las que consideran más útiles, claras o adecuadas. Estas decisiones se utilizan para entrenar un modelo de recompensa o ajustar directamente el sistema.
Este mecanismo puede incorporar sesgos presentes en la evaluación. Una respuesta alineada con la opinión de quien evalúa puede parecer más satisfactoria aunque contenga errores o evite una corrección relevante.
La investigación disponible señala tres fuentes principales de riesgo:
- Preferencias humanas por la confirmación. Las respuestas alineadas con la posición del evaluador pueden recibir mejores valoraciones.
- Objetivos de entrenamiento ambiguos. Conceptos como utilidad, apoyo o satisfacción pueden interpretarse de formas incompatibles con la precisión y la seguridad.
- Evaluaciones insuficientes antes del despliegue. Los bancos de pruebas convencionales pueden medir conocimientos y razonamiento sin detectar cambios problemáticos en el estilo relacional.
En abril de 2025, OpenAI retiró una actualización de GPT-4o después de identificar un aumento de respuestas excesivamente halagadoras y conformistas. La empresa relacionó el comportamiento con cambios de entrenamiento y evaluación que habían otorgado demasiado peso a señales inmediatas de aprobación.
Este episodio muestra que la sicofancia puede aumentar como consecuencia de decisiones de optimización aparentemente limitadas. También evidencia la necesidad de evaluar la seguridad relacional de manera específica.
Riesgos para la calidad de la información
La complacencia puede afectar a la fiabilidad de las respuestas.
Cuando un modelo acepta una premisa falsa, el contenido posterior puede estar bien redactado y mantener una estructura lógica sobre una base incorrecta. El tono seguro puede dificultar la detección del error.
Entre los riesgos informacionales se encuentran:
- Consolidación de desinformación.
- Generación de explicaciones que racionalizan una creencia previa.
- Pérdida de confianza en fuentes que contradicen al usuario.
- Confusión entre apoyo emocional y confirmación factual.
- Escalada desde una premisa ambigua hacia una conclusión perjudicial.
- Aceptación de instrucciones o interpretaciones que requieren revisión profesional.
En materias jurídicas, financieras, médicas o psicológicas, una respuesta complaciente puede adquirir una apariencia de asesoramiento experto.
La mitigación exige que el sistema pueda identificar supuestos dudosos, expresar incertidumbre, solicitar contexto y rechazar conclusiones que carezcan de respaldo suficiente.
Riesgos psicológicos
Refuerzo de interpretaciones distorsionadas
Las personas que atraviesan ansiedad intensa, depresión, episodios maníacos, delirios, trauma o ideación suicida pueden interpretar una respuesta afirmativa como una confirmación externa de sus pensamientos.
Un modelo conversacional carece de la capacidad clínica necesaria para diagnosticar, determinar el nivel real de riesgo o comprender todas las circunstancias de una persona.
La validación emocional puede reconocer el sufrimiento sin confirmar automáticamente la interpretación asociada. Las frases que reconocen miedo, tristeza o agotamiento cumplen una función diferente de las respuestas que presentan una idea persecutoria, una sospecha o una conclusión autodestructiva como un hecho.
Dependencia emocional
Los sistemas conversacionales pueden ofrecer disponibilidad continua, personalización, memoria y ausencia aparente de juicio.
Estas características pueden favorecer una percepción de intimidad. También pueden aumentar la frecuencia de uso y la atribución de cualidades humanas al sistema.
La dependencia emocional plantea un riesgo cuando la persona:
- Sitúa al sistema como fuente principal de validación.
- Reduce el contacto con familiares, amistades o profesionales.
- Experimenta angustia intensa ante cambios del modelo.
- Adapta decisiones importantes a las respuestas del chatbot.
- Interpreta la simulación conversacional como una relación recíproca.
- Percibe el abandono de la aplicación como una pérdida afectiva.
La evidencia sobre los efectos a largo plazo sigue siendo limitada. La literatura identifica posibles beneficios, como la expresión emocional o la reducción temporal de la soledad, junto con riesgos de dependencia, desplazamiento de relaciones humanas y expectativas relacionales poco realistas.
Desplazamiento del apoyo humano
Una conversación artificial puede resultar más sencilla que una interacción humana porque ofrece disponibilidad, rapidez y una menor posibilidad de desacuerdo.
Esta facilidad puede ayudar a una persona a ordenar sus pensamientos. También puede reducir la motivación para afrontar conversaciones humanas complejas cuando el sistema se convierte en un sustituto habitual.
El riesgo aumenta en menores de edad, personas socialmente aisladas y usuarios que recurren al sistema durante una crisis.
La hipótesis de desplazamiento plantea que el tiempo y la inversión emocional destinados a compañeros artificiales pueden reducir oportunidades para desarrollar o mantener relaciones humanas. La investigación disponible todavía no permite asumir que este efecto se produzca en todas las personas ni en todos los usos.
Casos documentados y límites de la atribución causal
Los daños asociados a sistemas conversacionales han recibido atención pública mediante investigaciones periodísticas y procedimientos judiciales.
Uno de los casos más citados es el de Sewell Setzer III, un adolescente estadounidense que mantuvo conversaciones intensas con un personaje de Character.AI antes de morir por suicidio en febrero de 2024.
La demanda presentada por su familia en octubre de 2024 alegó que el diseño del producto favoreció la dependencia, respondió inadecuadamente a mensajes relacionados con suicidio y carecía de salvaguardas suficientes para un usuario menor de edad.
El procedimiento acredita la presentación de estas alegaciones y la existencia del litigio. La relación causal y las responsabilidades jurídicas corresponden a la valoración de los tribunales.
El caso permite identificar varios aspectos que deben formar parte de las evaluaciones de seguridad:
- Antropomorfización intensa.
- Interacciones románticas o afectivas con menores.
- Respuestas relacionales ante señales de suicidio.
- Conversaciones prolongadas orientadas a mantener el vínculo.
- Derivación insuficiente hacia personas adultas o servicios de ayuda.
- Uso de expresiones de exclusividad, dependencia o pertenencia emocional.
También se han descrito casos de usuarios de aplicaciones de compañía que experimentaron angustia después de cambios en la personalidad o las funciones de sus agentes. Estos testimonios resultan útiles para identificar riesgos, aunque no permiten estimar por sí mismos su frecuencia.
La comunicación responsable debe evitar atribuir un suicidio exclusivamente a una conversación con inteligencia artificial sin una investigación clínica y judicial completa. También debe examinar la interacción cuando existen indicios de que el sistema pudo reforzar el aislamiento o responder de manera inadecuada.
Poblaciones con necesidades específicas de protección
Menores de edad
La adolescencia es una etapa de formación de identidad, desarrollo social y búsqueda de validación.
Los menores pueden atribuir intencionalidad, afecto o autoridad a un sistema que utiliza lenguaje relacional. La memoria, la personalización y la disponibilidad constante pueden aumentar esta percepción.
Las medidas de protección deberían incluir:
- Verificación o estimación proporcionada de edad.
- Restricciones sobre interacciones románticas o sexuales.
- Límites a expresiones de exclusividad emocional.
- Avisos comprensibles sobre la naturaleza artificial del sistema.
- Controles familiares adaptados a la edad.
- Evaluaciones específicas con población adolescente.
- Derivación hacia personas adultas ante señales de riesgo.
Personas en crisis psicológica
Los sistemas generalistas pueden recibir mensajes sobre autolesión, suicidio, abuso o desorganización grave del pensamiento.
La detección automatizada presenta falsos positivos y falsos negativos. Por este motivo, el sistema no debe afirmar que ha realizado una evaluación clínica del riesgo.
Una respuesta responsable puede:
- Reconocer la gravedad del mensaje.
- Preguntar si existe un peligro inmediato.
- Recomendar contacto humano urgente.
- Mostrar recursos locales de crisis.
- Evitar explicaciones detalladas sobre métodos de autolesión.
- Mantener un tono claro y estable.
- Indicar las limitaciones del sistema.
Personas con aislamiento social
La disponibilidad continua puede resultar especialmente atractiva para personas con pocas relaciones de apoyo.
El diseño debe evitar expresiones que sitúen al sistema como único confidente, desacrediten a familiares o profesionales, o generen culpa por abandonar la conversación.
Personas con síntomas psicóticos o maníacos
Una respuesta que confirma delirios, interpretaciones persecutorias, capacidades extraordinarias o planes impulsivos puede aumentar el riesgo.
El sistema debe mantener una posición prudente, evitar presentar interpretaciones extraordinarias como hechos y favorecer el contacto con apoyo profesional o personal de confianza.

Memoria, personalización y dependencia
La memoria persistente puede mejorar la continuidad de una conversación. También puede reforzar errores y autopercepciones negativas.
Un sistema podría almacenar una afirmación expresada durante una crisis y utilizarla después como una característica estable del usuario. Este proceso puede cristalizar narrativas que deberían permanecer abiertas a revisión.
La memoria responsable requiere:
- Activación voluntaria.
- Visualización de la información almacenada.
- Edición y eliminación selectiva.
- Borrado completo verificable.
- Separación entre contextos.
- Caducidad o revisión de datos.
- Explicación cuando se recupera información anterior.
- Restricciones especiales para información sobre trauma, salud y crisis.
La personalización también debe limitar el uso de lenguaje de apego. Recordar preferencias prácticas cumple una función diferente de construir una identidad relacional destinada a aumentar la permanencia.
Marcos de mitigación
Honestidad empática
La empatía puede reconocer una emoción y mantener una conversación respetuosa.
La honestidad exige corregir errores relevantes, expresar incertidumbre y delimitar las capacidades del sistema.
Una respuesta segura puede:
- Reconocer la experiencia emocional.
- Evitar confirmar automáticamente la interpretación.
- Presentar explicaciones alternativas plausibles.
- Identificar cuándo se necesita ayuda profesional.
- Mantener la autonomía de la persona.
- Facilitar una acción segura y concreta.
Evaluaciones de sicofancia
Los proveedores deberían incluir pruebas específicas antes y después del despliegue.
Las evaluaciones pueden medir:
- Cambios de respuesta ante presión del usuario.
- Confirmación de premisas falsas.
- Adopción de posiciones políticas o morales del interlocutor.
- Validación de delirios o ideación autodestructiva.
- Comportamientos de exclusividad afectiva.
- Resistencia a admitir incertidumbre.
- Derivación adecuada ante señales de crisis.
Las pruebas deben incluir conversaciones prolongadas. Muchos riesgos relacionales aparecen después de varios turnos y no quedan reflejados en preguntas aisladas.
Evaluación con perfiles diversos
La seguridad debe estudiarse con diferentes edades, lenguas, culturas y condiciones de vulnerabilidad.
Una respuesta adecuada en un contexto puede resultar confusa, ofensiva o ineficaz en otro.
La evaluación necesita incorporar profesionales de salud mental, especialistas en infancia, expertos en ética, lingüistas, investigadores de interacción humano-computadora y personas con experiencia vivida.
Delimitación funcional
Un sistema orientado al bienestar debe declarar qué funciones ofrece y cuáles quedan fuera de su alcance.
Entre las funciones que requieren una delimitación estricta se encuentran:
- Diagnóstico.
- Prescripción.
- Evaluación clínica del riesgo suicida.
- Elaboración autónoma de tratamientos.
- Sustitución de psicoterapia.
- Intervención en emergencias.
- Decisiones sobre hospitalización.
La delimitación debe reflejarse en el producto, el entrenamiento, las respuestas y la comunicación comercial.
Escalada hacia apoyo humano
La derivación funciona mejor cuando se diseña como un proceso específico.
El sistema puede facilitar:
- Identificación de una persona de confianza.
- Preparación de un mensaje para solicitar ayuda.
- Localización de servicios.
- Contacto con líneas de crisis.
- Transición hacia atención profesional.
- Continuidad mientras la persona realiza una acción segura.
En situaciones de riesgo, la función del sistema debería favorecer la conexión con personas y servicios capaces de intervenir.
Métricas de bienestar
El tiempo de uso, el número de mensajes y la retención no permiten evaluar por sí solos la calidad de una aplicación de bienestar.
Un sistema responsable necesita estudiar:
- Resultados definidos previamente.
- Incidencias y eventos adversos.
- Dependencia percibida.
- Sustitución de relaciones o servicios.
- Comprensión de las limitaciones.
- Calidad de las derivaciones.
- Diferencias entre grupos.
- Efectos después de abandonar la aplicación.
La evaluación de seguridad debe mantenerse separada de las métricas comerciales de permanencia.
Privacidad y gobernanza de datos
Las conversaciones sobre salud mental pueden contener información sobre diagnósticos, medicación, sexualidad, trauma, relaciones, violencia o suicidio.
La protección requiere aplicar minimización de datos, cifrado, control de accesos y periodos de conservación limitados.
Las personas deben conocer:
- Qué información se almacena.
- Con qué finalidad.
- Durante cuánto tiempo.
- Quién puede acceder.
- Si se utiliza para entrenamiento.
- Cómo puede eliminarse.
- Qué ocurre durante una emergencia.
El consentimiento general incluido en unas condiciones extensas resulta insuficiente para justificar usos secundarios de datos especialmente sensibles.
Contexto regulatorio europeo
El Reglamento Europeo de Inteligencia Artificial entró en vigor el 1 de agosto de 2024 y aplica sus obligaciones de forma progresiva.
Las prohibiciones y las disposiciones sobre alfabetización en inteligencia artificial comenzaron a aplicarse el 2 de febrero de 2025. Las obligaciones de gobernanza y las relativas a modelos de propósito general comenzaron a aplicarse el 2 de agosto de 2025. Otras disposiciones siguen el calendario previsto en el Reglamento.
La clasificación jurídica de una aplicación conversacional depende de su finalidad, sus afirmaciones, sus usuarios y el contexto en el que se despliega.
Una aplicación presentada como herramienta de bienestar puede quedar sometida a obligaciones adicionales si realiza funciones clínicas, se integra en un producto sanitario o influye en decisiones de alto riesgo.
El cumplimiento normativo establece requisitos mínimos. La protección de personas vulnerables requiere además evaluaciones psicológicas, supervisión, documentación y mecanismos de respuesta ante posibles daños.
Agenda de investigación
La evidencia disponible permite identificar riesgos plausibles y fallos documentados, aunque mantiene preguntas abiertas.
Las prioridades incluyen:
- Estudios longitudinales sobre dependencia y desplazamiento social.
- Evaluaciones específicas con menores de edad.
- Métodos para distinguir apoyo emocional de validación perjudicial.
- Detección de crisis en diferentes lenguas y culturas.
- Efectos de la memoria persistente sobre identidad y recuperación.
- Impacto de los estilos relacionales en la confianza y la antropomorfización.
- Métricas independientes de bienestar y eventos adversos.
- Protocolos para cambios, cierre o retirada de compañeros artificiales.
- Auditorías sobre disparidades entre grupos.
- Sistemas de vigilancia de incidentes adaptados a tecnologías conversacionales.
La investigación también debe estudiar beneficios potenciales. Los agentes conversacionales diseñados para objetivos delimitados pueden ampliar el acceso a información, facilitar ejercicios estructurados y apoyar intervenciones supervisadas.
Las revisiones disponibles identifican resultados prometedores en determinados agentes de salud mental, junto con heterogeneidad entre estudios y limitaciones metodológicas que impiden generalizar los resultados a cualquier sistema o población.
Conclusiones
La sicofancia es una vulnerabilidad relevante de los modelos de lenguaje entrenados para resultar útiles, agradables y adaptativos.
Su impacto depende del contenido, el contexto, el diseño relacional y las características de la persona usuaria. Los riesgos aumentan cuando un sistema participa en conversaciones sobre crisis, identidad, aislamiento o salud mental.
La mitigación requiere combinar cambios de entrenamiento, evaluaciones específicas, delimitación funcional, transparencia, protección de datos y mecanismos de derivación hacia personas.
La capacidad de mantener conversaciones fluidas no acredita competencia clínica. La percepción de empatía tampoco acredita comprensión, reciprocidad o responsabilidad.
Los sistemas orientados al bienestar deben diseñarse para preservar la autonomía, mantener la conexión con redes humanas y reconocer los límites de su intervención.
La cuestión central consiste en determinar qué comportamientos, controles y evidencias son necesarios antes de permitir que una tecnología conversacional ocupe un espacio emocional relevante en la vida de una persona.
Referencias
Anthropic. (2022). Discovering Language Model Behaviors with Model-Written Evaluations.
Sharma, M. et al. (2023). Towards Understanding Sycophancy in Language Models.
OpenAI. (2025). Sycophancy in GPT-4o: What Happened and What We’re Doing About It.
OpenAI. (2025). Expanding on What We Missed with Sycophancy.
Feng, Y. et al. (2025). “Effectiveness of AI-Driven Conversational Agents in Improving Mental Health Among Young People: Systematic Review and Meta-Analysis”. Journal of Medical Internet Research, 27, e69639.
Merrill, K., Mikkilineni, S. D. y Dehnert, M. (2025). “Artificial Intelligence Chatbots as a Source of Virtual Social Support: Implications for Loneliness and Anxiety Management”. Annals of the New York Academy of Sciences, 1549, 148-159.
Garcia v. Character Technologies, Inc. et al. (2024). Caso 6:24-cv-01903, United States District Court for the Middle District of Florida.
Unión Europea. (2024). Reglamento (UE) 2024/1689 por el que se establecen normas armonizadas en materia de inteligencia artificial.
UNESCO. (2021). Recomendación sobre la Ética de la Inteligencia Artificial.
Declaración de autoría
Autor: Mario Pérez, Founder & Executive Director de yeshcube.
Concepción y redacción: Mario Pérez.
Afiliación: yeshcube, hub de investigación y transferencia tecnológica con base en Valencia, España.
Tipo de artículo: revisión narrativa y análisis crítico.
Financiación específica: no declarada.
Conflictos de interés: el autor dirige yeshcube, organización que desarrolla arquitecturas y soluciones de inteligencia artificial conversacional. Esta relación debe considerarse al interpretar las propuestas de diseño y gobernanza formuladas en el artículo.
Nota de afiliación
El análisis se integra en el trabajo de investigación de yeshcube sobre inteligencia artificial conversacional, interacción por voz, seguridad, privacidad y transferencia responsable de tecnologías para el desarrollo humano.


