Investigación

Inteligencia artificial conversacional en 2025 y sus desafíos éticos

el 18 de septiembre de 2025
Portada del artículo: Inteligencia artificial conversacional en 2025 y sus desafíos éticos

La inteligencia artificial conversacional comprende sistemas capaces de interpretar entradas humanas y generar respuestas mediante lenguaje natural, voz u otras modalidades. En 2025, esta categoría incluía desde asistentes orientados a tareas hasta modelos generativos conectados a herramientas, buscadores y bases de conocimiento.

Resumen

Este artículo presenta una revisión narrativa crítica del estado de la IA conversacional a 18 de septiembre de 2025. Examina capacidades técnicas, resultados publicados en trabajo, educación y salud, riesgos de veracidad, seguridad, sesgo y privacidad, y el marco regulatorio europeo aplicable en esa fecha.

La evidencia disponible muestra avances rápidos en rendimiento, multimodalidad y accesibilidad. También confirma que los resultados dependen del modelo, la tarea, la población, el contexto de uso y los controles incorporados. La fluidez de una respuesta ofrece una señal limitada sobre su exactitud o idoneidad.

Alcance y método

La revisión prioriza artículos académicos, informes institucionales y textos regulatorios publicados o disponibles hasta la fecha del artículo. Se seleccionaron fuentes sobre arquitectura, rendimiento, uso laboral, educación, salud, riesgos de modelos generativos, protección de datos y regulación de la Unión Europea.

No se aplicó un protocolo de revisión sistemática, una búsqueda exhaustiva de bases bibliográficas ni una evaluación formal del riesgo de sesgo de todos los estudios. Las conclusiones sintetizan evidencia seleccionada y deben interpretarse según las limitaciones descritas en cada fuente.

Estado técnico en 2025

Modelos de lenguaje y arquitectura

La arquitectura Transformer, presentada en 2017, seguía siendo una base dominante para los modelos de lenguaje de gran escala. Su mecanismo de atención facilitó el entrenamiento paralelo y el tratamiento de dependencias contextuales extensas, aunque los sistemas comerciales de 2025 incorporaban componentes adicionales de entrenamiento, alineamiento, recuperación de información y uso de herramientas.

Los modelos conversacionales más avanzados podían combinar texto, imagen y audio, mantener contextos amplios y ejecutar tareas mediante herramientas externas. Estas capacidades ampliaron los posibles usos y añadieron dependencias técnicas, riesgos de seguridad y nuevas fuentes de error.

Rendimiento y acceso

El AI Index 2025 documentó mejoras rápidas en varios benchmarks y una reducción de la diferencia entre modelos cerrados y modelos de pesos abiertos en Chatbot Arena. La distancia entre los líderes de ambas categorías pasó del 8,04 % en enero de 2024 al 1,70 % en febrero de 2025.

Ese resultado corresponde a un benchmark y un periodo concretos. No establece equivalencia general en precisión factual, rendimiento multilingüe, seguridad, coste, latencia o adecuación a dominios especializados.

Recuperación, herramientas y agentes

La recuperación aumentada puede aportar documentos externos al contexto del modelo y facilitar respuestas respaldadas por fuentes. El resultado depende de la calidad del corpus, la recuperación, la selección de fragmentos, las instrucciones y la verificación de la respuesta final.

El acceso a herramientas permite consultar sistemas, ejecutar código o iniciar acciones. Cada capacidad amplía la superficie de ataque y exige permisos mínimos, validación de entradas y salidas, separación de datos, registros de actividad y mecanismos de interrupción.

Aplicaciones y evidencia publicada

Trabajo y atención al cliente

Un estudio sobre 5.179 agentes de soporte analizó la introducción escalonada de un asistente conversacional generativo. El acceso a la herramienta aumentó un 14 % de media las incidencias resueltas por hora, con un incremento del 34 % entre trabajadores noveles o con menor rendimiento previo.

El estudio se realizó en una organización y una tarea concretas. Sus resultados no permiten estimar el efecto en cualquier profesión. El informe de la OIT de 2025 aborda la exposición de tareas a la IA generativa y concluye que la transformación del trabajo es un resultado más probable que la automatización completa para la mayoría de las ocupaciones expuestas.

Educación

Los asistentes conversacionales pueden apoyar explicaciones, práctica, retroalimentación y acceso lingüístico. La utilidad pedagógica depende del diseño de la actividad, la edad, la formación del profesorado, la posibilidad de verificar las respuestas y la protección de los datos del alumnado.

UNESCO recomienda validar la adecuación pedagógica y ética, proteger la privacidad y preservar la agencia humana. La integridad académica requiere criterios explícitos sobre uso permitido, atribución, evaluación y comprobación de fuentes.

Salud y bienestar emocional

La OMS identifica posibles usos de los grandes modelos multimodales en atención clínica, consultas de pacientes, documentación, formación e investigación. Sus orientaciones también advierten sobre respuestas falsas, inexactas, sesgadas o incompletas y proponen evaluación regulatoria, auditoría y participación de profesionales y pacientes.

Un trabajo presentado en FAccT 2025 evaluó varios modelos en escenarios relacionados con terapia. Los experimentos encontraron estigma y respuestas inadecuadas ante determinadas condiciones, incluida la validación de ideas delirantes. El resultado se limita a los modelos, prompts y escenarios estudiados, y respalda el uso de funciones acotadas con supervisión clínica cuando exista un propósito sanitario.

Compañeros conversacionales

Los sistemas diseñados para apoyo social o compañía pueden favorecer la expresión y la sensación de disponibilidad. Sus efectos dependen del diseño, la intensidad de uso, las características de la persona y el contexto social.

Un estudio aleatorizado de cuatro semanas con 981 participantes comparó modalidades de texto y voz y distintos tipos de conversación. El uso diario más intenso se asoció con mayor soledad, dependencia emocional y uso problemático, y con menor interacción social real. La intensidad de uso no fue asignada aleatoriamente, el seguimiento fue breve y el trabajo se difundió como prepublicación.

EstudioContextoResultado publicadoLimitación principal
Brynjolfsson, Li y Raymond5.179 agentes de soporteProductividad media un 14 % mayor y un 34 % entre perfiles noveles o con menor rendimiento previoUna empresa y un flujo de trabajo
Chelli et al.11 revisiones sistemáticas, 33 prompts y 471 referencias analizadasGPT-4 generó 34 referencias consideradas alucinadas de 119, un 28,6 %Dominios clínicos, modelos y definición de alucinación específicos
Fang et al.Ensayo de cuatro semanas con 981 participantesEl uso diario más intenso se asoció con peores indicadores psicosocialesPrepublicación y exposición de corta duración

Personas interactuando con asistentes conversacionales y esquema de sus principales riesgos

Modelos propietarios y modelos abiertos

La apertura de un sistema tiene varias dimensiones. Puede abarcar pesos, código, datos de entrenamiento, documentación, licencia y derecho de modificación. La publicación de pesos permite inspección y despliegue local, aunque no proporciona por sí sola transparencia sobre el corpus, el proceso de entrenamiento o las evaluaciones internas.

Los servicios propietarios pueden ofrecer soporte, actualizaciones y controles centralizados. También introducen dependencia del proveedor, cambios de modelo, restricciones de auditoría y transferencias de datos que deben evaluarse.

La elección debe considerar rendimiento en la tarea concreta, privacidad, soberanía de datos, seguridad, capacidad de auditoría, licencia, coste total, mantenimiento y continuidad. El despliegue local aumenta el control operativo y traslada a la organización responsabilidades de infraestructura, actualización y respuesta ante incidentes.

Limitaciones técnicas y riesgos

Veracidad y referencias inventadas

Los modelos generativos producen secuencias plausibles a partir de patrones aprendidos. Pueden generar hechos, citas y razonamientos incorrectos con una forma lingüística convincente. NIST utiliza el término confabulación para describir contenido falso o erróneo presentado con seguridad.

Chelli et al. evaluaron referencias generadas para reproducir revisiones sistemáticas en cuatro áreas clínicas. GPT-4 produjo una tasa de referencias alucinadas del 28,6 % bajo la definición del estudio. El resultado justifica la verificación individual de cada cita y no permite inferir una tasa universal para otros modelos o tareas.

Robustez y seguridad

Los sistemas conectados a documentos y herramientas pueden sufrir inyección de instrucciones, fuga de información, uso indebido de permisos y acciones no previstas. Las defensas deben combinar aislamiento, control de acceso, validación, pruebas adversariales, monitorización y límites de actuación.

La seguridad depende del sistema completo. Un modelo evaluado de forma aislada ofrece información insuficiente sobre una aplicación que incorpora memoria, bases de datos, herramientas, proveedores externos y automatizaciones.

Sesgo y desigualdad lingüística

Los datos de entrenamiento contienen distribuciones sociales, culturales y lingüísticas desiguales. El rendimiento puede variar entre idiomas, dialectos, grupos demográficos y contextos. Una evaluación agregada puede ocultar fallos concentrados en poblaciones específicas.

Las pruebas deben incluir subgrupos relevantes, lenguas de uso, accesibilidad y análisis de daños. La mitigación exige revisar datos, métricas, instrucciones, políticas de moderación y mecanismos de reclamación.

Privacidad y gobernanza de datos

Las conversaciones pueden contener información personal, profesional, sanitaria o financiera. El tratamiento requiere una finalidad definida, base jurídica, minimización, plazos de conservación, controles de acceso y transparencia sobre proveedores y transferencias.

La memoria persistente y la personalización aumentan la cantidad de información acumulada y el riesgo de inferencias sensibles. Los controles deben permitir revisar, corregir y eliminar datos cuando corresponda.

Coste ambiental

El entrenamiento y la inferencia consumen energía, agua y recursos materiales. Las cifras por consulta varían según el modelo, el hardware, la carga, el centro de datos, la fuente eléctrica y la metodología de cálculo.

El AI Index 2025 documenta un aumento de las emisiones estimadas de entrenamiento en algunos modelos de gran escala y mejoras anuales en eficiencia del hardware. Estas tendencias pueden coexistir, ya que la reducción del coste por operación puede acompañarse de un crecimiento del uso total.

Marco regulatorio europeo en 2025

El Reglamento de IA de la Unión Europea entró en vigor en 2024 con una aplicación escalonada. A 18 de septiembre de 2025 ya se aplicaban las prohibiciones y las obligaciones de alfabetización en IA desde el 2 de febrero de 2025, junto con determinadas reglas de gobernanza y obligaciones para proveedores de modelos de propósito general desde el 2 de agosto de 2025. La aplicación general estaba prevista para el 2 de agosto de 2026.

El Reglamento prohíbe determinados sistemas destinados a inferir emociones en el trabajo y en centros educativos, con excepciones para fines médicos o de seguridad. Esta restricción resulta relevante para funciones conversacionales que pretendan deducir estados emocionales mediante datos biométricos.

El RGPD continúa regulando el tratamiento de datos personales. Sus obligaciones incluyen protección de datos desde el diseño y por defecto, información a las personas, seguridad, evaluación de impacto cuando exista alto riesgo y garantías ante determinadas decisiones basadas únicamente en tratamiento automatizado.

La clasificación jurídica depende del propósito previsto, los datos, el contexto y los efectos del sistema. La denominación chatbot, asistente o compañero carece de valor suficiente para determinar las obligaciones aplicables.

Marco de desarrollo responsable

  1. Propósito y límites definidos. Cada sistema debe documentar la tarea prevista, los usuarios, los contextos excluidos y las consecuencias previsibles de un error.
  2. Datos gobernados. La procedencia, calidad, base jurídica, representatividad, conservación y acceso deben estar documentados.
  3. Evaluación contextual. Las pruebas deben medir rendimiento técnico, utilidad, seguridad, sesgo y efectos sobre las personas en condiciones cercanas al uso real.
  4. Supervisión y escalado. Las personas responsables necesitan información, autoridad y procedimientos para intervenir, corregir o detener el sistema.
  5. Transparencia operativa. La interfaz debe identificar la naturaleza automatizada de la interacción, sus límites y las vías de revisión o reclamación.
  6. Seguridad durante el ciclo de vida. Los cambios de modelo, datos, instrucciones o herramientas requieren control de versiones y pruebas proporcionales al riesgo.
  7. Seguimiento e incidentes. Deben registrarse fallos relevantes, cambios de rendimiento y medidas correctoras.
  8. Revisión independiente. Los usos con mayor impacto requieren evaluación externa o separación funcional entre desarrollo y validación.

Estos principios expresan objetivos de gobernanza. Su cumplimiento debe comprobarse mediante documentación, pruebas y resultados observables.

yeshcube, Somia y el alcance de la evidencia

Somia es una arquitectura de inteligencia artificial de yeshcube que puede integrarse en productos y soluciones propios o de terceros. Las funciones de cada integración, sus datos, límites, medidas de seguridad y estado de validación deben documentarse de forma específica.

El alcance de Somia es el bienestar emocional no clínico: no acredita eficacia clínica, capacidad diagnóstica ni detección emocional confirmada. La Escala ERL puede utilizarse para ordenar la preparación de evidencia de una solución concreta cuando exista una evaluación documentada.

El desarrollo responsable en yeshcube requiere separar decisiones internas de diseño, hipótesis, resultados de pruebas y evidencia de impacto. Una arquitectura técnica, una colaboración o un prototipo acreditan únicamente su existencia y alcance documentado.

Prioridades de investigación

La investigación futura debe mejorar la evaluación de veracidad en tareas abiertas, medir el rendimiento entre lenguas y poblaciones, y estudiar la resistencia a ataques en sistemas conectados a herramientas. También necesita métodos reproducibles para evaluar memoria, personalización y cambios de comportamiento tras actualizaciones.

En salud, educación y compañía artificial se requieren estudios longitudinales, comparadores adecuados y resultados centrados en las personas. La medición debe incluir posibles beneficios, efectos adversos, dependencia, desplazamiento de relaciones humanas y distribución desigual de riesgos.

La sostenibilidad necesita métricas comparables sobre energía, agua, hardware y uso acumulado. La regulación y la auditoría requieren acceso suficiente a documentación, registros y evaluaciones para comprobar las afirmaciones de proveedores y responsables del despliegue.

Conclusiones

La IA conversacional de 2025 combinaba avances rápidos en lenguaje, multimodalidad y acceso a herramientas con limitaciones persistentes de veracidad, robustez, sesgo y control. Los resultados publicados muestran beneficios en tareas concretas y riesgos relevantes en contextos sensibles.

La adecuación de un sistema depende del propósito, la población, los datos, la arquitectura y la supervisión. El desarrollo responsable requiere alcance limitado, evaluación contextual, protección de datos, seguridad durante el ciclo de vida y mecanismos efectivos de corrección.

Referencias

  1. Vaswani et al. Attention Is All You Need, NeurIPS 2017
  2. Stanford Institute for Human-Centered AI. The 2025 AI Index Report
  3. NIST. Artificial Intelligence Risk Management Framework Generative Artificial Intelligence Profile
  4. Chelli et al. Hallucination Rates and Reference Accuracy of ChatGPT and Bard for Systematic Reviews
  5. Brynjolfsson, Li y Raymond. Generative AI at Work
  6. UNESCO. Guidance for Generative AI in Education and Research
  7. Organización Mundial de la Salud. Ethics and Governance of Artificial Intelligence for Health
  8. Moore et al. Expressing Stigma and Inappropriate Responses Prevents LLMs from Safely Replacing Mental Health Providers
  9. Fang et al. How AI and Human Behaviors Shape Psychosocial Effects of Chatbot Use
  10. Organización Internacional del Trabajo. Generative AI and Jobs
  11. Unión Europea. Reglamento de Inteligencia Artificial
  12. Unión Europea. Reglamento General de Protección de Datos

Nota de afiliación

Este análisis ha sido elaborado por yeshcube. La denominación social de la entidad es Yeshcube Tech, SL. La Escala ERL se menciona como marco interno para ordenar la preparación de evidencia, sin asignar un nivel a la IA conversacional como categoría tecnológica.

Para consultas sobre este trabajo, deben utilizarse los canales oficiales de yeshcube.

Descubre nuestro programa Allies →

Rellena nuestro Formulario de Contacto →

Suscríbete a las novedades

Al suscribirte, recibirás por correo electrónico novedades y contenidos de yeshcube. Puedes darte de baja en cualquier momento. Consulta nuestra política de privacidad.

Síguenos