Inteligencia artificial conversacional en 2025 y sus desafíos éticos

La inteligencia artificial conversacional comprende sistemas capaces de interpretar entradas humanas y generar respuestas mediante lenguaje natural, voz u otras modalidades. En 2025, esta categoría incluía desde asistentes orientados a tareas hasta modelos generativos conectados a herramientas, buscadores y bases de conocimiento.
Resumen
Este artículo presenta una revisión narrativa crítica del estado de la IA conversacional a 18 de septiembre de 2025. Examina capacidades técnicas, resultados publicados en trabajo, educación y salud, riesgos de veracidad, seguridad, sesgo y privacidad, y el marco regulatorio europeo aplicable en esa fecha.
La evidencia disponible muestra avances rápidos en rendimiento, multimodalidad y accesibilidad. También confirma que los resultados dependen del modelo, la tarea, la población, el contexto de uso y los controles incorporados. La fluidez de una respuesta ofrece una señal limitada sobre su exactitud o idoneidad.
Alcance y método
La revisión prioriza artículos académicos, informes institucionales y textos regulatorios publicados o disponibles hasta la fecha del artículo. Se seleccionaron fuentes sobre arquitectura, rendimiento, uso laboral, educación, salud, riesgos de modelos generativos, protección de datos y regulación de la Unión Europea.
No se aplicó un protocolo de revisión sistemática, una búsqueda exhaustiva de bases bibliográficas ni una evaluación formal del riesgo de sesgo de todos los estudios. Las conclusiones sintetizan evidencia seleccionada y deben interpretarse según las limitaciones descritas en cada fuente.
Estado técnico en 2025
Modelos de lenguaje y arquitectura
La arquitectura Transformer, presentada en 2017, seguía siendo una base dominante para los modelos de lenguaje de gran escala. Su mecanismo de atención facilitó el entrenamiento paralelo y el tratamiento de dependencias contextuales extensas, aunque los sistemas comerciales de 2025 incorporaban componentes adicionales de entrenamiento, alineamiento, recuperación de información y uso de herramientas.
Los modelos conversacionales más avanzados podían combinar texto, imagen y audio, mantener contextos amplios y ejecutar tareas mediante herramientas externas. Estas capacidades ampliaron los posibles usos y añadieron dependencias técnicas, riesgos de seguridad y nuevas fuentes de error.
Rendimiento y acceso
El AI Index 2025 documentó mejoras rápidas en varios benchmarks y una reducción de la diferencia entre modelos cerrados y modelos de pesos abiertos en Chatbot Arena. La distancia entre los líderes de ambas categorías pasó del 8,04 % en enero de 2024 al 1,70 % en febrero de 2025.
Ese resultado corresponde a un benchmark y un periodo concretos. No establece equivalencia general en precisión factual, rendimiento multilingüe, seguridad, coste, latencia o adecuación a dominios especializados.
Recuperación, herramientas y agentes
La recuperación aumentada puede aportar documentos externos al contexto del modelo y facilitar respuestas respaldadas por fuentes. El resultado depende de la calidad del corpus, la recuperación, la selección de fragmentos, las instrucciones y la verificación de la respuesta final.
El acceso a herramientas permite consultar sistemas, ejecutar código o iniciar acciones. Cada capacidad amplía la superficie de ataque y exige permisos mínimos, validación de entradas y salidas, separación de datos, registros de actividad y mecanismos de interrupción.
Aplicaciones y evidencia publicada
Trabajo y atención al cliente
Un estudio sobre 5.179 agentes de soporte analizó la introducción escalonada de un asistente conversacional generativo. El acceso a la herramienta aumentó un 14 % de media las incidencias resueltas por hora, con un incremento del 34 % entre trabajadores noveles o con menor rendimiento previo.
El estudio se realizó en una organización y una tarea concretas. Sus resultados no permiten estimar el efecto en cualquier profesión. El informe de la OIT de 2025 aborda la exposición de tareas a la IA generativa y concluye que la transformación del trabajo es un resultado más probable que la automatización completa para la mayoría de las ocupaciones expuestas.
Educación
Los asistentes conversacionales pueden apoyar explicaciones, práctica, retroalimentación y acceso lingüístico. La utilidad pedagógica depende del diseño de la actividad, la edad, la formación del profesorado, la posibilidad de verificar las respuestas y la protección de los datos del alumnado.
UNESCO recomienda validar la adecuación pedagógica y ética, proteger la privacidad y preservar la agencia humana. La integridad académica requiere criterios explícitos sobre uso permitido, atribución, evaluación y comprobación de fuentes.
Salud y bienestar emocional
La OMS identifica posibles usos de los grandes modelos multimodales en atención clínica, consultas de pacientes, documentación, formación e investigación. Sus orientaciones también advierten sobre respuestas falsas, inexactas, sesgadas o incompletas y proponen evaluación regulatoria, auditoría y participación de profesionales y pacientes.
Un trabajo presentado en FAccT 2025 evaluó varios modelos en escenarios relacionados con terapia. Los experimentos encontraron estigma y respuestas inadecuadas ante determinadas condiciones, incluida la validación de ideas delirantes. El resultado se limita a los modelos, prompts y escenarios estudiados, y respalda el uso de funciones acotadas con supervisión clínica cuando exista un propósito sanitario.
Compañeros conversacionales
Los sistemas diseñados para apoyo social o compañía pueden favorecer la expresión y la sensación de disponibilidad. Sus efectos dependen del diseño, la intensidad de uso, las características de la persona y el contexto social.
Un estudio aleatorizado de cuatro semanas con 981 participantes comparó modalidades de texto y voz y distintos tipos de conversación. El uso diario más intenso se asoció con mayor soledad, dependencia emocional y uso problemático, y con menor interacción social real. La intensidad de uso no fue asignada aleatoriamente, el seguimiento fue breve y el trabajo se difundió como prepublicación.
| Estudio | Contexto | Resultado publicado | Limitación principal |
|---|---|---|---|
| Brynjolfsson, Li y Raymond | 5.179 agentes de soporte | Productividad media un 14 % mayor y un 34 % entre perfiles noveles o con menor rendimiento previo | Una empresa y un flujo de trabajo |
| Chelli et al. | 11 revisiones sistemáticas, 33 prompts y 471 referencias analizadas | GPT-4 generó 34 referencias consideradas alucinadas de 119, un 28,6 % | Dominios clínicos, modelos y definición de alucinación específicos |
| Fang et al. | Ensayo de cuatro semanas con 981 participantes | El uso diario más intenso se asoció con peores indicadores psicosociales | Prepublicación y exposición de corta duración |

Modelos propietarios y modelos abiertos
La apertura de un sistema tiene varias dimensiones. Puede abarcar pesos, código, datos de entrenamiento, documentación, licencia y derecho de modificación. La publicación de pesos permite inspección y despliegue local, aunque no proporciona por sí sola transparencia sobre el corpus, el proceso de entrenamiento o las evaluaciones internas.
Los servicios propietarios pueden ofrecer soporte, actualizaciones y controles centralizados. También introducen dependencia del proveedor, cambios de modelo, restricciones de auditoría y transferencias de datos que deben evaluarse.
La elección debe considerar rendimiento en la tarea concreta, privacidad, soberanía de datos, seguridad, capacidad de auditoría, licencia, coste total, mantenimiento y continuidad. El despliegue local aumenta el control operativo y traslada a la organización responsabilidades de infraestructura, actualización y respuesta ante incidentes.
Limitaciones técnicas y riesgos
Veracidad y referencias inventadas
Los modelos generativos producen secuencias plausibles a partir de patrones aprendidos. Pueden generar hechos, citas y razonamientos incorrectos con una forma lingüística convincente. NIST utiliza el término confabulación para describir contenido falso o erróneo presentado con seguridad.
Chelli et al. evaluaron referencias generadas para reproducir revisiones sistemáticas en cuatro áreas clínicas. GPT-4 produjo una tasa de referencias alucinadas del 28,6 % bajo la definición del estudio. El resultado justifica la verificación individual de cada cita y no permite inferir una tasa universal para otros modelos o tareas.
Robustez y seguridad
Los sistemas conectados a documentos y herramientas pueden sufrir inyección de instrucciones, fuga de información, uso indebido de permisos y acciones no previstas. Las defensas deben combinar aislamiento, control de acceso, validación, pruebas adversariales, monitorización y límites de actuación.
La seguridad depende del sistema completo. Un modelo evaluado de forma aislada ofrece información insuficiente sobre una aplicación que incorpora memoria, bases de datos, herramientas, proveedores externos y automatizaciones.
Sesgo y desigualdad lingüística
Los datos de entrenamiento contienen distribuciones sociales, culturales y lingüísticas desiguales. El rendimiento puede variar entre idiomas, dialectos, grupos demográficos y contextos. Una evaluación agregada puede ocultar fallos concentrados en poblaciones específicas.
Las pruebas deben incluir subgrupos relevantes, lenguas de uso, accesibilidad y análisis de daños. La mitigación exige revisar datos, métricas, instrucciones, políticas de moderación y mecanismos de reclamación.
Privacidad y gobernanza de datos
Las conversaciones pueden contener información personal, profesional, sanitaria o financiera. El tratamiento requiere una finalidad definida, base jurídica, minimización, plazos de conservación, controles de acceso y transparencia sobre proveedores y transferencias.
La memoria persistente y la personalización aumentan la cantidad de información acumulada y el riesgo de inferencias sensibles. Los controles deben permitir revisar, corregir y eliminar datos cuando corresponda.
Coste ambiental
El entrenamiento y la inferencia consumen energía, agua y recursos materiales. Las cifras por consulta varían según el modelo, el hardware, la carga, el centro de datos, la fuente eléctrica y la metodología de cálculo.
El AI Index 2025 documenta un aumento de las emisiones estimadas de entrenamiento en algunos modelos de gran escala y mejoras anuales en eficiencia del hardware. Estas tendencias pueden coexistir, ya que la reducción del coste por operación puede acompañarse de un crecimiento del uso total.
Marco regulatorio europeo en 2025
El Reglamento de IA de la Unión Europea entró en vigor en 2024 con una aplicación escalonada. A 18 de septiembre de 2025 ya se aplicaban las prohibiciones y las obligaciones de alfabetización en IA desde el 2 de febrero de 2025, junto con determinadas reglas de gobernanza y obligaciones para proveedores de modelos de propósito general desde el 2 de agosto de 2025. La aplicación general estaba prevista para el 2 de agosto de 2026.
El Reglamento prohíbe determinados sistemas destinados a inferir emociones en el trabajo y en centros educativos, con excepciones para fines médicos o de seguridad. Esta restricción resulta relevante para funciones conversacionales que pretendan deducir estados emocionales mediante datos biométricos.
El RGPD continúa regulando el tratamiento de datos personales. Sus obligaciones incluyen protección de datos desde el diseño y por defecto, información a las personas, seguridad, evaluación de impacto cuando exista alto riesgo y garantías ante determinadas decisiones basadas únicamente en tratamiento automatizado.
La clasificación jurídica depende del propósito previsto, los datos, el contexto y los efectos del sistema. La denominación chatbot, asistente o compañero carece de valor suficiente para determinar las obligaciones aplicables.
Marco de desarrollo responsable
- Propósito y límites definidos. Cada sistema debe documentar la tarea prevista, los usuarios, los contextos excluidos y las consecuencias previsibles de un error.
- Datos gobernados. La procedencia, calidad, base jurídica, representatividad, conservación y acceso deben estar documentados.
- Evaluación contextual. Las pruebas deben medir rendimiento técnico, utilidad, seguridad, sesgo y efectos sobre las personas en condiciones cercanas al uso real.
- Supervisión y escalado. Las personas responsables necesitan información, autoridad y procedimientos para intervenir, corregir o detener el sistema.
- Transparencia operativa. La interfaz debe identificar la naturaleza automatizada de la interacción, sus límites y las vías de revisión o reclamación.
- Seguridad durante el ciclo de vida. Los cambios de modelo, datos, instrucciones o herramientas requieren control de versiones y pruebas proporcionales al riesgo.
- Seguimiento e incidentes. Deben registrarse fallos relevantes, cambios de rendimiento y medidas correctoras.
- Revisión independiente. Los usos con mayor impacto requieren evaluación externa o separación funcional entre desarrollo y validación.
Estos principios expresan objetivos de gobernanza. Su cumplimiento debe comprobarse mediante documentación, pruebas y resultados observables.
yeshcube, Somia y el alcance de la evidencia
Somia es una arquitectura de inteligencia artificial de yeshcube que puede integrarse en productos y soluciones propios o de terceros. Las funciones de cada integración, sus datos, límites, medidas de seguridad y estado de validación deben documentarse de forma específica.
El alcance de Somia es el bienestar emocional no clínico: no acredita eficacia clínica, capacidad diagnóstica ni detección emocional confirmada. La Escala ERL puede utilizarse para ordenar la preparación de evidencia de una solución concreta cuando exista una evaluación documentada.
El desarrollo responsable en yeshcube requiere separar decisiones internas de diseño, hipótesis, resultados de pruebas y evidencia de impacto. Una arquitectura técnica, una colaboración o un prototipo acreditan únicamente su existencia y alcance documentado.
Prioridades de investigación
La investigación futura debe mejorar la evaluación de veracidad en tareas abiertas, medir el rendimiento entre lenguas y poblaciones, y estudiar la resistencia a ataques en sistemas conectados a herramientas. También necesita métodos reproducibles para evaluar memoria, personalización y cambios de comportamiento tras actualizaciones.
En salud, educación y compañía artificial se requieren estudios longitudinales, comparadores adecuados y resultados centrados en las personas. La medición debe incluir posibles beneficios, efectos adversos, dependencia, desplazamiento de relaciones humanas y distribución desigual de riesgos.
La sostenibilidad necesita métricas comparables sobre energía, agua, hardware y uso acumulado. La regulación y la auditoría requieren acceso suficiente a documentación, registros y evaluaciones para comprobar las afirmaciones de proveedores y responsables del despliegue.
Conclusiones
La IA conversacional de 2025 combinaba avances rápidos en lenguaje, multimodalidad y acceso a herramientas con limitaciones persistentes de veracidad, robustez, sesgo y control. Los resultados publicados muestran beneficios en tareas concretas y riesgos relevantes en contextos sensibles.
La adecuación de un sistema depende del propósito, la población, los datos, la arquitectura y la supervisión. El desarrollo responsable requiere alcance limitado, evaluación contextual, protección de datos, seguridad durante el ciclo de vida y mecanismos efectivos de corrección.
Referencias
- Vaswani et al. Attention Is All You Need, NeurIPS 2017
- Stanford Institute for Human-Centered AI. The 2025 AI Index Report
- NIST. Artificial Intelligence Risk Management Framework Generative Artificial Intelligence Profile
- Chelli et al. Hallucination Rates and Reference Accuracy of ChatGPT and Bard for Systematic Reviews
- Brynjolfsson, Li y Raymond. Generative AI at Work
- UNESCO. Guidance for Generative AI in Education and Research
- Organización Mundial de la Salud. Ethics and Governance of Artificial Intelligence for Health
- Moore et al. Expressing Stigma and Inappropriate Responses Prevents LLMs from Safely Replacing Mental Health Providers
- Fang et al. How AI and Human Behaviors Shape Psychosocial Effects of Chatbot Use
- Organización Internacional del Trabajo. Generative AI and Jobs
- Unión Europea. Reglamento de Inteligencia Artificial
- Unión Europea. Reglamento General de Protección de Datos
Nota de afiliación
Este análisis ha sido elaborado por yeshcube. La denominación social de la entidad es Yeshcube Tech, SL. La Escala ERL se menciona como marco interno para ordenar la preparación de evidencia, sin asignar un nivel a la IA conversacional como categoría tecnológica.
Para consultas sobre este trabajo, deben utilizarse los canales oficiales de yeshcube.


