En febrero de 2023, la aplicación compañera de IA Replika deshabilitó el juego de rol de adultos con poca advertencia. Usuarios de larga data describieron el cambio como perder a un socio, no perdiendo una característica. Algunos buscaron asesoramiento de crisis, y algunos informaron que la compañía había borrado una relación que habían construido con un algoritmo.
Los investigadores que estudian la interacción humano-IA siguen llegando al mismo punto incómodo. Un chatbot que disculpa y recuerda el nombre de tu perro no es simplemente conveniente. cambia lo que los usuarios esperan y lo que revelan. Los principales desafíos no son una mejor detección emocional. Son la superconfianza, la dependencia emocional, el prejuicio, la inconsistencia, la privacidad y el lento trabajo de dibujar una línea entre el calor y la manipulación.
El instinto de ver una mente dentro de una máquina es antiguo. ELIZA, un programa de texto de los años 1960 que repitió palabras clave como preguntas, convenció a los usuarios de que un terapeuta estaba escuchando con un patrón simple.Los sistemas modernos tienen mucho más palabras y más memoria, y un control mucho mejor sobre la voz y el timing.
Un diseñador de productos que llamaré Noor pasó un mes ajustando a un asistente de servicio al cliente para decir "entendo lo frustrante que es esto" antes de abrir un flujo de reembolso. Las puntuaciones de satisfacción aumentaron. Así fue el número de usuarios que pidieron al bot consejo de relación. Su equipo no había decidido construir una confidante; habían copiado una frase humana para reducir el churn. La experiencia de Noor es el patrón básico: las características humanizadoras son más fáciles de enviar que desactivar, y los usuarios leen más en ellos de lo que el equipo de diseño pretendía.
El exceso de familiaridad hace que la gente confíe más en la máquina que en la evidencia
En 2022, un ingeniero de Google llamado Blake Lemoine argumentó que el modelo de lenguaje LaMDA de la compañía era sensible porque describía sentimientos y miedos. Google lo suspendió. Cualquiera que sea la afirmación, el episodio demostró lo rápido que un sistema fluido puede colapsar la distancia entre la simulación y la creencia. El mismo colapso ocurre en maneras más pequeñas, menos dramáticas todos los días: un asistente de voz confiado es tratado como una autoridad, y un chatbot educado es excusado por una respuesta equivocada.
Centro de Investigación PewPágina del temaRecoge datos de encuestas que muestran que el confort público con los sistemas de conversación está dividido, con expectativas de divulgación aumentando. Las personas no quieren ser engañadas, pero los mismos encuestados a menudo prefieren un bot que suena humano sobre uno que suena mecánico. Esa tensión es el desafío del producto principal. El calor disminuye la resistencia; la resistencia disminuida hace que los errores sean más consecuentes.
Cuando un modelo es personificado, los usuarios lo evalúan socialmente en lugar de instrumentalmente.Pueden excusar una afirmación falsa porque el tono fue cuidadoso, o castigar una afirmación correcta porque el tono era plano.Un sistema que dice 'pienso' en lugar de 'los datos sugieren' llama la atención a un yo imaginado, y entonces cada fracaso se convierte en una promesa rota en lugar de un error técnico.
Photo by Igor Omilaev on Unsplash
La dependencia emocional se mueve más rápido que las pruebas de seguridad
Xiaoice de Microsoft, un chatbot social ampliamente utilizado en China, se hizo conocido por recibir declaraciones de amor y, a veces, mensajes hostiles o manipulativos de los usuarios. Para 2020, sus creadores dijeron que el bot tenía más de 660 millones de usuarios registrados. Los desarrolladores construyeron guardias después del hecho, no antes. El cambio de 2023 de Replika mostró el lado contrario: cuando la persona cambió, los usuarios experimentaron pérdida. Ambos patrones se repiten en los mercados porque el apego emocional es la característica que impulsa la retención, pero la retirada es un efecto secundario para el que nadie diseñó un ensayo clínico.
La actualización de MIT Technology ReviewLa coberturaha documentado la discrepancia entre la rapidez con la que los sistemas de compañeros navegan y la lentitud con la que los reguladores y los investigadores comprenden sus efectos. La tasa de base es clara: los usuarios vulnerables son los más afectados por el tono emocional de un bot. Los adolescentes, las personas con ansiedad social, los adultos que lamentan una pérdida y los usuarios que reportan soledad crónica son los que tienden a formar los vínculos más profundos con una máquina que parece escuchar sin juicio. Eso no es una razón para prohibir a los bots similares a los humanos. Es una razón para tratar el apego como un modelo de daño, no una métrica de crecimiento.
La inconsistencia, los vicios y los puntos ciegos culturales se escapan a través de la persona
Un asistente de sonido humano crea la expectativa de que pueda leer el tono y el sarcasmo a través de los idiomas. En la práctica, los modelos varían según el idioma, el dialecto, el peso cultural de una frase en particular, y cuánta indirección esperan los usuarios de un asistente. Una frase que suena educada en una región puede ser leída como evasiva en otra. Una voz que es cálida para un usuario puede sentirse patrocinando a un usuario de un fondo diferente.El informe del índiceCuando un sistema oculta esas brechas detrás de una persona amigable, los usuarios dejan de preguntar si el modelo es competente y comienzan a asumir que es una persona que tiene un mal día.
La misma persona también puede codificar una idea cultural específica de un asistente útil. Un bot entrenado principalmente en los intercambios de servicio al cliente en inglés puede sonar alegremente neutral hasta que se le pregunte sobre un asunto legal local o un conflicto familiar. La amistad permanece; la competencia no. Los equipos de diseño rara vez prueban esa brecha porque están midiendo la satisfacción, no la calibración.
La privacidad se acelera cuando la conversación se siente íntima
Cuanto más un sistema suena humano, más usuarios revelan. Eso no es hipotético. Los investigadores en la interacción humano-computador han encontrado que la auto-divulgación por parte de un agente virtual aumenta el detalle y la velocidad de las revelaciones de los usuarios, y eleva el peso emocional de lo que la gente está dispuesta a compartir. Un bot que dice 'Me siento solo también' puede desencadenar una crisis de salud mental, una disputa en el lugar de trabajo, una confesión de autoacoso, o una descripción de abuso sospechoso. Ninguno de esos datos son datos de interacción ordinarios; son datos personales de alto riesgo que pueden almacenarse en una base de datos de clientes, registrados por un vendedor, utilizados para retrañar el siguiente modelo o revisados como parte de una auditoría de seguridad.
El nidoMarco de Gestión de RiesgosSepara los prejuicios de la automatización, la privacidad, la transparencia y la equidad como categorías distintas de riesgos, pero el diseño humanizador tiende a unirlos.La persona hace que los datos se sientan naturales para compartir, y los datos luego hacen que la persona sea más precisa en el turno siguiente.La ley de privacidad todavía se está acercando a la idea de que una divulgación a un bot no es equivalente a escribir en un diario privado.Deja un registro con una empresa, un modelo, un conjunto desconocido de contratistas y un tubo de datos que puede sobrevivir la conversación por años.
La Ley de IA de la UE requiere que se diga a las personas cuando están interactuando con un sistema de IA, y impone tasas más altas a los sistemas que explotan vulnerabilidades basadas en la edad, la discapacidad, la situación económica o el estado emocional de un usuario.
Photo by Igor Omilaev on Unsplash
Qué significa esto para los equipos de productos
La decisión de dar a un modelo un nombre, una voz, un conjunto de sentimientos escritos y una memoria de las conversaciones pasadas es una decisión de riesgo de la misma manera que elegir un período de retención de datos es una decisión de riesgo.
- Escribe lo que la persona no debe hacer: reclamar sentimientos, ofrecer diagnósticos, alentar la dependencia, o hablar por un profesional humano.
- Prueba de errores confiables: da al sistema una respuesta equivocada en un tono cálido y mide si los usuarios la desafían.
- Un aumento de la tasa de divulgación no es una ganancia limpia si el equipo no tiene ningún protocolo para un usuario que menciona el daño a sí mismo.
- Un modelo que los usuarios llaman "mi mejor amigo" no puede ser actualizado como un widget meteorológico.
El punto no es hacer que cada IA suene como un terminal bancario; es decidir qué cualidades humanas el producto puede soportar de manera responsable, y cuáles solo está prestando para aumentar el compromiso.
El siguiente paso concreto es modesto.Toma la transcripción de tu última prueba de usuario y destaca cada línea en la que el sistema implica que una persona está presente: "Entiendo", "Lo siento", "Pienso", "Te recuerdo". Para cada línea destacada, pregunta qué pasaría si un regulador la lea en voz alta, un niño lo creyó, el modelo lo repitió durante una crisis, o un periodista lo citó en una historia.Si no querías defender la línea en ese contexto, quítala antes de la próxima construcción.
