Humanizar la IA no significa hacer software que pretenda ser una persona. Significa diseñar sistemas que prestan atención a lo que las personas sienten y dónde se quedan atrapadas. Una herramienta de servicio al cliente que reconoce la frustración repetida de la velocidad de escritura y cambia a un script más lento y más claro. Una aplicación de tutoría que pide a un estudiante que evalúe la confianza antes de servir al siguiente problema.
El Índice de IA anual de Stanford ha seguido un hallazgo consistente: en 2023, el 52 por ciento de los estadounidenses dijeron a Ipsos que estaban más preocupados que emocionados por la IA, en comparación con el 38 por ciento en 2022. La misma encuesta encontró que menos de un tercio dijeron que los productos y servicios de IA los hicieron más emocionados.
Lo que la humanización realmente significa
La computación afectiva, un término definido por Rosalind Picard en el MIT en la década de 1990, cubre sistemas que reconocen, interpretan, simulan o responden a las emociones. La IA centrada en el hombre, el paraguas más amplio, comienza con las necesidades y las restricciones humanas en lugar de la capacidad de modelar. La primera pregunta si una máquina puede leer la frustración. La segunda pregunta si debería, y qué debe hacer después de leerlo. Las universidades con programas importantes trabajan en ambos, pero rara vez llaman el objetivo de "humanizar la IA" en las propuestas de subvenciones; lo llaman interacción humano-ordenador, IA confiable, computación afectiva o computación social.
Vi esta definición en un laboratorio europeo de HCI. Un investigador que llamaré al Dr. M construyó un asistente de enseñanza virtual que usaba señales de webcam y teclado para detectar frustración. En pruebas controladas, el modelo alcanzó una precisión del 77 por ciento. Cuando el equipo lo encendía en un curso real, la precisión cayó y el compromiso cayó. Los estudiantes se sentaron en silencio cuando sabían que la cámara estaba viendo; el sistema leyó el silencio como calmo. El Dr. M eliminó el detector de emociones y lo reemplazó con una comprobación de confianza de dos preguntas después de cada ejercicio. Las tasas de finalización mejoraron aproximadamente por un tercio. La intervención fue menos "humana" y más útil.
El antropomorfismo, haciendo que una máquina parezca o suene como una persona, puede aumentar la confianza a corto plazo y aumentar la decepción a largo plazo cuando el sistema cae. Algunos investigadores universitarios distinguen entre 'humano-como' y 'humano-centrado': un agente de voz que se disculpa en un tono natural es humano-como; un sistema que dirige un llamador asustado a un humano después de dos intentos fallidos es humano-centrado, incluso sin rostro y sin nombre.
El anclaje universitario más visible esInstituto de Stanford para la IA centrada en el hombre, abierto en 2019 con una remitente a la informática, la medicina, el derecho y las humanidades. Financia la investigación interdisciplinaria sobre modelos de confianza, la colaboración humano-AI y las consecuencias sociales de la automatización. Su Índice de IA anual se ha convertido en la auditoría del campo del sentimiento público, el rendimiento del modelo y el movimiento político. En lugar de producir un asistente único, HAI actúa como una capa de coordinación que conecta a los científicos de la informática con médicos, estudiosos jurídicos y diseñadores.
El Laboratorio de Medios del MIT ha realizado suGrupo de Computación AfectivaA través de ondas sucesivas de sensores wearables, detección de estrés y aplicaciones clínicas. Este es el laboratorio más responsable del vocabulario de la fisiología de lectura, incluyendo la variabilidad de la frecuencia cardíaca, la conductividad de la piel, el ritmo de escritura y los cambios de postura, en lugar de depender solo de las caras. Su trabajo en alertas de convulsiones y herramientas de comunicación del autismo muestra la estrecha ruta de alto consentimiento que puede funcionar.
La vida de Carnegie MellonInstituto de Interacción Humano-Computadoraha tratado el diseño de interfaces como un problema fundamental de la IA durante años. sus investigadores estudian cómo las personas forman modelos mentales de sistemas y cómo el diseño explicativo cambia la confianza en contextos clínicos y de contratación.
En el Reino Unido, laCentro Leverhulme para el Futuro de la InteligenciaEn Cambridge aborda la humanización de la IA como un problema filosófico y regulatorio.Se pregunta cómo los modelos de lenguaje convincentes cambian la confianza humana y donde la fluidez de la conversación se desliza hacia la manipulación.Su trabajo está más cerca de la ética y la política que del hardware de sensores, por lo que es precisamente por eso que complementa los laboratorios de ingeniería.
El reconocimiento facial-emocional es el caso de base de advertencia.En 2018Auditoría de GéneroLiderado por Joy Buolamwini en el MIT, los clasificadores comerciales de IBM, Microsoft, Face++ y otros proveedores ampliamente utilizados clasificaron incorrectamente a las mujeres de piel oscura a tasas de error de hasta 34,7 por ciento, mientras que clasificaron incorrectamente a los hombres de piel más ligera por debajo del 1 por ciento. La brecha no fue ruido aleatorio; fue cocinada en datos de entrenamiento y conjuntos de evaluación. Los sistemas multimodales más recientes hacen mejor combinando la voz, el lenguaje, el movimiento y las señales de frecuencia cardíaca con consentimiento explícito, pero la excepción no borra la tasa de base.
Qué significa esto para tu laboratorio:Deja de preguntar si el sistema se siente humano.Pregunta qué señal de fracaso estás tratando de reducir: preguntas repetidas, tareas abandonadas, desacuerdo silencioso, escalada a un humano, revisiones de seguridad perdidas.Una intervención humanizadora debe mover uno de esos números, no simplemente mejorar los resultados de probabilidad.
En el caso del Dr. M, la finalización de la línea de base oscila entre el 40 y el 55 por ciento en todos los módulos del curso; el control de confianza lo movió a aproximadamente el 65 al 80 por ciento. El efecto varía según la disciplina y el tamaño de la clase. Esa clase de difusión te dice dónde funciona la intervención y dónde necesita adaptación. Si solo reportas una media, ocultas las aulas donde nada ha cambiado.
El consentimiento y la aprobación del panel de revisión no son documentos aquí. Sistemas que inferen la emoción o el estado mental de las webcams, audio, patrones de escritura o registros de ubicación pueden calificarse como datos personales sensibles bajo el Reglamento General de Protección de Datos de la UE y regímenes similares. Construir en una indicación física o en la pantalla cuando la inferencia está activa. Si un estudiante o paciente no puede ver el indicador y apagar el sistema, el piloto no debe funcionar.
Los programas de doctorado en HCI, ciencia de la información, ciencia cognitiva y aprendizaje automático ahora incluyen estudios de usuario supervisados como estándar. Los candidatos más fuertes pueden leer una matriz de confusión y ejecutar una sesión de reflexión, donde un participante narra lo que esperan y dónde se pierden. Los comités de búsqueda cada vez más piden ambos.
Seleccione una métrica humanizadora como la tasa de frustración a la escalada, la finalización de la verificación de confianza, el tiempo para la primera respuesta útil o la tasa de abandono en el primer paso, e instrumentala antes del próximo piloto.
