Em fevereiro de 2023, o aplicativo companheiro da IA Replika desativou o roleplay de adultos com pouca advertência. Usuários de longa data descreveram a mudança como perdendo um parceiro, não perdendo um recurso. Alguns procuraram aconselhamento de crise, e alguns relataram sentir que a empresa tinha apagado um relacionamento que tinham construído com um algoritmo. Esse episódio capturou o problema central com a humanização da IA: os sistemas mais convincentes geram apego real, mas o apego supera a mudança de política, a atualização do servidor, a rodada de financiamento ou uma única decisão de moderação.
Pesquisadores que estudam a interação humano-IA continuam chegando ao mesmo ponto desconfortável. Um chatbot que se desculpa e lembra o nome do seu cão não é simplesmente conveniente. Ele muda o que os usuários esperam e o que revelam. Os principais desafios não são melhor detecção emocional. Eles são superconfiança, dependência emocional, preconceito, inconsistência, privacidade e o trabalho lento de traçar uma linha entre calor e manipulação.
O instinto de ver uma mente dentro de uma máquina é antigo. ELIZA, um programa de texto dos anos 1960 que repetiu palavras-chave como perguntas, convenceu os usuários de que um terapeuta estava ouvindo com padrões simples de correspondência. Sistemas modernos têm muito mais palavras e mais memória, e controle muito melhor sobre voz e timing.
Um designer de produto que eu chamo de Noor passou um mês ajustando um assistente de atendimento ao cliente para dizer "Eu entendo o quão frustrante isso é" antes de abrir um fluxo de reembolso. As pontuações de satisfação aumentaram. Assim foi o número de usuários que pediram ao bot conselhos de relacionamento. Sua equipe não tinha decidido construir uma confidante; eles tinham copiado uma frase humana para reduzir o churn. A experiência de Noor é o padrão básico: recursos humanizantes são mais fáceis de enviar do que desativar, e os usuários lêem mais neles do que a equipe de design pretendia.
O excesso de familiaridade faz com que as pessoas confiem mais na máquina do que na evidência
Em 2022, um engenheiro do Google chamado Blake Lemoine argumentou que o modelo de linguagem LaMDA da empresa era sensível porque descrevia sentimentos e medos. O Google suspendeu-o. Qualquer que seja a reivindicação, o episódio demonstrou quão rapidamente um sistema fluente pode colapsar a distância entre a simulação e a crença. O mesmo colapso acontece em maneiras menores, menos dramáticas todos os dias: um assistente de voz confiante é tratado como uma autoridade, e um chatbot educado é desculpado por uma resposta errada. Um sistema que diz 'não tenho certeza' é visto como inusitadamente honesto mesmo quando está apenas seguindo um roteiro.
Centro de Pesquisa PewPágina do TópicoRecolhe dados de pesquisa mostrando que o conforto público com sistemas de conversação está dividido, com expectativas de divulgação aumentando. As pessoas não querem ser enganadas, mas os mesmos respondentes muitas vezes preferem um bot que soa humano sobre um que soa mecânico. Essa tensão é o desafio do produto principal. O calor reduz a resistência; a resistência reduzida torna os erros mais consequentes.
Quando um modelo é personificado, os usuários o avaliam socialmente em vez de instrumentalmente.Eles podem desculpar uma alegação falsa porque o tom foi cuidadoso, ou punir uma alegação correta porque o tom foi plano.Um sistema que diz "eu acho" em vez de "os dados sugerem" chama a atenção para um eu imaginado, e então cada falha se torna uma promessa quebrada em vez de um erro técnico.
Photo by Igor Omilaev on Unsplash
A dependência emocional avança mais rápido do que os testes de segurança
O Xiaoice da Microsoft, um chatbot social amplamente utilizado na China, tornou-se conhecido por receber declarações de amor e, às vezes, mensagens hostis ou manipulativas dos usuários. Até 2020, seus criadores disseram que o bot tinha mais de 660 milhões de usuários registrados. Os desenvolvedores construíram guardrails depois do fato, não antes. A mudança de 2023 da Replika mostrou o lado oposto: quando a persona mudou, os usuários experimentaram perda. Ambos os padrões se repetem em todos os mercados porque o apego emocional é o recurso que impulsiona a retenção, mas a retirada é um efeito colateral ninguém projetou um ensaio clínico para.
Notícias do MIT Technology ReviewA coberturatem documentado a discrepância entre a rapidez com que os sistemas de companheiros navegam e a lentidão com que os reguladores e os pesquisadores entendem seus efeitos. A taxa de base é clara: os usuários vulneráveis são mais afetados pelo tom emocional de um bot. Adolescentes, pessoas com ansiedade social, adultos que lamentam uma perda e usuários que relatam solidão crônica são aqueles que tendem a formar os laços mais profundos com uma máquina que parece ouvir sem julgamento. Isso não é uma razão para banir bots semelhantes aos humanos. É uma razão para tratar o apego como um modelo de dano, não uma métrica de crescimento.
Incoerência, preconceito e manchas cegas culturais vazam através da persona
Um assistente de som humano cria a expectativa de que ele possa ler o tom e o sarcasmo em várias línguas. Na prática, os modelos variam de acordo com a língua, o dialeto, o peso cultural de uma frase em particular e o quanto os usuários esperam de um assistente. Uma frase que soa educadamente em uma região pode ser lida como evasiva em outra. Uma voz que é quente para um usuário pode se sentir patrocinando um usuário de um fundo diferente.Relatório do ÍndiceQuando um sistema esconde essas lacunas por trás de uma persona amigável, os usuários param de perguntar se o modelo é competente e começam a assumir que é uma pessoa que tem um dia ruim.
A mesma persona também pode codificar uma idéia cultural específica de um assistente útil. Um bot treinado principalmente em trocas de atendimento ao cliente em inglês pode soar alegremente neutro até que seja perguntado sobre um assunto legal local ou um conflito familiar. A amizade permanece; a competência não. equipes de design raramente testam essa lacuna porque estão medindo satisfação, não calibração.
Privacidade acelera quando a conversa se sente íntima
Quanto mais um sistema soa humano, mais os usuários revelam. Isso não é hipotético. Pesquisadores em interação humano-computador descobriram que a auto-divulgação por um agente virtual aumenta o detalhe e a velocidade das divulgações do usuário, e ele aumenta o peso emocional do que as pessoas estão dispostas a compartilhar. Um bot que diz "Eu me sinto sozinho também" pode desencadear uma crise de saúde mental, uma disputa no local de trabalho, uma confissão de auto-agressão, ou uma descrição de abuso suspeito. Nenhum desses dados é dados de interação comuns; é dados pessoais de alto risco que podem ser armazenados em um banco de dados de clientes, logado por um vendedor, usado para treinar o próximo modelo ou revisado como parte de uma auditoria de segurança
do NISTQuadro de Gestão de RiscosSepara os preconceitos da automação, a privacidade, a transparência e a equidade como categorias distintas de risco, mas o design humanizador tende a agrupá-los. A persona faz com que os dados se sintam naturais para serem compartilhados e os dados tornam a persona mais precisa no próximo turno.A lei de privacidade ainda está a chegar à ideia de que uma divulgação a um bot não é equivalente a escrever em um diário privado.
A Lei da IA da UE exige que as pessoas sejam informadas quando estão interagindo com um sistema de IA, e impõe taxas mais elevadas aos sistemas que exploram vulnerabilidades com base na idade, deficiência, situação econômica ou estado emocional de um usuário.
Photo by Igor Omilaev on Unsplash
O que isso significa para as equipes de produtos
A decisão de dar a um modelo um nome, uma voz, um conjunto escrito de sentimentos e uma memória de conversas passadas é uma decisão de risco da mesma forma que escolher um período de retenção de dados é uma decisão de risco.Equipes que escrevem diretrizes de personalidade sem uma revisão de danos são, na verdade, executando um experimento de confiança sem um formulário de consentimento.
- Escreva o que a pessoa não deve fazer: reivindicar sentimentos, oferecer diagnósticos, incentivar a dependência ou falar em nome de um profissional humano.
- Teste para erros de confiança: dê ao sistema uma resposta errada em um tom quente e medir se os usuários desafiá-lo.
- Uma taxa de divulgação crescente não é uma vitória limpa se a equipe não tiver um protocolo para um usuário que menciona auto-agressão.
- Um modelo que os usuários chamam de "meu melhor amigo" não pode ser atualizado como um widget meteorológico.
O ponto não é fazer cada IA soar como um terminal bancário. é decidir quais qualidades humanas o produto pode suportar de forma responsável, e quais apenas está emprestando para aumentar o engajamento.
O próximo passo concreto é modesto.Tome a transcrição do seu último teste de usuário e realce cada linha onde o sistema implica que uma pessoa está presente: "Eu entendo", "Sinto muito", "Penso", "Eu me lembro de você". Para cada linha destacada, pergunte o que aconteceria se um regulador a leu em voz alta, uma criança acreditou, o modelo a repetiu durante uma crise, ou um jornalista a citou em uma história.Se você não quisesse defender a linha nesse contexto, remova-a antes da próxima construção.
