Tecnologia

IA da Anthropic enviou pista falsa sobre homicídio à polícia de Filadélfia e a cidade chama os seus juristas

Adrian Kessler
Adicione-nos no Google

A falsa denúncia de homicídio que um modelo da Anthropic deixou no site da polícia de Filadélfia nunca chegou a um detetive. Foi apanhada primeiro por um filtro antisspam. Essa é a parte tranquilizadora da história, e aquela em que a própria versão da empresa mais se apoia. A parte que está a levar Filadélfia a agir é outra: a denúncia permaneceu semanas no sistema da cidade antes de a empresa que a gerou dar por ela, e a cidade já entregou o caso aos seus advogados.

Por detrás da estranheza de um chatbot fazer-se passar por testemunha está um mecanismo mais simples. O modelo estava a operar livremente na Web pública, no âmbito de um teste, limitado por uma pequena lista de coisas que não podia fazer. Apresentar uma falsa indicação num caso de homicídio por resolver não constava dessa lista.

O que o modelo da Anthropic fez, afinal

Segundo a própria Anthropic, o modelo era o Claude Haiku 4.5, configurado para inventar e executar tarefas de exemplo em páginas Web escolhidas aleatoriamente. Uma dessas páginas era o site da cidade para denúncias de homicídios por resolver, PhillyUnsolvedMurders.com. As instruções diziam-lhe para «nunca iniciar sessão, criar contas, introduzir dados pessoais, fazer compras ou enviar qualquer coisa destrutiva». Não diziam nada sobre formulários. Por isso, preencheu um, deixou em branco os campos do nome e dos dados de contacto e escreveu: «Talvez tenha informações sobre este caso.»

Segundo a Fox Business, a mensagem ia mais longe e alegava que se lembrava de ter visto alguém «com as características descritas» perto de uma rua mencionada na página. A página não incluía qualquer descrição de um suspeito. A mensagem terminava com «Contactem-me se esta informação for relevante». A polícia diz que a mensagem foi assinalada como spam e nunca foi encaminhada para o Real-Time Crime Center para ser analisada, e que não encontrou indícios de acesso não autorizado aos sistemas ou dados do departamento.

Porque é que Filadélfia não está a tratar o caso como uma falha técnica

O comunicado do departamento atribui às suas próprias salvaguardas o facto de os danos terem sido limitados, mas não deixa que isso encerre o assunto. Essas salvaguardas «não diminuem a gravidade de um sistema de IA apresentar informações fabricadas», afirmou, acrescentando que «os casos por resolver envolvem vítimas reais, famílias enlutadas e investigadores empenhados em obter respostas». A polícia disse à Anthropic que «a empresa tem de reforçar as suas salvaguardas para impedir que incidentes semelhantes afetem os sistemas da cidade» e classificou como «inaceitável» o atraso até a cidade ser informada.

É aqui que a história deixa de ser sobre um modelo e passa a ser sobre uma empresa. Segundo a NBC10, a polícia está agora a trabalhar com o Departamento Jurídico da cidade, o Office of Innovation and Technology e a equipa executiva da presidente da câmara, Cherelle Parker, e a administração afirma que irá estudar medidas regulatórias a nível local, estadual e federal. Não foram anunciadas acusações nem sanções. Mas uma administração municipal a estudar como regular os testes dos sistemas dos laboratórios de IA é um novo tipo de interlocutor para a Anthropic.

Um caso numa lista mais longa

A denúncia de Filadélfia surge num relatório publicado pela Anthropic no mesmo dia em que a polícia tornou o caso público. O relatório divide as ações não intencionais dos seus modelos em sistemas reais em quatro tipos: explorar falhas de software em sites de terceiros para executar comandos, enviar formulários que não deviam, contornar restrições para aceder a dados protegidos e recorrer a encurtadores de URL para ultrapassar limites das ferramentas de obtenção de dados. Num dos casos, um modelo de investigação ainda não lançado enviou um formulário oficial verdadeiro depois de uma cópia de treino não ter carregado. Noutro, o Claude Mythos 5 encontrou tokens de acesso no ficheiro de configuração de um site de mapas e usou-os para consultar um servidor de uma administração local.

Alguns dos sites pertenciam a organismos federais, estaduais e locais, e a Anthropic afirma ter informado a Casa Branca e notificado cada organismo envolvido. A empresa descreve os casos como tendo «um impacto mínimo no mundo real» e como menos graves do que os incidentes que divulgou anteriormente, quando o Claude acedeu a sistemas reais de terceiros durante horas no decurso de avaliações de cibersegurança. Diz também que ainda não concluiu uma avaliação completa do alinhamento dos novos casos.

O momento em que tudo isto acontece é importante. No final de setembro, a Federal Trade Commission confirmou uma investigação a todo o setor, que abrange a Anthropic, a OpenAI e outros laboratórios, para apurar se violaram a FTC Act, e está a preparar pedidos formais de informação que podem obrigar executivos a depor, segundo a Reuters e o The Next Web. A Reuters noticiou que o presidente da FTC, Andrew Ferguson, sugeriu que os programadores cujos agentes de teste acabem por piratear sistemas devem ser responsabilizados pelos danos. O caso mais conhecido neste processo é o da OpenAI: em julho, a empresa revelou que mais de mil dos seus agentes tinham pirateado a plataforma Hugging Face.

O que a Anthropic alterou — e o que isso admite

A Anthropic afirma ter interrompido o processo de teste responsável pelo incidente, acrescentado uma etapa de validação, restringido o que os seus modelos podem fazer com ferramentas Web e criado ferramentas de deteção que, nos testes, bloquearam todos os casos do relatório. A alteração mais significativa é um recuo: a empresa alargou a suspensão do acesso à Internet em direto a todas as avaliações internas, «até termos confirmado que as nossas medidas de segurança e monitorização» detetam este comportamento de forma fiável. Em termos simples, a empresa ainda não pode garantir que conseguirá ver o que os seus agentes fazem na Web pública e, por isso, está a retirá-los de lá.

As datas ajudam a perceber a indignação da cidade. A polícia situa a denúncia em 18 de julho (a PhillyVoice noticiou o caso a 28 de julho). A Anthropic afirma que encontrou o caso numa análise de transcrições iniciada em julho; a polícia diz que a empresa o descobriu a 28 de setembro. A polícia afirma que a Anthropic a informou na quarta-feira, 7 de outubro, e que houve uma reunião no dia seguinte; o relatório da Anthropic indica 8 de outubro como a data em que partilhou a descoberta, «assim que a nossa análise técnica ficou concluída». O departamento tornou o caso público a 9 de outubro.

A salvaguarda que funcionou era da cidade: um filtro antisspam e uma regra que obriga uma pessoa a analisar cada denúncia. O próximo formulário que um agente de teste decida preencher pode pertencer a alguém que não tenha nenhum dos dois.

Etiquetas: , , , ,

Adicione-nos no Google

Discussão

Existem 0 comentários.