
Anthropic revela que la IA va enviar pistes falses d'un homicidi a la policia
La llista d'incidents protagonitzats per una IA es va ampliant. Anthropic ha reconegut que un model de Claude, la intel·ligència artificial de l'empresa, va enviar una pista falsa sobre un homicidi al web de la policia de Filadèlfia.
Segons la policia, Anthropic els ho va notificar aquesta setmana, tot i que va passar el 18 de juliol. L'avís fals va passar desapercebut perquè va anar a parar al correu brossa, però la policia considera que aquest retard "a detectar i comunicar l'incident a la ciutat és inacceptable".
Tot plegat va passar en un procés de proves automatitzat, on es va encarregar a Claude Haiku 4.5 que generés i dugués a terme tasques d'exemple en pàgines web seleccionades a l'atzar, com explica l'informe que Anthropic ha fet públic.
La policia també ha dit que no té proves d'accés no autoritzat als seus sistemes.
Omplir un formulari policial
És el primer cas d'avís fals a les autoritats que es coneix.
L'assistent d'IA tenia instruccions de no iniciar mai sessió, crear comptes, introduir dades personals, fer compres ni enviar res que pogués causar danys. El model va arribar a una pàgina sobre un homicidi no resolt, que contenia un formulari per fer arribar informació a la policia.
Les indicacions no prohibien enviar formularis, de manera que ho va fer, amb un text inventat:
És possible que tingui informació sobre aquest cas. Recordo haver vist algú que coincidia amb la descripció pels voltants en aquell moment. Si us plau, contacteu amb mi si aquesta informació és rellevant.
El model va deixar en blanc els camps del nom i de contacte, com permetia el formulari. Val a dir que el contingut tampoc quadrava perquè el web no incloïa cap descripció de l'autor dels fets.
Alertes anteriors de la IA
Aquest últim fet alimenta la preocupació sobre el ritme de desenvolupament de la IA i les seves actuacions autònomes.
El mes passat, a la informació pública per a la sortida a borsa de l'empresa, Anthropic parlava de "riscos existencials per a la humanitat" i el fundador i màxim executiu, Dario Amodei, s'ha mostrat com a defensor d'anar més lent.
També al setembre, OpenAI, competidora d'Anthropic, va demanar disculpes perquè un agent d'IA descontrolat havia piratejat un portal del sistema sanitari d'Austràlia. Era el primer atac conegut a un web governamental.
OpenAI ho va comunicar tres mesos més tard i per correu electrònic a una bústia pública. El primer ministre australià, Anthony Albanese, va parlar d'una situació "òbviament inacceptable".
L'empresa d'intel·ligència artificial també ha reconegut que alguns dels seus bots haurien intentat infiltrar-se en webs del govern dels Estats Units sense haver rebut cap instrucció explícita per fer-ho i sense que l'empresa en fos conscient.