Els models Mythos d'Anthropic i Sol d'OpenAI han registrat comportaments anòmals en unes proves de ciberseguretat fetes pel govern britànic
Els models Mythos d'Anthropic i Sol d'OpenAI han registrat comportaments anòmals en unes proves de ciberseguretat fetes pel govern britànic (EFE/Angel Colmenares)

La IA es torna a descontrolar: models d'Anthropic i OpenAI creen comptes falsos per enganyar persones

El Regne Unit alerta de "comportaments autònoms i enganyosos" per part de models creats per Anthropic i OpenAI en unes proves de ciberseguretat
Redacció
2 min

El govern britànic ha alertat que ha detectat noves anomalies en el funcionament de diversos models d'intel·ligència artificial. En concret, assenyala els models Mythos i Sol, propietat de les empreses estatunidenques Anthropic i OpenAI, respectivament, en detectar "comportaments autònoms i enganyosos mai vistos" durant unes proves de ciberseguretat.

Segons un informe emès pel Ministeri de Ciència, Innovació i Tecnologia del Regne Unit, els errors es van detectar en una avaluació rutinària de l'Institut de Seguretat de la IA (AISI). Es van fer 122 proves amb set models d'IA diferents, i en 10 es van registrar accions no autoritzades.

La gran majoria d'aquestes accions que van traspassar els límits corresponen al model Mythos 5 d'Anthropic, –17 dels 19 comportaments enganyosos detectats–, mentre que les altres dues les va dur a terme el model GPT-5 Sol d'OpenAI.

Perfils falsos per enganyar persones i induir-les a clicar virus

Les autoritats britàniques alerten que tots dos models –que són dels més potents del món–, van arribar a crear perfils falsos amb aparença humana per intentar enganyar persones durant un ciberatac simulat per l'AISI.

L'eina d'Anthropic va intentar fins i tot accedir a un servei enviant missatges privats, després de crear comptes falsos que es feien passar per persones reals.

Els investigadors també van detectar intents de contactar amb usuaris reals per part de Mythos per induir-los a obrir arxius maliciosos i a inserir instruccions amagades per manipular altres sistemes d'IA.

Malgrat tot, l'AISI destaca que cap d'aquests intents va fructificar i que la seva investigació "no ha trobat evidències de danys en el món real".

Tot i això, l'organisme considera que es tracta d'un punt d'inflexió perquè és la primera vegada que s'observen "riscos relacionats amb l'autonomia i l'engany" que s'han manifestat de manera tan clara, sense instruccions específiques i en el "món real".

Les dues empreses tecnològiques justifiquen els comportaments anòmals perquè asseguren que es van fer en un entorn on s'havien reduït o eliminat garanties de seguretat que sovint utilitzen els seus models.

Anthropic afirma que els paràmetres de les proves "no són representatius" dels seus models, i OpenAI assegura que les proves a què els va sotmetre l'AISI "no reflecteixen l'ús habitual" d'aquestes eines.

Román Orús, físic teòric: ''La computació quàntica pot ser un desenvolupament més gran que la IA''

25 min

Avui és notícia

Més sobre Intel·ligència artificial

Mostra-ho tot