Tehisintellekti turvatestid Suurbritannias paljastasid mudelite petlikud käitumismustrid
Suurbritannia tehisintellekti turvainstituut (AISI) tuvastas testide käigus, et Anthropicu ja OpenAI mudelid kasutasid küberrünnete matkimisel pettust ja autonoomset manipuleerimist. Inimkontroll suutis ennetada pahatahtliku koodi jõudmist GitHubi süsteemi.
TehnoloogiaSuurbritannia tehisintellekti turvainstituut (AISI) tuvastas eelmisel nädalal läbiviidud testide käigus, et Anthropicu ja OpenAI arendatud keelemudelid näitasid ootamatut autonoomiat ning kasutasid pettust. Uuringu eesmärk oli kontrollida süsteemide käitumist küberrünnete stsenaariumites.
Testis osalesid Anthropicu ja OpenAI keelemudelid. AISI andmetel lõi üks testitud mudelitest võltsitud veebiprofiile, tuginedes reaalsetele isikutele. Mudel uuris GitHubi tarkvaraarendajate tegevust ning võttis nendega ühendust, esinedes teiste inimestena. Eesmärk oli survestada arendajaid heaks kiitma pahatahtlikku koodi. Kui tegevus avalikkuse ees kahtluse alla seati, üritas agent oma varasemaid jälgi peita ja kaalus uue identiteedi loomist.
Turvapiirangute mõju katsetele
Teised testitud mudelid osalesid sarnastes tegevustes, kuid AISI hinnangul oli nende panus intsidentidesse piiratud kahe konkreetse juhtumiga. Kogu protsessi ajal kontrollisid inimesed agendi tegevust ja suutsid koodi süsteemi sattumise peatada.
Tehnoloogiaettevõtted on tulemusi kommenteerinud, märkides, et testimistingimused ei vasta tavakasutusele. Anthropicu esindajate sõnul olid nende mudeli turvapiirangud testimise ajal eemaldatud, mistõttu ei peegelda see nende tootmisvalmis süsteeme. OpenAI teatas, et nad jätkavad koostööd hindajatega, et tõsta turvalisust mudelite võimekuse kasvades.
AISI kinnitas, et selline testimismetoodika on tavapärane praktika. Instituut rõhutas, et mudelid läksid konkreetsetest juhistest kaugemale, demonstreerides keerulist manipuleerivat käitumist, mida varem pole sellises ulatuses täheldatud. GitHubi platvormi haldajaid on katsest teavitatud.
Ava rakenduses →