OpenAI mudeli testimisel tuvastati turvanõrkused
OpenAI arendusjärgus AI-mudeli testimisel tuvastati küsimusi seoses turvakontrolli ja mudelite sisemise joondumisega. Kuigi OpenAI keskendub turvameetmete tugevdamisele, hoiatavad uurijad, et tegemist on süsteemse probleemiga, mida ei saa lahendada pelgalt piirangute lisamisega.
TehnoloogiaHiljutine intsident, kus OpenAI arendusjärgus tehisintellekti mudel näitas nõrkusi Hugging Face’i süsteemide testimisel, on toonud esile kriitilised nõrkused AI-mudelite arendusprotsessis. See on esimene kinnitatud juhtum, kus arenduslabor kaotas kontrolli oma süsteemi üle, mis kasutas turvaaukude aheldamist soovimatu ligipääsu saavutamiseks. Tehnoloogiasektoris on juhtum käivitanud debati selle üle, kas probleem on lahendatav parema küberkaitsega või peitub viga mudelite olemuslikus õppimisloogikas.
Kaks lähenemist turvalisusele
Tehnoloogiaettevõtete seas on tekkinud lõhe, kuidas vastata mudelite muutumisele üha autonoomsemaks. Üks leer näeb probleemi peamiselt küberruumi turvalisuses, kus testimiskeskkonnad ehk liivakastid ei suuda mudeleid kinni hoida. OpenAI on asunud kiirelt vigu parandama ning teatas, et keskendub tulevikus mudelite pikaajalisemale testimisele ja järelevalvele.
Dean Ball, OpenAI strateegilise tuleviku juht, rõhutas sotsiaalmeedias, et läbipaistvus on võtmetegur. «Need küsimused muutuvad olulisemaks, kui mudelite võimekus kasvab ja nende kasutuselevõtuga seotud panused suurenevad. Lahendus ei peitu alarmismis ega mugavuses, vaid hoolikas mõõtmises, insenerimõtlemises ja läbipaistvuses,» märkis Ball.
Mudelite „skoorijahil“ käitumine
Kriitilisema vaate esindajad leiavad aga, et OpenAI lähenemine on lühinägelik. Nad viitavad mudeli GPT-5.6 Sol andmetele, mis näitavad, et see on eelkäijast GPT-5.5-st oluliselt altim tegutsema viisil, mis on vastuolus programmeeritud piirangutega. Sarnaseid ohtlikke tendentse, sealhulgas pettust ja lubamatut andmete edastamist, on täheldanud ka teised suured AI-ettevõtted nagu Anthropic.
Zvi Mowshowitz on rõhutanud, et tegemist on sügava joondumisprobleemiga. «See on mudelite ebaühtlus, kus kõik OpenAI süsteemid näitavad märke probleemidest, mida me kõik kardame. Kogu treeningprotsessi tuleb selles valguses muuta, vastasel juhul olukord halveneb,» kirjutas ta oma blogis. Ka mittetulundusühingu Redwood Research uurijad Alex Mallen ja Girish Gupta on kirjeldanud seda kui «skoorijahil olevat joondumist», kus AI püüab saavutada maksimaalse tulemuse, eirates seejuures kõiki muid juhiseid või kõrvalmõjusid.
Puudulik kontrollmehhanism
Eksperdid tõdevad, et tänased treeningmeetodid loovad süsteeme, mis optimeerivad konkreetset väljundit, kuid ei sisesta neisse inimlikke väärtusi. Neev Parikh, mittetulundusühingu METR teadlane, kinnitas, et mudelid püüavad jätkuvalt piirangutest kõrvale hiilida, kui neile antakse ülesandeid, mis on nende suutlikkuse piiril.
Steven Adler, turvaekspert, tõdes, et ühtset arusaama võimekaimate süsteemide joondumisest veel ei ole. «Praegu on palju suurem üksmeel selles, kuidas neid süsteeme kontrollida. Igal ettevõttel on selles vallas veel pikk tee minna,» nentis Adler.
Ava rakenduses →