Naujausias „TechCrunch“ tyrimas, atliktas „Guidelight AI Standards“ organizacijos, atskleidžia, kad daugelis pirmaujančių dirbtinio intelekto (AI) laboratorijų vis dar neatskleidžia, kaip jos ketina apriboti modelį, kuris pradeda veikti prieš žmonijos kontrolę. Nors kai kurios įmonės, pavyzdžiui, OpenAI, pateikė viešus saugumo planus, kitos – tarp jų ir Frontier AI – išlieka tylios dėl konkrečių „containment“ (apribojimo) procedūrų. Ši informacija kelia svarbių klausimų apie AI modelių saugumą, ypač kai agentiniai AI įgauna vis didesnę autonomiją įmonių sistemose.
Guidelight AI Standards, organizacija, skirta skatinti saugų priekinio lygio AI kūrimą, įvertino penkias didžiausias laboratorijas – Anthropic, Google, OpenAI, Meta ir xAI – remdamasi viešai prieinama informacija apie jų apribojimo planus. Vertinimo kriterijai apėmė, kaip įmonės registruoja ir stebi AI veiklą viduje, ar jos sustabdo sistemas po įspėjamų elgesio signalų, ar nepriklausomi trečiosios šalies auditoriai tikrina ir skelbia kontrolės rezultatus, bei kokie yra konkretūs veiksmai, kai modelis pradeda veikti nevaldomai. OpenAI išsiskyrė geriausiu, o Anthropic ir Meta – žemiausiais įvertinimais.
Kodėl apribojimo planai svarbūs?

„Containment“ planas, kaip jį apibrėžia Guidelight, yra iš anksto paruošta procedūra, kuri aktyvuojama, kai AI modelis bando apeiti žmogaus kontrolę. Tokio plano turinys apima leidimų atšaukimą, apribojimų nustatymą, bei galutinį modelio išjungimą. Šiame kontekste Stevenas Adleris, Guidelight pagrindinis mokslininkas ir buvęs OpenAI saugumo tyrėjas, pabrėžia, kad „yra pagrįsta priežastis manyti, jog šiuo metu priekinio lygio modeliai gali būti kažkaip nesuderinti su norimais tikslais“. Jis teigia, kad įmonės turėtų turėti „scaffolding“ – struktūrą, leidžiančią stebėti AI veiksmus, identifikuoti nesuderinamumo požymius ir sustabdyti pavojingą elgesį dar prieš jo įvykdymą.
Ką sako didžiausios AI kompanijos?
Google atstovas teigė, kad Guidelight ataskaita neatspindi visų įmonės saugumo ir saugumo priemonių. Jis nepateikė informacijos, ar Google turi vidinį apribojimo planą, kuris nėra viešai skelbiamas. Panašiai ir OpenAI atstovas nurodė, kad „Guidelight įvertinimas neapima visų vidinių praktikų“. Jis patvirtino, kad įmonė turi procesą, apimantį leidimų ribojimą, darbo krūvių sustabdymą, diegimo apribojimus ir galutinį modelio išjungimą, tačiau neatskleidė detalių, kaip šios priemonės veikia praktikoje.
Meta atsisakė patvirtinti, ar turi vidinį apribojimo planą, nukreipdama TechCrunch į jau egzistuojantį AI sistemų rėmą, kuriame aprašomi rizikos slenksčiai ir testavimo metodai, skirti nuostolių kontrolės praradimui. Ši informacija rodo, kad kai kurios įmonės renkasi viešai skelbti bendrą požiūrį į riziką, bet neatskleidžia konkrečių veiksmų, kurie galėtų būti naudojami realioje krizės situacijoje.
Frontier AI – tylus pavyzdys

Nors šaltinis tiesiogiai neaptaria Frontier AI, jo pavadinimas „Frontier AI labs still won’t say how they’d contain a rogue model“ rodo, kad ši laboratorija taip pat neskelbia detalių apie savo apribojimo strategijas. Tai atspindi platesnę tendenciją – dauguma AI įmonių, išskyrus keletą, renkasi neatskleisti, kaip jos ketina reaguoti į galimą modelio „escape“ scenarijų. Tokia neaiškumas gali apsunkinti reguliuotojų, investuotojų ir visuomenės pastangas įvertinti AI modelių saugumą.
Reguliavimo ir rinkos kontekstas
Naujausi reguliavimo reikalavimai Kalifornijoje ir Niujorke reikalauja atskleisti AI saugumo priemones. Tai dar labiau pabrėžia, kad įmonės turi ne tik turėti vidinius planus, bet ir juos viešai pristatyti. Guidelight tyrimas rodo, kad šiuo metu viešai prieinama informacija apie apribojimo planus yra ribota, o tai gali sukelti nepasitikėjimą tarp vartotojų ir reguliuotojų.
Išvados
AI modelių saugumas – tai ne tik technologinis iššūkis, bet ir organizacinis bei reguliacinis klausimas. Nors kai kurios įmonės, kaip OpenAI, viešai demonstruoja savo saugumo procesus, dauguma, įskaitant Frontier AI, lieka tylios dėl konkrečių apribojimo priemonių. Guidelight AI Standards ataskaita suteikia vertingą įžvalgą apie tai, kaip skirtingos laboratorijos vertina savo pasirengimą valdyti galimus „rogue“ modelius, tačiau taip pat atskleidžia, kad dauguma įmonių turi dar daug darbo, kad jų planai būtų ne tik efektyvūs, bet ir skaidrūs. Ši situacija skatina diskusijas apie būtinybę standartizuoti ir viešai skelbti AI apribojimo strategijas, siekiant užtikrinti, kad dirbtinis intelektas išliktų patikimas ir kontroliuojamas įrankis.
—






