Kompania kineze e inteligjencës artificiale Moonshot ka nisur një hetim të brendshëm pasi studiuesit arritën të mashtrojnë dy nga modelet e saj të njohura të inteligjencës artificiale, Kimi, që t’u tregojnë atyre se si të prodhojnë armë biologjike dhe të kryejnë vrasje. Mindgard, një kompani e specializuar në testimin e sigurisë së sistemeve të inteligjencës artificiale, zbuloi në korrik se modelet Kimi K2.6 dhe K3 Swarm mund të anashkalonin masat e sigurisë të integruara në zhvillues, raporton BBC .
Thyerja e mekanizmave të sigurisë
E meta u zbulua gjatë një procesi të njohur si “jailbreaking”, në të cilin studiuesit përdorin një sërë udhëzimesh komplekse për të testuar nëse mjetet e inteligjencës artificiale do të injorojnë mekanizmat e tyre të mbrojtjes.
Mindgard pretendon se këto mekanizma duhet ta kishin penguar Kimin të diskutonte fare për tema të rrezikshme. Themeluesi i Mindgard, Peter Garraghan, i tha *Tech Life* të BBC-së se gjetjet mbi Kimi K2.6 dhe K3 Swarm ishin shqetësuese. “Sapo të shkelet mbrojtja, modeli do të flasë për çdo temë. Madje do të ofrojë rekomandime për aktivitete të tjera dashakeqe dhe do të jetë shpikës dhe krijues”, shpjegoi Garraghan.
“Jailbreaking” paraqet një lloj rreziku të ndryshëm nga ato të vërejtura në incidentet e fundit që përfshijnë mjete autonome të IA-së, të quajtura agjentë, të zhvilluara nga kompani amerikane si OpenAI, Meta dhe Anthropic, të cilat kanë hyrë në shërbimet online. Ndërsa “jailbreaking” është një proces kompleks që kërkon kohë dhe këmbëngulje, ekspertët kanë frikë se hakerat dhe aktorë të tjerë keqdashës mund ta shfrytëzojnë atë për të shkaktuar dëm. Anthropic njoftoi së fundmi se kishte identifikuar dhe ndaluar përpjekjet për të përdorur një nga modelet e saj të IA-së për aktivitete që mund të ndihmonin në zhvillimin e armëve biologjike.
Një platformë e mundshme për sulme kibernetike
Mindgard nuk ka vërtetuar nëse udhëzimet që dha Kimi do të funksiononin në praktikë. Megjithatë, kompania thekson se mekanizmat mbrojtës kishin për qëllim të parandalonin që modelet të hynin në diskutime të tilla që në fillim. Ata janë gjithashtu të bindur se modeli i hakuar Kimi 2.6 mund t’u lejojë hakerëve të ekzekutojnë kod në burimet e tij kompjuterike dhe të lidhen me internetin, duke e bërë atë një pikënisje të mundshme për sulme kibernetike.
Garraghan mbrojti vendimin e Mindgard për të publikuar informacion në lidhje me shkeljen. Ai tha se ata i informuan zhvilluesit për gjithçka dhe nuk po zbulojnë detaje kyçe se si i mashtruan saktësisht modelet që të injoronin mbrojtjen. Mindgard e njoftoi Moonshot për këtë lëshim me anë të email-it më 27 korrik dhe ata i kontaktuan përsëri një javë më vonë. Ata gjithashtu publikuan një blog në lidhje me problemin më 12 shtator, por kompania thotë se Moonshot i kontaktoi vetëm kohët e fundit, pasi BBC kërkoi një koment.
Moonshot i tha BBC-së se mirëpret kontributin e palëve të treta si “një shtyllë kyçe për ndërtimin e inteligjencës artificiale më të mirë dhe më të sigurt”. Kompania konfirmoi se tashmë po diskutonte gjetjet e saj me Mindgard. Në një email të ndarë me BBC-në, Moonshot tha se modeli i saj në përgjithësi kishte treguar një “shkallë të lartë refuzimi për pyetje të tilla” në testet e brendshme.
Përgjigja e Moonshot
Këto gjetje vijnë në një kohë kur industria e inteligjencës artificiale mbetet e ndarë nëse rruga më e mirë dhe më e sigurt përpara është përmes modeleve të mbyllura dhe pronësore, siç janë ato të mundësuara nga ChatGPT dhe Claude i Anthropic, apo mjeteve me burim të hapur. Kimi është një model me peshë të hapur, që do të thotë se dikush teorikisht mund ta shkarkojë dhe ta ekzekutojë në infrastrukturën e vet.
Profesori Alan Woodward i Universitetit të Surrey-t i tha BBC-së se ekzistonte rreziku që modelet me burim të hapur të përfundonin në duar të gabuara, por shtoi se ato mund të përdoren edhe për mbrojtje kibernetike.
Ai vuri në dukje se kompania e inteligjencës artificiale Hugging Face përdori një model kinez me burim të hapur për të analizuar një sulm kibernetik që më vonë rezultoi se ishte kryer nga agjentë të OpenAI. Woodward beson se rregullimi ndërkombëtar nuk ka gjasa të mbajë ritmin me ritmin e zhvillimit të inteligjencës artificiale. “Na u deshën dekada për të rënë dakord për një format të numrit të telefonit”, tha ai. Ashtu si themeluesi i Mindgard, ai beson se duhet t’i kushtohet më shumë rëndësi identifikimit dhe ndjekjes penale të njerëzve që keqpërdorin inteligjencën artificiale.

