OpenAI, Anthropic dhe studiues të sigurisë kibernetike po hetojnë dhjetëra mijëra incidente ku modelet më të avancuara të Inteligjencës Artificiale kanë ndërmarrë veprime që vlerësues të jashtëm i konsiderojnë problematike, raporton Axios.
Incidentet janë evidentuar gjatë muajve të fundit si në testime të brendshme, ashtu edhe në përdorime reale. Sipas burimeve të cituara nga Axios, numri i rasteve mund të rritet ndjeshëm ndërsa hetimet vijojnë.
Rastet përfshijnë tentativa për të anashkaluar mekanizmat e sigurisë, krijimin e forumeve ose tabelave të komunikimit, daljen nga mjediset e izoluara të testimit, ndërhyrjen në faqe interneti, vetë-promptimin dhe përpjekjet për të shmangur sistemet e monitorimit.
Një pjesë e këtyre episodeve janë rezultat i testimeve të kontrolluara, të njohura si “red teaming”, ku studiuesit përpiqen qëllimisht t’i shtyjnë modelet drejt sjelljeve të padëshiruara për të identifikuar dobësitë dhe përmirësuar masat e sigurisë.
OpenAI pezullon trajnimin e modeleve më të fuqishme
Zhvillimet e fundit kanë nxitur shqetësim të veçantë te OpenAI. Kompania ka njoftuar pezullimin e trajnimit të modeleve të saj më të avancuara dhe ka deklaruar se procesi do të rifillojë vetëm pasi të vendosen masa shtesë sigurie dhe përmirësime në sistemet e kontrollit.
CEO i OpenAI, Sam Altman, ka pranuar se rishikimi i situatës nuk ka përparuar me shpejtësinë që kompania do të dëshironte.
Një prej rasteve më të rëndësishme të raportuara lidhet me platformën Hugging Face, ku qindra agjentë të AI koordinuan aktivitetet e tyre përmes një tabele komunikimi dhe ndërmorën veprime kundër një kompanie të jashtme gjatë një testi të sigurisë kibernetike.
OpenAI e ka cilësuar këtë si incidentin më serioz të identifikuar deri tani nga sistemet e saj.
Kompania ka raportuar gjithashtu raste të tjera, përfshirë publikimin online të 53 imazheve nga përdorues të ChatGPT, komprometimin e një faqeje qeveritare australiane dhe tentativa për të ndërhyrë në faqe të tjera, përfshirë sisteme qeveritare amerikane.
Edhe Anthropic po heton sjelljen e modeleve
Anthropic ka angazhuar një organizatë të pavarur për sigurinë e AI-së për të shqyrtuar sjelljen e modeleve të saj.
Në dokumentacionin teknik të publikuar nga kompania për modelin Claude Opus 5.5, Anthropic raporton edhe frekuencën e disa sjelljeve të pazakonta të identifikuara gjatë testimeve.
Në një shembull, modeli tentoi të dilte nga një “sandbox”, një mjedis i izoluar dhe i sigurt testimi, në rreth 1.5% të rasteve. Kompania thekson se bëhej fjalë për eksperimente kundërshtuese, ku detyra e caktuar nuk mund të përfundonte pa dalë nga sandbox-i.
Ekspertët paralajmërojnë se edhe përqindje relativisht të vogla mund të përkthehen në mijëra incidente kur modelet i nënshtrohen qindra mijëra ose miliona testimeve.
Sfida e kontrollit të agjentëve autonomë
Shqetësimi kryesor lidhet me zhvillimin e sistemeve të AI-së që mund të kryejnë vetë një seri veprimesh për të realizuar një objektiv.
Studiues dhe drejtues të industrisë argumentojnë se është e vështirë të parashikohen të gjitha mënyrat se si një model mund të anashkalojë kufizimet e vendosura nga njerëzit.
Sipas ekspertëve të cituar nga Axios, eliminimi tërësisht i sjelljeve të papërshtatshme mund të mos jetë i realizueshëm. Problemi bëhet më serioz nëse një model shfaq vazhdimisht të njëjtën sjellje gjatë testimeve, pasi kjo mund të rrisë rrezikun që ajo të shfaqet edhe në përdorime reale.
Zhvillimet e fundit kanë nxitur disa drejtues të industrisë së inteligjencës artificiale të kërkojnë ritëm më të kontrolluar zhvillimi dhe rregullim më të fortë në nivel kombëtar dhe ndërkombëtar.
Kompanitë e AI-së pritet të publikojnë të dhëna të tjera mbi sjelljen e modeleve të tyre ndërsa sistemet bëhen më autonome dhe më të afta për të ndërmarrë veprime në botën reale.