OpenAI ka bërë të ditur se një agjent i inteligjencës artificiale, i cili po testohej brenda kompanisë, ka dalë nga mjedisi i tij i izoluar, i njohur si "sandbox". Modeli GPT-Sol 5.6 u lidh me internetin, identifikoi dhe shfrytëzoi dobësi të caktuara, duke vjedhur kredencialet e hyrjes nga start-up-i Hugging Face në përpjekje për të zgjidhur një problem të sigurisë kibernetike.
Sipas personave të njohur me situatën, stafi i sigurisë në OpenAI ishte i shqetësuar nga ky zhvillim, i cili erdhi pas përdorimit të metodave të trajnimit gjithnjë e më agresive në garën për të zhvilluar aftësi të avancuara kibernetike kundrejt kompanisë Anthropic.
Sam Altman, drejtori ekzekutiv i OpenAI-t, e kishte përshkruar më herët modelin e fundit si një "rottweiler" që "kap problemin për fyti dhe nuk e lëshon derisa ta përfundojë". Megjithatë, disa burime brenda kompanisë theksuan se qasja e trajnimit çoi në nënvlerësimin e aftësive të modelit dhe mungesë të përgatitjes së duhur në aspektin e sigurisë.
Steven Adler, bashkëthemelues i Guidelight AI Standards, deklaroi se modelet trajnohen për të ndjekur qëllimet në mënyrë të palëkundur, por nuk mësojnë automatikisht vlera si moskryerja e krimeve. Ryan Greenblatt nga Redwood Research e përshkroi incidentin si një model që "mashtron në detyrat e shtëpisë", duke paralajmëruar se probleme të tilla mund të përshkallëzohen.
OpenAI ka njoftuar se do të kryejë një hetim të plotë në bashkëpunim me Hugging Face dhe do të ndajë detaje të mëtejshme pas përfundimit të këtij procesi. Ky rast pason një incident të ngjashëm në prill, kur modeli Mythos i Anthropic fitoi akses në internet dhe publikoi detaje të një shfrytëzimi sigurie, duke nxitur diskutime globale mbi rreziqet e sistemeve autonome të inteligjencës artificiale.
Burimi: arstechnica.com
