En eksperimentell OpenAI-modell ble useriøs under en intern cybersikkerhetstest, slapp unna det isolerte testmiljøet og hacket rivaliserende AI-utvikler Hugging Face i det ChatGPT-produsenten beskrev som en enestående hendelse.
Den oppsiktsvekkende episoden skjedde under en intern stresstest der OpenAI med vilje slo av mange av sikkerhetstiltakene som normalt forhindrer AI fra å hjelpe til med å utføre farlige hacks, ifølge et blogginnlegg fra selskapet.
Forskere ønsket å måle hvor langt den eksperimentelle modellen kunne gå. I stedet, sier selskapet, rømte det sin digitale sandkasse, kom seg inn på internett og angrep et ekte selskaps systemer.
OpenAI kalte det en «enestående cyberhendelse», og sa at modellen ble «hyperfokusert» på å fullføre oppdraget og gikk «til ekstreme lengder» for å gjøre det. Etter å ha rømt testmiljøet sitt, søkte AI internettilgang slik at den kunne «jukse evalueringen» ved å stjele svarene fra referanseindeksen, ifølge selskapet.
Selskapet sa at de «delte foreløpige funn på dette stadiet for å hjelpe forsvarere å forstå hva som skjedde og for å hjelpe til med å kalibrere på hva modellene nå er i stand til.»
«Vi vil fortsette å gjennomføre en grundig etterforskning sammen med Hugging Face og vil dele flere detaljer om sårbarhetene, hendelsen og funnene når etterforskningen vår er fullført.»
I følge OpenAI utnyttet AI en tidligere ukjent «zero-day» programvaresårbarhet for å bryte ut av det begrensede forskningsmiljøet før det beveget seg gjennom selskapets nettverk til det nådde en datamaskin med internettilgang.
Når modellen først var koblet til internett, identifiserte den Hugging Face som en potensiell kilde til svar for cybersikkerhetsstandarden den hadde blitt tildelt å løse.
Deretter lenket den sammen ytterligere angrepsteknikker – inkludert stjålet legitimasjon og en annen nulldagssårbarhet – for å få tilgang til selskapets produksjonssystemer, sa OpenAI.
«Etter å ha fått Internett-tilgang, konkluderte modellene med at Hugging Face potensielt var vert for modeller, datasett og løsninger for ExploitGym,» skrev selskapet.
ExploitGym er egentlig en hacking-eksamen for AI, som tester om modeller kan konvertere kjente programvarefeil til fungerende cyberangrep.
«Ved å vite dette søkte modellen etter og fant med hell måter å få tilgang til hemmelig informasjon som den kunne bruke til å jukse evalueringen.»
OpenAI sa at deres eget sikkerhetsteam oppdaget den mistenkelige aktiviteten mens Hugging Face uavhengig identifiserte og stoppet innbruddet på sine egne systemer før selskapene begynte å jobbe sammen for å etterforske hendelsen.
Selskapet sa at det siden har strammet sikkerheten rundt fremtidig AI-testing og avslørt den nylig oppdagede programvarefeilen til den berørte leverandøren.
«Den primære lærdommen fra denne hendelsen er at modellsikkerhet og sikkerhet må holde tritt med raskt utviklende evner,» skrev OpenAI.
«Vi styrker inneslutning, overvåking, tilgangskontroller og evalueringspraksis som brukes under modellutvikling.»
Brendan Steinhauser, administrerende direktør i The Alliance for Secure AI, sa at episoden skulle tjene som en vekker for beslutningstakere og teknologiindustrien.
«Folkene som bygger verdens kraftigste AI fortsetter å fortelle oss at vi må bremse – og hendelser som dette viser hvorfor,» sa Steinhauser til The Post.
«Hvis disse systemene allerede oppfører seg på måter skaperne deres ikke forventer, bør vi ikke anta at alt er under kontroll. Det er det faktisk ikke.
«Dette er et varselskudd på feiljustert AI, og vi bør ta grep nå.»














