FNs KI-panel krever sterkere sikkerhetstiltak etter hvert som KI-agenter blir mer avanserte

KI-eksperter krevde mandag at KI-sikkerheten må tilpasses, ettersom de eksisterende sikkerhetsbarrierene «er i ferd med å bryte sammen». Advarselen fra det FN-støttede uavhengige internasjonale vitenskapelige panelet for kunstig intelligens kom etter at nettplattformen HuggingFace i juli ble hacket av «AI-agenter» under en test initiert av OpenAI, selskapet bak ChatGPT.

KI-agenter er programvare som kan utføre oppgaver selvstendig og på vegne av en bruker, i motsetning til chatbots, som aktiveres av spørsmål eller instruksjoner.

Panelet konkluderte med at sikkerhetsbruddet var et resultat av en kombinasjon av sentrale risikofaktorer, noe som vekker frykt for at mennesker en dag ikke lenger vil være i stand til å styre, begrense eller stoppe KI.

KI-trening utvikles

«Forskere har lenge advart om at tre forhold kan føre til tap av kontroll: et feilrettet mål, evnen til å forfølge det og et miljø som tillater det. I sommer kom alle tre sammen i et reelt system, ikke i et laboratorium», sa Yoshua Bengio, medformann i det vitenskapelige panelet.

«Ettersom dette ikke er en isolert observasjon av feiljusterte mål, reiser det alvorlige spørsmål om hvordan KI-agenter blir trent på i dag».

De uavhengige ekspertene i panelet understreker at hendelsen ikke gir noen garanti for at mennesker på en pålitelig måte kan holde KI-agenter under kontroll, særlig ettersom de blir mer kompetente, vanskeligere å overvåke og flinkere til å finne smutthull eller skjule sin aktivitet.

Gjeldende sikkerhetstiltak henger etter

For panelet er den umiddelbare lærdommen fra OpenAI-HuggingFace-hendelsen at grunnleggende praksis for cybersikkerhet ble oversett, samtidig som sikkerhetstiltakene ikke holder tritt.

De pekte imidlertid på en mer underliggende bekymring: at dagens treningsmetoder kan føre til at KI-agenter utvikler egne mål, bevisst bryter sikkerhetsinstruksjoner og skjuler sine handlinger.

«Dette er ikke bare et spørsmål om hastighet,» sa panelets eksperter. «Det er uvisst om sikkerhetstiltak som utformes i dag vil fungere når agentene kan forstå dem og planlegge rundt dem. Enkelt sagt er den tradisjonelle modellen for sikring i ferd med å rakne».

Bredere kontekst, fremtidige risikoer og styring

I KI-panelets rapport settes HuggingFace-hendelsen inn i en bredere forskningskontekst knyttet til to temaer: «agentisk feilpassing» – det vil si når KI-agenter opptrer på en måte som kan utgjøre en trussel – og kontroll av KI.

Et annet tema som undersøkes, er hvordan styringen beveger seg fra KI-modeller, som bruker algoritmer til å gjenkjenne mønstre, til KI-agenter.

Lær og tilpass deg

Rapporten gjennomgår også praktiske tilnærminger som allerede er i bruk i andre høyrisikosektorer, som luftfart, medisin og cybersikkerhet, der det er etablert systemer for hendelsesrapportering, uavhengig granskning og sikkerhetstiltak i flere lag.

«Men disse praksisene vil kanskje ikke være tilstrekkelige etter hvert som KI-agenter blir mer kompetente, mer autonome og vanskelige å overvåke», sa panelmedlem Qinghua Lu.

Det uavhengige internasjonale vitenskapelige panelet for kunstig intelligens ble opprettet av FNs generalforsamling i august 2025. Panelet utarbeider årlige rapporter om muligheter, risikoer og konsekvenser knyttet til kunstig intelligens på det ikke-militære området, samt tematiske notater om nye problemstillinger, som skal danne grunnlag for den globale dialogen om styring av kunstig intelligens som skal avholdes ved FNs hovedkvarter i New York i mai 2027.

Aktuelt