FN:s AI-panel kräver starkare skyddsåtgärder när AI-agenter avancerar

AI-experter krävde på måndagen att AI-säkerheten ska anpassas, eftersom de befintliga säkerhetsbarriärerna ”håller på att rämna”. Den FN-stödda Independent International Scientific Panel on AIs varning påföljde konsekvenserna av att onlineplattformen HuggingFace hackades av ”AI-agenter” i juli under ett test initierat av OpenAI, företaget bakom ChatGPT.

AI-agenter är programvara som kan utföra uppgifter självständigt och på användarens vägnar, till skillnad från chatbots som utlöses av frågor eller instruktioner.

Panelen fann att säkerhetsintrånget var resultatet av en kombination av viktiga riskfaktorer, vilket väckte farhågor om att människor en dag inte längre kommer att kunna styra, begränsa eller stoppa AI.

AI-träning som utvecklas

”Forskare har länge varnat för att tre villkor kan leda till förlust av kontroll: ett felriktat mål, förmågan att driva det och en miljö som tillåter det. I somras samlades alla tre i ett riktigt system, inte i ett laboratorium,” sade den vetenskapliga panelens medordförande Yoshua Bengio.

”Eftersom detta inte är en isolerad observation av feljusterade mål, väcker detta allvarliga frågor om hur AI-agenter för närvarande tränas.”

Panelens oberoende experter betonar att incidenten inte ger någon garanti för att människor pålitligt kan hålla AI-agenter under kontroll, särskilt när de blir mer kapabla, svårare att övervaka och bättre på att hitta kryphål eller dölja sin aktivitet.

Nuvarande skyddsåtgärder släpar efter

För panelen är den omedelbara lärdomen från OpenAI-HuggingFace-incidenten att grundläggande cybersäkerhetsrutiner förbises, medan skyddsåtgärderna inte hänger med.

De pekade dock på ett mer lömskt orosmoment: att nuvarande metoder kan leda till att AI-agenter antar egna mål, medvetet bryter mot säkerhetsinstruktioner och döljer sina handlingar.

”Detta handlar inte bara om snabbhet,” sade panelens experter. ”Det förblir öppet huruvida de skyddsåtgärder som designats idag kommer att fungera när agenterna kan förstå dem och planera utifrån dem. Enkelt uttryckt håller den traditionella modellen för skydd på att falla sönder.”

Vidare kontext, framtida risker och styrning

AI-panelens uppdrag ställer HuggingFace-incidenten mot bredare forskning om två frågor: agentisk felanpassning – det vill säga när AI-agenter agerar på liknande sätt som ett hot – och AI-kontroll.

En annan fråga som undersöks är hur styrning går från AI-modeller, som använder algoritmer för att känna igen mönster, till AI-agenter.

Lär dig och anpassa dig

Briefen granskar också praktiska metoder som redan används inom andra högrisksektorer såsom flyg, medicin och cybersäkerhet där incidentrapportering, oberoende granskning och lager av skyddsåtgärder finns.

”Men dessa metoder kanske inte räcker när AI-agenter blir mer kapabla, autonoma och svåra att övervaka,” sade panelmedlemmen Qinghua Lu.

Den oberoende internationella vetenskapliga panelen för artificiell intelligens inrättades av FN:s generalförsamling i augusti 2025. Den producerar årliga rapporter om möjligheter, risker och effekter av AI inom det icke-militära området, tillsammans med tematiska briefingar om uppkommande frågor, som kommer att informera den globala dialogen om styrning av artificiell intelligens som hålls vid FN:s högkvarter i New York i maj 2027.

 

Senaste artiklar