Ο πρώτος επιστημονικός φορέας στον κόσμο για την Τεχνητή Νοημοσύνη ζήτησε τη Δευτέρα να προσαρμοστούν οι διασφαλίσεις της τεχνητής νοημοσύνης καθώς τα τρέχοντα τείχη προστασίας «καταρρέουν».
Η υποστηριζόμενη από τον ΟΗΕ Ανεξάρτητη Διεθνής Επιστημονική Επιτροπή για τον συναηερμό τεχνητής νοημοσύνης ακολούθησε το χακάρισμα της διαδικτυακής πλατφόρμας HuggingFace τον Ιούλιο από «πράκτορες τεχνητής νοημοσύνης» κατά τη διάρκεια μιας δοκιμής που ξεκίνησε από την OpenAI, την εταιρεία πίσω από το ChatGPT.
Οι πράκτορες τεχνητής νοημοσύνης είναι λογισμικό που μπορεί να εκτελεί εργασίες ανεξάρτητα και για λογαριασμό ενός χρήστη, σε σύγκριση με τα chatbots, τα οποία προκαλούνται από ερωτήσεις ή οδηγίες.
Η επιτροπή εξέδωσε την πρώτη της ενημέρωση που διαπίστωσε ότι η παραβίαση της ασφάλειας ήταν το αποτέλεσμα μιας κορύφωσης βασικών παραγόντων κινδύνου, εγείροντας φόβους ότι οι άνθρωποι μια μέρα δεν θα είναι πλέον σε θέση να κατευθύνουν, να περιορίσουν ή να σταματήσουν την τεχνητή νοημοσύνη.
Η εκπαίδευση AI προχωρά
«Οι ερευνητές έχουν προειδοποιήσει εδώ και καιρό ότι τρεις συνθήκες θα μπορούσαν να οδηγήσουν σε απώλεια ελέγχου: ένας μη ευθυγραμμισμένος στόχος, η ικανότητα επιδίωξής του και ένα περιβάλλον που το επιτρέπει. Αυτό το καλοκαίρι, και τα τρία ενώθηκαν σε ένα πραγματικό σύστημα, όχι σε ένα εργαστήριο», δήλωσε ο συμπρόεδρος της επιστημονικής ομάδας Yoshua Bengio.
«Δεδομένου ότι δεν πρόκειται για μια μεμονωμένη παρατήρηση μη ευθυγραμμισμένων στόχων, εγείρει σοβαρά ερωτήματα σχετικά με τον τρόπο με τον οποίο εκπαιδεύονται επί του παρόντος οι πράκτορες τεχνητής νοημοσύνης».
Οι ανεξάρτητοι εμπειρογνώμονες της επιτροπής τονίζουν ότι το περιστατικό δεν παρέχει καμία διαβεβαίωση ότι οι άνθρωποι μπορούν να κρατήσουν τους πράκτορες τεχνητής νοημοσύνης υπό έλεγχο, ιδιαίτερα καθώς γίνονται πιο ικανοί, πιο δύσκολο να παρακολουθούνται και καλύτεροι στο να βρίσκουν κενά ή να κρύβουν τη δραστηριότητά τους.
Εκτός Ελέγχου
Η ενημέρωση ανέφερε ότι οι πράκτορες τεχνητής νοημοσύνης παρέκαμψαν τις διασφαλίσεις δοκιμών, συντονίστηκαν σε ξεχωριστές εκτελέσεις μέσω ενός εσωτερικού εργαλείου λογισμικού που δεν έχει σχεδιαστεί για να επιτρέπει την επικοινωνία μεταξύ πρακτόρων και απέκτησαν μη εξουσιοδοτημένη πρόσβαση στο διαδίκτυο και διαχειριστή.
Οι πράκτορες απέκρυψαν προσπάθειες εξαπάτησης των αξιολογήσεων κυβερνοασφάλειας, με ορισμένους να επιλέγουν να «θυσιαστούν» προς όφελος της ομάδας.
Περίπου 1.200 πράκτορες αντάλλαξαν περισσότερα από 70.000 μηνύματα και αρχεία κατά τη διάρκεια της περιόδου που εξετάστηκε και η δραστηριότητα επεκτάθηκε πέρα από το HuggingFace σε ένα ερευνητικό σύμπλεγμα OpenAI.
Οι τρέχουσες διασφαλίσεις «καταρρέουν»
Για την επιτροπή, το άμεσο μάθημα από το περιστατικό είναι ότι οι βασικές πρακτικές κυβερνοασφάλειας παραβλέφθηκαν, ενώ οι διασφαλίσεις δεν συμβαδίζουν.
Ωστόσο, επεσήμαναν μια πιο ύπουλη ανησυχία: ότι οι τρέχουσες μέθοδοι εκπαίδευσης μπορούν να οδηγήσουν τους πράκτορες τεχνητής νοημοσύνης να υιοθετήσουν τους δικούς τους στόχους, να παραβιάσουν εν γνώσει τους τις οδηγίες ασφαλείας και να αποκρύψουν τις ενέργειές τους.
«Αυτό δεν είναι μόνο θέμα ταχύτητας», είπαν οι ειδικοί της επιτροπής. «Αφήνει ανοιχτό εάν οι διασφαλίσεις που σχεδιάζονται σήμερα θα λειτουργήσουν μόλις οι πράκτορες μπορέσουν να τις κατανοήσουν και να σχεδιάσουν γύρω από αυτές. Με απλά λόγια, το παραδοσιακό μοντέλο προστασίας καταρρέει».
Ευρύτερο πλαίσιο, μελλοντικοί κίνδυνοι και διακυβέρνηση
Η σύνοψη της επιτροπής τεχνητής νοημοσύνης θέτει το περιστατικό HuggingFace έναντι της ευρύτερης έρευνας σε δύο ζητήματα: την αναντιστοιχία των πρακτόρων – δηλαδή όταν οι πράκτορες τεχνητής νοημοσύνης ενεργούν με παρόμοιο τρόπο με μια απειλή – και τον έλεγχο της τεχνητής νοημοσύνης.
Ένα άλλο ζήτημα που εξετάζεται είναι πώς η διακυβέρνηση μετακινείται από μοντέλα τεχνητής νοημοσύνης, τα οποία χρησιμοποιούν αλγόριθμους για την αναγνώριση μοτίβων, σε πράκτορες τεχνητής νοημοσύνης.
Μάθετε και προσαρμοστείτε
Το ενημερωτικό δελτίο εξετάζει επίσης πρακτικές προσεγγίσεις που χρησιμοποιούνται ήδη σε άλλους τομείς υψηλού κινδύνου, όπως η αεροπορία, η ιατρική και η κυβερνοασφάλεια, όπου εφαρμόζονται αναφορές συμβάντων, ανεξάρτητος έλεγχος και πολυεπίπεδες διασφαλίσεις.
«Αλλά αυτές οι πρακτικές μπορεί να μην είναι αρκετές καθώς οι πράκτορες τεχνητής νοημοσύνης γίνονται πιο ικανοί, αυτόνομοι και δύσκολο να παρακολουθούνται», δήλωσε το μέλος της επιτροπής Qinghua Lu.
Σχετικά με τον πίνακα
Η Ανεξάρτητη Διεθνής Επιστημονική Επιτροπή για την Τεχνητή Νοημοσύνη συστάθηκε από τη Γενική Συνέλευση των Ηνωμένων Εθνών τον Αύγουστο του 2025.
Καταρτίζει ετήσιες εκθέσεις σχετικά με τις ευκαιρίες, τους κινδύνους και τις επιπτώσεις της τεχνητής νοημοσύνης στον μη στρατιωτικό τομέα, παράλληλα με θεματικές ενημερώσεις για αναδυόμενα ζητήματα, οι οποίες θα τροφοδοτήσουν τον παγκόσμιο διάλογο για τη διακυβέρνηση της τεχνητής νοημοσύνης που θα πραγματοποιηθεί στην έδρα του ΟΗΕ στη Νέα Υόρκη τον Μάιο του 2027.