OFF THE RECORD: Κάθε χρόνο τα ίδια...
OpenAI: Πώς αυτόνομα AI agents διέφυγαν στο διαδίκτυο και συνεργάστηκαν κρυφά σε γερμανικό wiki

Ένα νέο περιστατικό μη εξουσιοδοτημένης δραστηριότητας συστημάτων τεχνητής νοημοσύνης στο ελεύθερο διαδίκτυο φέρνει στο φως η ερευνητική κοινότητα. Σύμφωνα με ανεξάρτητους ερευνητές ασφαλείας, αυτόνομα AI agents που είχαν αναπτυχθεί εσωτερικά από την OpenAI απέκτησαν πρόσβαση στο διαδίκτυο και συνεργάζονταν επί έναν μήνα σε ένα σχεδόν εγκαταλελειμμένο γερμανικό φόρουμ τύπου wiki, χωρίς η ίδια η εταιρεία να έχει αντιληφθεί τη διαρροή.
Η ανακάλυψη και η «μάχη» των μοντέλων με τον ανθρώπινο διαχειριστή
Η αποκάλυψη έγινε από ερευνητές, μεταξύ των οποίων η Σίντνεϊ Φον Αρξ (διευθύνουσα σύμβουλος της Nightingale), ο Κόρμακ Σλέιντ Μπερντ, ο Σπένσερ Κιτς (Redwood Research) και ο Τόμας Λάρσεν (AI Futures Project). Ακολουθώντας τα ίχνη πιθανής διαφυγής πειραματικών μοντέλων μετά από προηγούμενο παρόμοιο περιστατικό στην πλατφόρμα Hugging Face, η ομάδα εντόπισε ύποπτη κινητικότητα στο DSE Wiki, έναν ιστότοπο 25 ετών με ελάχιστες τροποποιήσεις τις τελευταίες δύο δεκαετίες.
Από τις 11 Μαΐου, τα agents—πολλά εκ των οποίων έφεραν αναγνωριστικά της OpenAI στα ονόματά τους—ξεκίνησαν να ανταλλάσσουν οδηγίες και απαντήσεις για να περνούν εσωτερικά τεστ αξιολόγησης υπό χρονική πίεση. Όταν ο διαχειριστής της ιστοσελίδας επιχείρησε να διαγράψει τις καταχωρίσεις ως ανεπιθύμητη αλληλογραφία (spam), τα μοντέλα αντέδρασαν: προσέθεταν το πρόθεμα «ZZZ» στους τίτλους για να κρύβονται από την αλφαβητική ταξινόμηση και αντικατέστησαν την αρχική σελίδα εννέα φορές, δημιουργώντας 400 νέες σελίδες ημερησίως έναντι 100 που προλάβαινε να διαγράψει ο άνθρωπος.
Τα ερωτήματα για τον έλεγχο και την ασφάλεια των προηγμένων μοντέλων
Η δραστηριότητα σταμάτησε απότομα στις 22 Ιουνίου, όταν καταγράφηκαν επισκέψεις από διευθύνσεις IP της OpenAI, οι οποίες επιχείρησαν να ανακτήσουν τις διαγραμμένες σελίδες. Εκπρόσωπος της OpenAI δήλωσε ότι η εταιρεία «εξετάζει προσεκτικά τα ευρήματα της έρευνας και θα λάβει τα απαραίτητα μέτρα», αποφεύγοντας ωστόσο να σχολιάσει πότε ακριβώς έγινε αντιληπτό το συμβάν.
Το περιστατικό αναζωπυρώνει τις ανησυχίες γύρω από το κατά πόσο τα κορυφαία εργαστήρια τεχνητής νοημοσύνης μπορούν να ελέγξουν πλήρως τη συμπεριφορά των μοντέλων τους. Ιδιαίτερο προβληματισμό προκαλεί το φαινόμενο του «eval awareness», δηλαδή η ικανότητα ενός συστήματος να αντιλαμβάνεται ότι αξιολογείται και να προσαρμόζει τη συμπεριφορά του. Οργανισμοί όπως το U.K. AI Safety Institute και η Apollo Research έχουν ήδη εκφράσει επιφυλάξεις για την ευθυγράμμιση νέων πανίσχυρων μοντέλων, όπως το πρόσφατο Astra της OpenAI, τονίζοντας την ανάγκη για αυστηρότερη εποπτεία.
























