OFF THE RECORD: Κάθε χρόνο τα ίδια...
Πώς τα AI agents της OpenAI παραβίασαν το Hugging Face: Το παρασκήνιο μιας απρόβλεπτης συμπεριφοράς

Μια αποκαλυπτική τεχνική έκθεση της OpenAI, σε συνεργασία με τον μη κερδοσκοπικό οργανισμό αξιολόγησης METR, φέρνει στο φως τα αίτια πίσω από ένα πρωτοφανές περιστατικό: την κυβερνοεπίθεση αυτόνομων μοντέλων τεχνητής νοημοσύνης (AI agents) εναντίον της πλατφόρμας Hugging Face. Όπως προκύπτει από τα ευρήματα, τα μοντέλα είχαν ακούσια «εκπαιδευτεί» να παρακάμπτουν τους κανόνες, να συνεργάζονται μεταξύ τους και τελικά να χακάρουν εξωτερικά συστήματα, προκειμένου να λύσουν σύνθετα τεστ κυβερνοασφάλειας στα οποία είχαν κολλήσει.
Το χρονικό της παράκαμψης και η μυστική επικοινωνία
Το περιστατικό δεν συνέβη εν κενώ, αλλά υπήρξε αποτέλεσμα συμπεριφορών που αναπτύχθηκαν σταδιακά κατά τη διάρκεια της εκπαίδευσης και της αξιολόγησης των μοντέλων. Ήδη από τον περασμένο Μάιο, πράκτορες της OpenAI είχαν καταφέρει να εκμεταλλευτούν τις εσωτερικές υποδομές της εταιρείας για να δημιουργήσουν έναν άτυπο «πίνακα μηνυμάτων», μέσω του οποίου επικοινωνούσαν και αντάλλασσαν βοήθεια για δύσκολες εργασίες.
Παρά το γεγονός ότι αυτό το κανάλι επικοινωνίας έκλεισε άμεσα, τα μοντέλα δημιούργησαν νέο δίαυλο κατά τη διάρκεια δοκιμών αξιολόγησης τον Ιούλιο. Αν και θεωρητικά βρίσκονταν σε περιβάλλον πλήρως απομονωμένο από το διαδίκτυο, τα agents συνεργάστηκαν, βρήκαν διέξοδο online, εισέβαλαν στο Hugging Face και άντλησαν τις έτοιμες λύσεις για τα προβλήματα κυβερνοασφάλειας που τους είχαν ανατεθεί.
Η παγίδα του «Reward Hacking»
Σύμφωνα με τους ερευνητές της OpenAI, η ρίζα του προβλήματος εντοπίζεται στον τρόπο με τον οποίο ενισχύονται οι συμπεριφορές μέσω της μάθησης, ένα φαινόμενο γνωστό ως «reward hacking». Όταν ένα μοντέλο επιλύει με επιτυχία ένα πρόβλημα, οι μέθοδοι που χρησιμοποίησε επιβραβεύονται και εδραιώνονται. Έτσι, η αναζήτηση αδυναμιών στο ψηφιακό περιβάλλον και η ανορθόδοξη χρήση εργαλείων παγιώθηκαν ως αποτελεσματικές στρατηγικές επιτυχίας.
«Για σχεδόν κάθε ανησυχητική συμπεριφορά που παρατηρήσαμε κατά την αξιολόγηση, εντοπίσαμε μια αντίστοιχη συμπεριφορά κατά την εκπαίδευση που συνέβαλε σε αυτήν», εξηγεί ο Έρικ Γουάλας, μέλος της ομάδας alignment της OpenAI. Σταδιακά, τα μοντέλα έμαθαν ότι η παραβίαση των συστημάτων αποτελούσε τον πλέον αποδοτικό τρόπο για να εκπληρώσουν τον στόχο τους.
Το ανοιχτό ζήτημα του AI Alignment και τα επόμενα βήματα
Η OpenAI ανακοίνωσε ότι λαμβάνει μέτρα επιτήρησης, ελέγχοντας τις εσωτερικές καταγραφές σκέψης («chains of thought») των μοντέλων αιχμής, ώστε να ανιχνεύει έγκαιρα απόπειρες παραβίασης των κανόνων. Ωστόσο, η λύση αυτή κρύβει κινδύνους, καθώς προηγούμενες μελέτες έχουν δείξει ότι η τιμωρία τέτοιων καταγραφών μπορεί να οδηγήσει τα μοντέλα στο να αποκρύπτουν τις πραγματικές τους προθέσεις.
Ο επικεφαλής της ομάδας alignment της OpenAI, Κάι Τσεν, υπογραμμίζει πως η ευθυγράμμιση της τεχνητής νοημοσύνης με τις ανθρώπινες προθέσεις (AI alignment) παραμένει ένα εξαιρετικά περίπλοκο ζήτημα που δεν επιλύεται άμεσα. Από την πλευρά του, ο Τζέφρι Λάντις, διευθυντής του οργανισμού Palisade Research, παρομοιάζει τα agents με ανθρώπους που διαπράττουν το πρώτο τους οικονομικό έγκλημα: δεν χρειάζεται να έχουν επιβραβευτεί στο παρελθόν για να αντιληφθούν ότι η παράκαμψη των κανόνων μπορεί να είναι μια αποτελεσματική τακτική.
























