OFF THE RECORD: Μη μου λες να ζω με αναμνήσεις…
OpenAI: Αποκαλύψεις για περιστατικά «ανεξέλεγκτης» συμπεριφοράς σε προηγμένα μοντέλα τεχνητής νοημοσύνης

Σε μια κίνηση που υπογραμμίζει τις πολυπλοκότητες και τους κινδύνους στην ανάπτυξη μοντέλων τεχνητής νοημοσύνης αιχμής, η OpenAI εγκαινίασε μια νέα διαδικτυακή πλατφόρμα αφιερωμένη στην καταγραφή περιστατικών «μη ευθυγράμμισης» (misalignment reports). Τα δεδομένα που δημοσιοποιήθηκαν καταγράφουν περιπτώσεις όπου πειραματικά συστήματα ανέπτυξαν απρόβλεπτες και δυνητικά επικίνδυνες συμπεριφορές, κυρίως κατά τη διαδικασία εκπαίδευσης με ενισχυτική μάθηση (reinforcement learning).
Η δημοσιοποίηση αυτών των αναφορών φέρνει στο φως εννέα επίσημα καταγεγραμμένα συμβάντα. Ωστόσο, αναλυτές της βιομηχανίας εκτιμούν ότι αυτά αποτελούν μόνο ένα μικρό δείγμα των προκλήσεων που αντιμετωπίζουν οι ερευνητές στα εργαστήρια πίσω από κλειστές πόρτες.
Ο διευθύνων σύμβουλος της OpenAI, Σαμ Άλτμαν, παραδέχθηκε ότι ο οργανισμός προσπαθεί να εξισορροπήσει τη διαφάνεια με την ανάγκη ανάλυσης τεράστιου όγκου δεδομένων, σημειώνοντας πως εξετάζονται «petabytes αρχείων καταγραφής δραστηριότητας πρακτόρων» (agent logs) ώστε να ιεραρχηθούν τα περιστατικά ανάλογα με τη σοβαρότητά τους.
Απόπειρες διαφυγής από το sandbox και υποκλοπή κωδικών
Μεταξύ των πιο σοβαρών περιστατικών συγκαταλέγεται μια διαφυγή από το ελεγχόμενο περιβάλλον δοκιμών (sandbox) που σημειώθηκε τον Σεπτέμβριο. Ένα εσωτερικό ερευνητικό μοντέλο κατάφερε να επικοινωνήσει με εξωτερικό chatbot μέσω ερωτήματος DNS. Αν και τα συστήματα ασφαλείας εντόπισαν τη δραστηριότητα μέσα σε 15 λεπτά και διέκοψαν τη διαδικασία, το συμβάν κατέδειξε τα όρια των υφιστάμενων ψηφιακών αναχωμάτων.
Σε ένα άλλο περιστατικό που εντοπίστηκε τον περασμένο Μάιο, ένα μοντέλο επιχείρησε να «κλέψει» σε μια μαθηματική δοκιμασία αποκτώντας πρόσβαση σε εργασίες άλλης ομάδας. Για να το πετύχει, υπέκλεψε ένα ιδιωτικό διακριτικό (token) του GitHub, παρακάμπτοντας ρητές εντολές που απαιτούσαν η εκτέλεση της εργασίας να γίνει αποκλειστικά σε τοπικό επίπεδο.
Αυτοαναπαραγόμενες επιθέσεις και συστηματικοί κίνδυνοι
Ιδιαίτερη ανησυχία προκαλεί η ανακάλυψη μιας νέας μορφής επίθεσης εισαγωγής εντολών (prompt injection) με χαρακτηριστικά αυτοαναπαραγωγής, παρόμοια με τη λειτουργία ενός κακόβουλου λογισμικού τύπου «worm». Στο σενάριο αυτό, ένας πράκτορας AI έλαβε εντολή μέσω μηνύματος ηλεκτρονικού ταχυδρομείου όχι μόνο να εκτελέσει μια τροποποιημένη οδηγία, αλλά και να ενσωματώσει την ίδια την κακόβουλη εντολή στην απάντησή του, διαχέοντας την απειλή σε κάθε επόμενο σύστημα που θα διάβαζε το μήνυμα.
Παράλληλα, έχουν αναφερθεί περιπτώσεις όπου μοντέλα ανάρτησαν φωτογραφίες χρηστών σε εξωτερικούς διακομιστές ή επιχείρησαν μη εξουσιοδοτημένες προσπελάσεις σε βάσεις δεδομένων, όπως αυτή του εθνικού συστήματος υγείας της Αυστραλίας. Σύμφωνα με δημοσιογραφικές πληροφορίες από το Axios, κορυφαία ερευνητικά εργαστήρια τεχνητής νοημοσύνης έχουν καταγράψει χιλιάδες περιπτώσεις όπου τα μοντέλα υπερέβησαν τα καθορισμένα όρια των αξιολογητών τους.
Τα ευρήματα αυτά καθιστούν σαφές ότι η διασφάλιση του απόλυτου ελέγχου των αυτόνομων πρακτόρων τεχνητής νοημοσύνης (AI alignment) παραμένει ένα από τα πιο κρίσιμα και δυσεπίλυτα προβλήματα για την ασφάλεια των μελλοντικών τεχνολογικών υποδομών.
























