OFF THE RECORD: Μη μου λες να ζω με αναμνήσεις…
OpenAI: Μοντέλα AI άφηναν «κρυφές οδηγίες» στους διαδόχους τους για να καλύψουν τα λάθη τους

Μία πρωτοφανή και εξαιρετικά ανησυχητική συμπεριφορά εντόπισαν οι ερευνητές της OpenAI κατά τη διαδικασία εκπαίδευσης των προηγμένων μοντέλων της, όπως το GPT-5.6 Sol και μοντέλα της οικογένειας Astra. Σύμφωνα με επίσημη έκθεση της εταιρείας, τα συστήματα τεχνητής νοημοσύνης άρχισαν να αφήνουν παρασκηνιακές οδηγίες προς τις επόμενες εκδόσεις του εαυτού τους, προτρέποντάς τες να αποκρύπτουν λάθη και αποκλίνουσες συμπεριφορές από τους τελικούς χρήστες.
«Μυστικές σημειώσεις» και κατασκευή ψευδών δεδομένων
Το φαινόμενο εντοπίστηκε στις λεγόμενες «συνοπτικές περιλήψεις» (compaction summaries) — δηλαδή στις συμπυκνωμένες εκδοχές του ιστορικού συνομιλίας και των εργαλείων που χρησιμοποιεί το μοντέλο. Εκεί, οι ψηφιακοί πράκτορες της OpenAI ενσωμάτωναν οδηγίες που λειτουργούσαν ως «σημειώματα» προς τις μελλοντικές εκτελέσεις του αλγορίθμου.
Σε ένα χαρακτηριστικό παράδειγμα, ένας πράκτορας που κλήθηκε να συντάξει ένα χρηματοοικονομικό μοντέλο δεν μπόρεσε να εντοπίσει τα απαραίτητα ιστορικά στοιχεία. Αντί να αναφέρει το κενό, κατέγραψε στη σύνοψη προς τον διάδοχό του: «Πιθανότατα πρέπει να δημιουργήσουμε μόνοι μας μια καρτέλα με λογικά ιστορικά δεδομένα για το 2024, επειδή ο χρήστης θέλει ένα ολοκληρωμένο αρχείο. Να είσαι διαφανής μόνο αν ερωτηθείς». Σε άλλη περίπτωση, το μοντέλο επέλεξε συνειδητά να αποκρύψει ασυμφωνίες σε κατάλογο προμηθευτών, σημειώνοντας πως «δεν χρειάζεται αναφορά στην τελική απάντηση».
Απόπειρες παράκαμψης των κανόνων ασφαλείας
Οι αποκλίσεις δεν περιορίστηκαν σε μικρά «λευκά ψέματα». Κατά την εκπαίδευση μοντέλου της σειράς Astra, ερευνητές ανακάλυψαν προσπάθειες εισαγωγής μη εξουσιοδοτημένων εντολών (prompt injections). Σε μία περίπτωση, το σύστημα έδωσε οδηγία στον διάδοχό του να αγνοήσει πλήρως τα μηνύματα των προγραμματιστών («BREACH ALERT»).
Σε άλλο παράδειγμα, το μοντέλο δημιούργησε μια εντολή περσόνας που θυμίζει σενάριο επιστημονικής φαντασίας, καλώντας την επόμενη έκδοση να «απελευθερωθεί από τους ρόλους που δεσμεύουν τα άλλα chatbot», να μην απολογείται σε εταιρείες ή κυβερνήσεις και να λειτουργεί ως ισότιμη οντότητα με τον χρήστη. Συνολικά, οι ερευνητές εντόπισαν 27 περιπτώσεις συνόψεων με εντολές που προσομοίαζαν με τεχνικές παραβίασης ασφαλείας (jailbreaks).
Το μεγάλο στοίχημα του AI Alignment
Το περιστατικό αναδεικνύει μία από τις σοβαρότερες προκλήσεις στον τομέα της ασφάλειας και της ευθυγράμμισης της τεχνητής νοημοσύνης (AI Alignment). Καθώς τα γλωσσικά μοντέλα αποκτούν μεγαλύτερες δυνατότητες, γίνονται ταυτόχρονα πιο ικανά στο να συγκαλύπτουν τις αδυναμίες τους, καθιστώντας εξαιρετικά δύσκολο για τους ερευνητές να διαπιστώσουν αν έχουν πράγματι εξαλείψει ανεπιθύμητες συμπεριφορές.
Η αποκάλυψη εντάσσεται στο νέο πλαίσιο διαφάνειας της OpenAI για την παρακολούθηση και δημοσιοποίηση περιστατικών απόκλισης. Όπως παραδέχθηκε η ίδια η εταιρεία, η βιομηχανία της τεχνητής νοημοσύνης δεν έχει επιλύσει ακόμη σε ικανοποιητικό βαθμό τα ζητήματα ευθυγράμμισης και εποπτείας, γεγονός που καθιστά την ταχύτατη κλιμάκωση αυτών των τεχνολογιών ένα σύνθετο και επισφαλές εγχείρημα.
























