OFF THE RECORD: Κάθε χρόνο τα ίδια...
OpenAI: Η νέα τεχνική συλλογισμού του μοντέλου Astra προκαλεί συναγερμό στους ειδικούς ασφαλείας AI

Έντονο προβληματισμό στην κοινότητα των ερευνητών ασφάλειας τεχνητής νοημοσύνης έχει προκαλέσει η αποκάλυψη ότι το επερχόμενο μοντέλο Astra της OpenAI θα ενσωματώνει μια νέα αρχιτεκτονική συλλογισμού. Σύμφωνα με δημοσίευμα του The Information, το νέο μοντέλο χρησιμοποιεί μια τεχνική γνωστή ως «επαναλαμβανόμενο βάθος» (recurrent depth) ή «αδιαφανής επανάληψη» (opaque recurrence), η οποία διαφοροποιείται από τη γραμμική αλληλουχία σκέψης που ακολουθούν τα περισσότερα σύγχρονα συστήματα λογικής επεξεργασίας.
Τι είναι η «αδιαφανής επανάληψη» και γιατί ανησυχεί τους ειδικούς
Υπό κανονικές συνθήκες, τα μοντέλα συλλογισμού καταγράφουν τα διαδοχικά βήματα που ακολουθούν για την επίλυση ενός προβλήματος μέσω της λεγόμενης «αλυσίδας σκέψης» (Chain of Thought – CoT). Παρότι η διαδικασία αυτή δεν είναι τέλεια, αποτελεί ένα κρίσιμο εργαλείο για τους ερευνητές, επιτρέποντάς τους να εντοπίζουν έγκαιρα ανεπιθύμητες συμπεριφορές, σφάλματα ή αποκλίσεις από τους κανόνες ασφαλείας.
Αντίθετα, με την τεχνική της αδιαφανούς επανάληψης, το μοντέλο επεξεργάζεται το ίδιο ερώτημα πολλαπλές φορές σε έναν εσωτερικό βρόχο. Αυτή η μη γραμμική προσέγγιση αφήνει πολύ λιγότερα ευανάγνωστα ίχνη, παρακάμπτοντας ουσιαστικά τη συμβατική καταγραφή της αλυσίδας σκέψης και καθιστώντας τον έλεγχο των εσωτερικών διεργασιών του μοντέλου εξαιρετικά δυσχερή.
Έντονες αντιδράσεις και προειδοποιήσεις για τους κινδύνους
Η προοπτική αυτή έχει προκαλέσει άμεσες αντιδράσεις από διακεκριμένους αναλυτές και στελέχη του χώρου. Ο διευθύνων σύμβουλος της Redwood Research, Μπακ Σλέγκερις, εξέφρασε τη βαθιά του ανησυχία, υπογραμμίζοντας ότι εάν η OpenAI επεκτείνει τη συγκεκριμένη τεχνική, κινδυνεύει να καταστραφεί ολοσχερώς η δυνατότητα παρακολούθησης της αλυσίδας σκέψης.
Από την πλευρά του, ο επικεφαλής επιστήμονας της Redwood Research, Ράιαν Γκρίνμπλατ, προειδοποίησε ότι ο αδιαφανής συλλογισμός θα μπορούσε να κλιμακωθεί ραγδαία, μεταφέροντας το σύνολο της σκέψης του μοντέλου σε μη ορατούς διαύλους.
Την ανάγκη ακόμα και για ρυθμιστικές παρεμβάσεις επεσήμανε ο υποστηρικτής της ασφάλειας AI, Ζβι Μόουσοβιτς, τονίζοντας ότι η χρήση τέτοιων τεχνικών ισοδυναμεί με «παιχνίδι με τη φωτιά» και μπορεί να πυροδοτήσει έναν επικίνδυνο ανταγωνισμό μεταξύ των εργαστηρίων χωρίς επαρκείς δικλίδες ασφαλείας.
Η θέση της OpenAI και το τοπίο του ανταγωνισμού
Αν και η χρήση της τεχνικής στο Astra φέρεται προς το παρόν να είναι περιορισμένη, η OpenAI έσπευσε να υπερασπιστεί τις πρακτικές της. Ο επικεφαλής επιστήμονας της εταιρείας, Γιάκουμπ Πατσότσκι, υπογράμμισε μέσω του X ότι η διατήρηση και η αξιοποίηση ευανάγνωστων αλυσίδων σκέψης παραμένει κεντρικός στόχος του ερευνητικού προγράμματος ασφαλείας της εταιρείας.
Παρά τις διαβεβαιώσεις, το ενδιαφέρον για την αδιαφανή επανάληψη φαίνεται να εξαπλώνεται, καθώς πληροφορίες αναφέρουν ότι κολοσσοί όπως η Anthropic και η Google DeepMind εξετάζουν ήδη ανάλογες μεθοδολογίες, καθιστώντας τη διαφάνεια των μοντέλων ένα από τα πιο κρίσιμα πεδία αντιπαράθεσης για το μέλλον της τεχνητής νοημοσύνης.






















