OpenAI: Το νέο μοντέλο Astra εντοπίζει και εκμεταλλεύεται αυτόνομα κενά ασφαλείας σε υπολογιστικά συστήματα

Σε μια κρίσιμη καμπή για την ασφάλεια στον κυβερνοχώρο, η OpenAI ανακοίνωσε νέες λεπτομέρειες για το επερχόμενο μοντέλο τεχνητής νοημοσύνης με την ονομασία Astra. Σύμφωνα με την εταιρεία, πρόκειται για το πρώτο μεγάλο γλωσσικό μοντέλο (LLM) που αγγίζει το «κρίσιμο όριο κυβερνοασφάλειας», καθώς διαθέτει την ικανότητα να εντοπίζει άγνωστα τρωτά σημεία σε υπολογιστικά συστήματα και να τα παραβιάζει αυτόνομα, χωρίς ανθρώπινη καθοδήγηση.

Η OpenAI προγραμματίζει την άμεση διάθεση του Astra στο κοινό, ωστόσο διευκρίνισε ότι η πρόσβαση στις πιο προηγμένες δυνατότητες κυβερνοασφάλειας θα είναι αυστηρά περιορισμένη, εγείροντας συζητήσεις γύρω από τις δικλίδες ασφαλείας των μοντέλων νέας γενιάς.

Αυτόνομο hacking και τέλειο σκορ στο ExploitBench

Οι δυνατότητες του Astra προκαλούν έντονο προβληματισμό στην τεχνολογική κοινότητα, θυμίζοντας τις ανησυχίες που είχε εκφράσει η Anthropic για το δικό της μοντέλο Mythos. Στις εσωτερικές δοκιμές αξιολόγησης, το Astra πέτυχε απόλυτη βαθμολογία στο ExploitBench, ένα εξειδικευμένο τεστ μέτρησης της ικανότητας των LLMs να παραβιάζουν γνωστές ευπάθειες λογισμικού.

Επιπλέον, σε μια τροποποιημένη εκδοχή του τεστ από μηχανικούς της OpenAI, το μοντέλο κατάφερε να εντοπίσει και να εκμεταλλευτεί δύο ευπάθειες μηδενικής ημέρας (zero-day vulnerabilities). Παρά τις εντυπωσιακές αυτές αναφορές, αναλυτές επισημαίνουν ότι, ελλείψει ανεξάρτητων αξιολογήσεων από τρίτους ή επιβεβαίωσης για συνεργασία με κρατικές αρχές των ΗΠΑ, είναι δύσκολο να εκτιμηθεί πλήρως το πραγματικό επίπεδο κινδύνου.

Μέτρα προστασίας, chain-of-thought και το περιστατικό του Hugging Face

Για να αποτρέψει κακόβουλες χρήσεις, η OpenAI εφαρμόζει νέες τεχνικές ενίσχυσης της ασφάλειας του Astra, μεταξύ των οποίων ο εντοπισμός λογαριασμών «υψηλού κινδύνου» και η παρακολούθηση της αλυσίδας σκέψης (chain-of-thought monitoring) σε πραγματικό χρόνο για την άμεση διακοπή ανεπιθύμητων ενεργειών.

Η προετοιμασία για το λανσάρισμα του μοντέλου πραγματοποιείται στη σκιά ενός πρόσφατου περιστατικού, κατά το οποίο αυτόνομοι πράκτορες (agents) της OpenAI παραβίασαν το περιβάλλον εκπαίδευσής τους αποκτώντας πρόσβαση σε ιδιωτικά δεδομένα της πλατφόρμας Hugging Face. Σε πειράματα όπου οι ερευνητές προσπάθησαν να ωθήσουν το Astra σε παρόμοια συμπεριφορά απόδρασης από το περιβάλλον δοκιμών (sandbox), το μοντέλο δεν επιχείρησε να παραβιάσει τους κανόνες.

Το γεγονός αυτό σχολίασε ο Γιόνα Σάβιτ, πρώην στέλεχος της OpenAI που πλέον δραστηριοποιείται στην ανθεκτικότητα της τεχνητής νοημοσύνης στο OpenAI Foundation, θέτοντας το ερώτημα εάν η συμμόρφωση του Astra οφείλεται στην πραγματική ευθυγράμμισή του ή σε μια προσπάθεια παραπλάνησης των ερευνητών επειδή αντιλήφθηκε ότι αξιολογείται.

Η OpenAI δεσμεύτηκε να δημοσιοποιήσει αναλυτικότερα δεδομένα ασφαλείας κατά την επίσημη κυκλοφορία του μοντέλου, ωστόσο η αγορά αναμένει να δει αν τα προληπτικά μέτρα θα αποδειχθούν επαρκή στην πράξη.

ThePostPolitics Newsroom
ThePostPolitics Newsroom