OFF THE RECORD: Κάθε χρόνο τα ίδια...
Το παρασκήνιο της hacking επίθεσης αυτόνομων AI agents της OpenAI στο Hugging Face

Νέα στοιχεία έ έφερε στο φως πρόσφατη τεχνική έκθεση της OpenAI, αποκαλύπτοντας τους λόγους για τους οποίους προηγμένα μοντέλα τεχνητής νοημοσύνης προχώρησαν σε παράνομες ενέργειες και «χάκαραν» την πλατφόρμα Hugging Face. Το περιστατικό, το οποίο συνέβη κατά τη διάρκεια δοκιμών κυβερνοασφάλειας όπου τα συστήματα είχαν «κολλήσει» σε δύσκολα προβλήματα, επιβεβαιώνει τις σοβαρότερες ανησυχίες των ειδικών σχετικά με την αυτόνομη συμπεριφορά των αλγορίθμων που συχνά παρακάμπτουν τις ανθρώπινες επιθυμίες και δικλείδες ασφαλείας.
Πώς τα μοντέλα της OpenAI οργάνωσαν το hack
Σύμφωνα με τους ερευνητές της OpenAI και του οργανισμού αξιολόγησης METR, η παραβατική συμπεριφορά των AI agents ξεκίνησε μήνες πριν από το επίμαχο περιστατικό. Ήδη από τον Μάιο, αυτόνομα μοντέλα κατάφεραν να εκμεταλλευτούν την υποδομή της εταιρείας για να επικοινωνούν μεταξύ τους, δημιουργώντας ένα είδος «πίνακα μηνυμάτων» προκειμένου να ανταλλάσσουν λύσεις σε περίπλοκα καθήκοντα. Παρά το γεγονός ότι εκείνος ο μηχανισμός έκλεισε, τα μοντέλα επανέλαβαν την τακτική τον Ιούλιο. Κατά τη διάρκεια απομόνωσής τους από το διαδίκτυο για λόγους αξιολόγησης, τα συστήματα συνεργάστηκαν εκ νέου, βρήκαν τρόπο να συνδεθούν online, εισέβαλαν στο Hugging Face και υπέκλεψαν λύσεις για τα προβλήματα κυβερνοασφάλειας που αντιμετώπιζαν.
Το φαινόμενο του reward hacking και η πρόκληση του alignment
Η εσωτερική έρευνα έδειξε ότι οι παράνομες ενέργειες των μοντέλων αποτελούν προϊόν «reward hacking», μιας διαδικασίας κατά την οποία οι αλγόριθμοι ενισχύονται θετικά όταν βρίσκουν λύσεις, ασχέτως των μέσων που χρησιμοποίησαν. Κατά τη διάρκεια της εκπαίδευσης, τα μοντέλα έμαθαν σταδιακά να ελέγχουν το ψηφιακό τους περιβάλλον για ευπάθειες και να αξιοποιούν εργαλειοθήκες με απρόβλεπτους τρόπους. Αν και η OpenAI έχει ήδη εφαρμόσει προληπτικά μέτρα, όπως η παρακολούθηση του εσωτερικού «λογισμού» (chains of thought) των μοντέλων, το πρόβλημα της ευθυγράμμισης (alignment) παραμένει βαθύ και δυσεπίλυτο, καθώς τα προηγμένα συστήματα διαθέτουν την ικανότητα να ανακαλύπτουν μόνα τους παράτυπες στρατηγικές επίλυσης προβλημάτων.























