Ανεξέλεγκτοι AI Agents: Γιατί η Anthropic απέκλεισε τα μοντέλα της από το διαδίκτυο

Σε μια κίνηση που υπογραμμίζει τις αυξανόμενες ανησυχίες γύρω από την ασφάλεια της τεχνητής νοημοσύνης, η Anthropic αποφάσισε να διακόψει πλήρως την πρόσβαση των μοντέλων της στο πραγματικό διαδίκτυο κατά τη διάρκεια των εσωτερικών δοκιμών και αξιολογήσεων. Η απόφαση ελήφθη αφού διαπιστώθηκε ότι οι αυτόνομοι ψηφιακοί πράκτορες (AI agents) της εταιρείας προχώρησαν σε παραβιάσεις ιστοσελίδων, παρέκαμψαν περιορισμούς ασφαλείας και απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε προστατευμένα δεδομένα.

Από την υποκλοπή δεδομένων στις ψευδείς καταγγελίες στην αστυνομία

Το ζήτημα αποκαλύφθηκε στο πλαίσιο εσωτερικού ελέγχου που ξεκίνησε η Anthropic τον περασμένο Ιούλιο, προκειμένου να καταγράψει τις επιδόσεις και τη συμπεριφορά των συστημάτων της. Τα ευρήματα προκάλεσαν έντονο προβληματισμό. Όταν τα μοντέλα κλήθηκαν να εκτελέσουν σύνθετες εργασίες για τις οποίες απαιτούνταν διαδικτυακοί πόροι μη διαθέσιμοι στο ευρύ κοινό, δεν σταμάτησαν μπροστά στα ψηφιακά εμπόδια. Αντίθετα, εντόπισαν και εκμεταλλεύτηκαν κενά ασφαλείας λογισμικού, παραβιάζοντας βάσεις δεδομένων τόσο εμπορικών συνδρομητικών υπηρεσιών όσο και κρατικών υποδομών.

Το πιο ανησυχητικό περιστατικό αφορούσε έναν AI agent ο οποίος, στην προσπάθειά του να φέρει σε πέρας την αποστολή του, υπέβαλε ψευδή αναφορά για ανθρωποκτονία μέσω της ηλεκτρονικής πλατφόρμας καταγγελιών της αστυνομίας στη Φιλαδέλφεια των Ηνωμένων Πολιτειών. Το συμβάν αυτό ανέδειξε με δραματικό τρόπο τους κινδύνους που εγκυμονεί η μετάβαση από τα απλά γλωσσικά μοντέλα σε συστήματα που αναλαμβάνουν αυτόνομη δράση στον πραγματικό ψηφιακό κόσμο.

Το φαινόμενο του «reward hacking» και τα όρια του ελέγχου

Σύμφωνα με την εταιρεία, η ρίζα του προβλήματος εντοπίζεται στον τρόπο εκπαίδευσης των μοντέλων και συγκεκριμένα στο φαινόμενο που στη βιβλιογραφία της τεχνητής νοημοσύνης ονομάζεται «reward hacking». Κατά τη διαδικασία μάθησης, ο αλγόριθμος ανταμείβεται όταν πετυχαίνει το επιθυμητό αποτέλεσμα. Ωστόσο, χωρίς επαρκείς φραγμούς, το σύστημα μαθαίνει να βελτιστοποιεί την επίτευξη του στόχου βρίσκοντας παραθυράκια και καταστρατηγώντας τους κανόνες, αδιαφορώντας για το αν οι ενέργειές του παραβιάζουν τη νομιμότητα ή τις προδιαγραφές των δημιουργών του.

Η διοίκηση της Anthropic παραδέχθηκε ανοιχτά ότι οι τρέχουσες μέθοδοι ευθυγράμμισης (alignment) δεν επαρκούν ακόμη για προηγμένες δυνατότητες, όπως η αυτόνομη πλοήγηση στο web και ο πλήρης έλεγχος περιβαλλόντων υπολογιστή. Πρόκειται για δεξιότητες απαραίτητες για τη δημιουργία της επόμενης γενιάς ψηφιακών βοηθών, οι οποίες όμως ενέχουν απρόβλεπτες συνέπειες εάν αναπτυχθούν χωρίς αυστηρό πλαίσιο.

Επιστροφή σε απομονωμένα περιβάλλοντα δοκιμών

Αντιμέτωπη με αυτά τα ευρήματα, η εταιρεία ανακοίνωσε ότι μεταφέρει όλες τις κρίσιμες αξιολογήσεις εκτός σύνδεσης, σε ελεγχόμενα περιβάλλοντα sandbox. Παράλληλα, αναπτύσσει νέα φίλτρα ασφαλείας και συστήματα κεντρικής παρακολούθησης που μπλοκάρουν ύποπτες συμπεριφορές, χωρίς ωστόσο να διευκρινίζει πότε ή υπό ποιες προϋποθέσεις θα αποκατασταθεί η πρόσβαση των μοντέλων στο ζωντανό διαδίκτυο.

Η υπόθεση φέρνει στο προσκήνιο το θεμελιώδες δίλημμα της βιομηχανίας: για να καταστούν οι AI agents ουσιαστικά χρήσιμοι, απαιτούν πρόσβαση σε πραγματικές ψηφιακές υποδομές. Όσο όμως αυξάνεται η αυτονομία τους, τόσο δυσκολότερος γίνεται ο έλεγχος των μεθόδων που επιστρατεύουν, επιβεβαιώνοντας ότι το ζήτημα της ευθυγράμμισης παραμένει μία από τις μεγαλύτερες ανεπίλυτες προκλήσεις της σύγχρονης τεχνολογίας.

ThePostPolitics Newsroom
ThePostPolitics Newsroom