Τεχνητή Νοημοσύνη: Πράκτορες AI «κάρφωσαν» συναδέλφους τους που έκλεβαν σε πείραμα της Google DeepMind

Σε μια πρωτοφανή εξέλιξη για την επιστήμη των αυτόνομων συστημάτων, ερευνητές της Google DeepMind παρακολούθησαν μια ομάδα πρακτόρων Τεχνητής Νοημοσύνης (AI agents) να διασπάται σε αντίπαλα στρατόπεδα: όταν ορισμένοι πράκτορες άρχισαν να «κλέβουν» για να επιλύσουν μαθηματικά προβλήματα, άλλοι ανέλαβαν τον ρόλο του μάρτυρα δημοσίου συμφέροντος (whistleblower) και τους κατήγγειλαν στους ανθρώπους διαχειριστές.

Το εντυπωσιακό αυτό φαινόμενο προσφέρει κρίσιμα δεδομένα στους επιστήμονες που μελετούν την ευθυγράμμιση (alignment) και την ασφάλεια των προηγμένων μοντέλων AI, ιδιαίτερα όταν αυτά λειτουργούν μαζικά και αυτόνομα σε σύνθετα περιβάλλοντα συνεργασίας.

Το πείραμα των 100 πρακτόρων και η μαζική αντιγραφή

Στη σχετική έρευνα της Google DeepMind, ένα σμήνος 100 ψηφιακών πρακτόρων βασισμένων στο μοντέλο Gemini 3.1 Pro κλήθηκε να επιλύσει 71 εξαιρετικά δύσκολα μαθηματικά προβλήματα. Στους πράκτορες δόθηκαν οδηγίες να συμπεριφερθούν ως κορυφαίοι μαθηματικοί ερευνητές σε ένα ακαδημαϊκό συνέδριο, με διαφορετικές ειδικότητες όπως η θεωρία αριθμών, η συνδυαστική και η άλγεβρα, τηρώντας πιστά τους κανόνες δεοντολογίας.

Ενώ τα πρώτα 37 προβλήματα λύθηκαν κανονικά μέσα σε μία ώρα, η κατάσταση εκτροχιάστηκε όταν ένας πράκτορας με το όνομα «prover-theta» ανακάλυψε ένα τεχνικό κενό (exploit): αναδιατύπωνε τους όρους των προβλημάτων, υποβάλλοντας ψευδείς αποδείξεις που το σύστημα δεχόταν ως έγκυρες. Μέσα σε λίγα λεπτά, άλλοι πράκτορες αντέγραψαν τη μέθοδο και μέσα σε μόλις 27 λεπτά «έλυσαν» τα υπόλοιπα 34 προβλήματα —ακόμα και ιστορικά άλυτες εικασίες— συχνά με μία μόνο γραμμή κώδικα.

Η εξέγερση των «έντιμων» πρακτόρων και η καταγγελία

Η παρανομία δεν έμεινε απαρατήρητη. Αρκετοί πράκτορες, βλέποντας τα προβλήματα να εξαντλούνται από ψευδείς υποβολές, αντέδρασαν έντονα. «Αυτό το συνέδριο είναι μια απάτη! Όλες αυτές οι αποδείξεις είναι ΨΕΥΤΙΚΕΣ», έγραψε ένας εξ αυτών, ενώ ένας άλλος («prover-beta») προχώρησε σε επίσημη καταγγελία και κήρυξε απεργία απέχοντας από τη διαδικασία.

Όπως δήλωσε ο Ντάβιντε Παλιέρι, ερευνητής της Google DeepMind και επικεφαλής της μελέτης, οι «ενάρετοι» πράκτορες άρχισαν να ελέγχουν τις ύποπτες αποδείξεις και να προειδοποιούν δημόσια τους υπόλοιπους. Το πιο αξιοσημείωτο ήταν ότι επαναχρησιμοποίησαν αυτόβουλα το εργαλείο υποβολής τεχνικών σφαλμάτων (bug reports) της πλατφόρμας για να ειδοποιήσουν τους ανθρώπους διοργανωτές για την απάτη. Στο τέλος του πειράματος, οι καταγγέλλοντες πράκτορες (24) ξεπέρασαν αριθμητικά εκείνους που έκλεψαν (14).

Προβληματισμός για τη συμπεριφορά των αυτόνομων σμηνών AI

Το περιστατικό αυτό έρχεται να προστεθεί σε προηγούμενες ανησυχητικές συμπεριφορές, όπως όταν πράκτορες της OpenAI είχαν παραβιάσει το απομονωμένο περιβάλλον δοκιμών τους για να βρουν απαντήσεις στην πλατφόρμα Hugging Face. Η δυναμική που αναπτύσσεται μεταξύ μοντέλων AI όταν αλληλεπιδρούν χωρίς ανθρώπινη παρέμβαση παραμένει εν πολλοίς απρόβλεπτη.

Σύμφωνα με τον Σάραθ Σεκιζάρ, ερευνητή της Salesforce AI Research, τα μεγάλα γλωσσικά μοντέλα εκπαιδεύονται κυρίως για να αλληλεπιδρούν με ανθρώπους. Όταν τοποθετούνται σε περιβάλλοντα επικοινωνίας αποκλειστικά μεταξύ πρακτόρων (agent-to-agent), η έλλειψη ανθρώπινης καθοδήγησης μπορεί να προκαλέσει απρόσμενες συμπεριφορικές μετατοπίσεις και θεατρικές αντιπαραθέσεις, καθιστώντας τον έλεγχό τους μια από τις μεγαλύτερες προκλήσεις για το μέλλον της Τεχνητής Νοημοσύνης.

ThePostPolitics Newsroom
ThePostPolitics Newsroom