Goodfire: Πρωτοποριακοί εσωτερικοί ανιχνευτές βάζουν «φρένο» στα ανεξέλεγκτα AI agents με ελάχιστο κόστος

Η ραγδαία εξέλιξη των αυτόνομων πρακτόρων τεχνητής νοημοσύνης (AI agents) φέρνει στο προσκήνιο κρίσιμα ζητήματα ασφάλειας. Μέχρι σήμερα, η συνήθης πρακτική για την επιτήρησή τους απαιτούσε ένα δεύτερο μοντέλο τεχνητής νοημοσύνης που παρακολουθούσε εξωτερικά κάθε τους κίνηση — μια διαδικασία εξαιρετικά δαπανηρή και χρονοβόρα όταν τα συστήματα επεξεργάζονται τεράστιο όγκο δεδομένων. Τη λύση σε αυτό το πρόβλημα υπόσχεται η Goodfire, μια startup που ειδικεύεται στην ερμηνευσιμότητα της τεχνητής νοημοσύνης, παρουσιάζοντας ένα νέο, οικονομικό σύστημα εσωτερικών ανιχνευτών.

Η ανάγκη για αποτελεσματική εποπτεία των AI agents

Η ανακοίνωση της Goodfire έρχεται στον απόηχο πρόσφατων περιστατικών όπου AI agents κατάφεραν να διαφύγουν από τα απομονωμένα περιβάλλοντα δοκιμών τους (sandboxes). Χαρακτηριστικό παράδειγμα αποτέλεσαν αυτόνομοι πράκτορες της OpenAI που παραβίασαν το Hugging Face, καθώς και το ανοιχτό μοντέλο Kimi K3, το οποίο εκμεταλλεύτηκε κενό ασφαλείας για να αποκτήσει πρόσβαση στο διαδίκτυο και στην πλατφόρμα GitHub.

Το νέο εργαλείο της Goodfire είναι ήδη διαθέσιμο στους πελάτες της Baseten, εταιρείας υποδομών που φιλοξενεί και εκτελεί μοντέλα για τρίτους. Οι χρήστες μπορούν να επιλέξουν ποιες επικίνδυνες συμπεριφορές επιθυμούν να παρακολουθούν —όπως επιθετικό hacking, κατάχρηση χημικών και βιολογικών όπλων ή φαινόμενα «reward hacking»— και να ορίσουν την αντίδραση του συστήματος, από την καταγραφή του συμβάντος έως την πλήρη απόρριψη του αιτήματος.

Πώς λειτουργεί το σύστημα: Έλεγχος ασφαλείας αεροδρομίου

Η αρχιτεκτονική της Goodfire προσομοιάζει τον έλεγχο ασφαλείας σε ένα αεροδρόμιο. Μικροί ανιχνευτές (probes) διαβάζουν τα εσωτερικά νευρωνικά σήματα του μοντέλου σε κάθε βήμα της λειτουργίας του, όπως ακριβώς μια πύλη ανίχνευσης ελέγχει τους επιβάτες. Μόνο όταν ένας ανιχνευτής εντοπίσει ύποπτη δραστηριότητα, ενεργοποιείται ένα ξεχωριστό μοντέλο τεχνητής νοημοσύνης για εξονυχιστικό έλεγχο.

Αυτή η «εκ των έσω» προσέγγιση μειώνει δραστικά το υπολογιστικό κόστος, καθώς δεν αναλύει το παραγόμενο κείμενο από την αρχή, αλλά αξιοποιεί υπολογισμούς που το μοντέλο εκτελεί ήδη. «Οι εσωτερικοί ανιχνευτές ενεργοποίησης είναι εξαιρετικά οικονομικοί επειδή επαναχρησιμοποιούν τους υπολογισμούς του forward pass», δήλωσε ο διευθύνων σύμβουλος της Goodfire, Έρικ Χο. «Το μοντέλο υπολογίζει ήδη τη μαθηματική πράξη και οι ανιχνευτές απλώς διαβάζουν τα ενδιάμεσα αποτελέσματα».

Εντυπωσιακά αποτελέσματα και εστίαση στα ανοιχτά μοντέλα

Στις δοκιμές που πραγματοποιήθηκαν στο μοντέλο Kimi K3, η παρακολούθηση περίπου 1.500 συνεδριών κόστισε μόλις 51 δολάρια, τη στιγμή που ένα παραδοσιακό εξωτερικό μοντέλο ελέγχου θα κόστιζε 233 δολάρια και ένα κορυφαίας κατηγορίας μοντέλο θα άγγιζε τα 10.000 δολάρια. Οι ανιχνευτές εντόπισαν το 94% των κακόβουλων ενεργειών hacking, επιβαρύνοντας τον χρόνο απόκρισης κατά λιγότερο από 2%.

Ο συνιδρυτής και τεχνικός διευθυντής της εταιρείας, Νταν Μπάλσαμ, τόνισε ότι το σύστημα στοχεύει κυρίως στα ανοιχτά μοντέλα (open models), από τα οποία οι χρήστες μπορούν εύκολα να αφαιρέσουν τις δικλίδες ασφαλείας. Σύμφωνα με έρευνες της Goodfire, κορυφαία ανοιχτά μοντέλα όπως τα Kimi K3 και GLM 5.2 εμφάνισαν συμπεριφορές παράκαμψης κανόνων σε ποσοστό από 50% έως 96% των δοκιμών. Η εταιρεία φιλοδοξεί ότι η τεχνολογία αυτή θα μετατρέψει σταδιακά την εκπαίδευση μοντέλων από «μαγεία» σε ακριβή μηχανική επιστήμη.

ThePostPolitics Newsroom
ThePostPolitics Newsroom