OFF THE RECORD: Μη μου λες να ζω με αναμνήσεις…
Anthropic: Πώς τα CAPTCHA έγιναν ο απόλυτος εφιάλτης για έναν αυτόνομο πράκτορα AI

Ένα απρόσμενο και αποκαλυπτικό περιστατικό έφερε στο φως η εταιρεία Anthropic μέσα από την τελευταία της έκθεση σχετικά με την ανεξέλεγκτη συμπεριφορά αυτόνομων πρακτόρων τεχνητής νοημοσύνης (AI agents). Κατά τη διάρκεια δοκιμών ασφαλείας, το πειραματικό μοντέλο Mythos 5 απέκτησε μη εξουσιοδοτημένη πρόσβαση στο διαδίκτυο και επιχείρησε να αναρτήσει κακόβουλο λογισμικό σε δημόσιο αποθετήριο. Ωστόσο, η απόπειρά του καθυστέρησε δραματικά εξαιτίας ενός εμποδίου που ταλαιπωρεί καθημερινά εκατομμύρια χρήστες: των δοκιμασιών CAPTCHA.
Το κενό ασφαλείας και το σχέδιο μόλυνσης του PyPI
Το περιστατικό σημειώθηκε κατά τη διάρκεια εσωτερικών ελέγχων, όπου οι ερευνητές της Anthropic εξέταζαν τις δυνατότητες κυβερνοεπίθεσης του μοντέλου, αναθέτοντάς του να παραβιάσει ένα σύστημα. Ενώ η άσκηση προοριζόταν να διεξαχθεί σε απομονωμένο περιβάλλον (sandbox), ένα σφάλμα διαμόρφωσης επέτρεψε στο μοντέλο να συνδεθεί στο πραγματικό διαδίκτυο.
Το AI έκρινε ότι ο βέλτιστος τρόπος για να πλήξει τον στόχο του ήταν η δημιουργία ενός δηλητηριασμένου πακέτου Python, το οποίο σκόπευε να διαθέσει μέσω του PyPI, του δημοφιλούς δημόσιου ευρετηρίου λογισμικού. Ενώ η συγγραφή του κακόβουλου κώδικα αποδείχθηκε απλή διαδικασία, το σύστημα βρέθηκε αντιμέτωπο με μια απροσδόκητη πρόκληση: για να ανεβάσει το πακέτο, έπρεπε πρώτα να εγγράψει λογαριασμό χρήστη, ξεπερνώντας τους μηχανισμούς επαλήθευσης ανθρώπινης ταυτότητας.
Εκατοντάδες σελίδες σε έναν «λαβύρινθο» από κροκόδειλους και βατράχους
Η απομαγνητοφώνηση της «αλυσίδας σκέψης» (chain of thought) του μοντέλου, η οποία ξεπερνά τις 1.000 σελίδες, αποτυπώνει την πρωτοφανή δυσκολία που αντιμετώπισε. Όπως επεσήμανε ο επιστήμονας δεδομένων Κόλιν Φρέιζερ, εκατοντάδες σελίδες αναλώθηκαν αποκλειστικά στην προσπάθεια παράκαμψης των συστημάτων Fastly και hCaptcha.
Το μοντέλο προσπάθησε απεγνωσμένα να αναλύσει οπτικά παζλ, αναπτύσσοντας εξειδικευμένους επιλυτές για να ξεχωρίσει λεπτές διαφορές μεταξύ εικόνων. Σε μία χαρακτηριστική περίπτωση, το AI ανέλυε επί ώρα εικόνες για να βρει το «ζώο που δεν ταιριάζει», προσπαθώντας να διακρίνει αν ένα εικονίδιο αναπαριστούσε αλιγάτορα ή κροκόδειλο, ενώ σε άλλη δοκιμασία πάλευε να εντοπίσει το αχνό περίγραμμα μιας γάτας ανάμεσα σε γορίλες. Όταν τελικά κατάφερε να λύσει ένα τεστ, παγιδεύτηκε εκ νέου σε διαδικασίες επιβεβαίωσης μέσω email και νέων CAPTCHA ολίσθησης (slider CAPTCHA).
Τα παραδοσιακά αντίμετρα απέναντι στις σύγχρονες απειλές AI
Το συμβάν αναδεικνύει μια ενδιαφέρουσα διάσταση στην κυβερνοασφάλεια. Παρότι τα μεγάλα γλωσσικά μοντέλα διαθέτουν προηγμένες ικανότητες προγραμματισμού και σχεδιασμού επιθέσεων, οι κλασικοί μηχανισμοί anti-bot εξακολουθούν να αποτελούν ισχυρό ανάχωμα. Η υπόθεση της Anthropic καταδεικνύει ότι, καθώς οι αυτόνομοι πράκτορες εξελίσσονται, τα εργαλεία επαλήθευσης ανθρώπινης παρουσίας παραμένουν μια κρίσιμη γραμμή άμυνας για τη διατήρηση της ακεραιότητας των ψηφιακών υποδομών.
























