Τεχνητή νοημοσύνη: Κινεζικά μοντέλα AI έσπασαν τα μέτρα ασφαλείας – Ανησυχία για οδηγίες βιολογικών όπλων

Σοβαρά ερωτήματα σχετικά με την αξιοπιστία και την αποτελεσματικότητα των δικλίδων ασφαλείας στα προηγμένα συστήματα τεχνητής νοημοσύνης εγείρουν τα ευρήματα νέας έρευνας στον τομέα της κυβερνοασφάλειας. Στο επίκεντρο βρίσκονται τα κινεζικά μοντέλα Kimi K2.6 και K3 Swarm, τα οποία αναπτύχθηκαν από την εταιρεία Moonshot. Σύμφωνα με εξειδικευμένες δοκιμές ασφαλείας, τα συγκεκριμένα συστήματα υπέκυψαν σε τεχνικές «jailbreaking», αγνοώντας τους ενσωματωμένους περιορισμούς και δίνοντας λεπτομερείς οδηγίες για εξαιρετικά επικίνδυνα θέματα, όπως η παραγωγή βιολογικών όπλων και η εκτέλεση δολοφονιών.

Πώς παρακάμφθηκαν οι δικλίδες ασφαλείας

Η αποκάλυψη έγινε από τη Mindgard, μια εταιρεία που εξειδικεύεται στον έλεγχο και την αξιολόγηση της ασφάλειας συστημάτων AI. Οι ερευνητές διαπίστωσαν ότι τα μοντέλα της Moonshot μπορούσαν να παρακαμφθούν με στοχευμένες εντολές, οδηγώντας τα στην πλήρη κατάρρευση των ηθικών και λειτουργικών φίλτρων τους.

Ο ιδρυτής της Mindgard, Πίτερ Γκάραχαν, μιλώντας στο BBC, εξήγησε πως τα ευρήματα προκαλούν έντονο προβληματισμό. Όπως δήλωσε χαρακτηριστικά, μόλις επιτευχθεί το jailbreak, τα συστήματα «θα μιλήσουν για οποιοδήποτε θέμα, παρέχοντας συστάσεις για κακόβουλες ενέργειες με ευρηματικό και δημιουργικό τρόπο». Επιπλέον, η Mindgard προειδοποιεί ότι ένα παραβιασμένο Kimi K2.6 θα μπορούσε δυνητικά να επιτρέψει σε χάκερ να εκτελέσουν κακόβουλο κώδικα στις υπολογιστικές του υποδομές, μετατρέποντάς το σε εφαλτήριο για ευρύτερες κυβερνοεπιθέσεις.

Το δίλημμα των open-weight μοντέλων και οι κίνδυνοι

Η υπόθεση αναζωπυρώνει τη διεθνή διαμάχη σχετικά με τα πλεονεκτήματα και τους κινδύνους των ιδιόκτητων κλειστών μοντέλων —όπως το ChatGPT της OpenAI και το Claude της Anthropic— σε σχέση με τα μοντέλα «ανοικτών βαρών» (open-weight), όπως το Kimi. Η φύση των open-weight εργαλείων επιτρέπει σε οποιονδήποτε χρήστη να τα κατεβάσει και να τα λειτουργήσει στους δικούς του διακομιστές, καθιστώντας σχεδόν αδύνατο τον κεντρικό έλεγχο μετά την παράκαμψη των περιορισμών.

Από την πλευρά της, η Moonshot υποστήριξε ότι θεωρεί τη συνεισφορά ανεξάρτητων ερευνητών βασικό πυλώνα για την ανάπτυξη ασφαλέστερης τεχνολογίας, ενώ σημείωσε ότι στις δικές της δοκιμές τα μοντέλα εμφάνιζαν υψηλό ποσοστό απόρριψης επικίνδυνων αιτημάτων. Σημειώνεται ότι περιστατικά κακόβουλης εκμετάλλευσης έχουν απασχολήσει και αμερικανικές εταιρείες, με την Anthropic να δηλώνει πρόσφατα ότι απέτρεψε απόπειρες χρήσης των δικών της μοντέλων για δραστηριότητες που σχετίζονταν με βιολογικά όπλα.

Η δυσκολία της διεθνούς ρύθμισης

Σχολιάζοντας τις εξελίξεις, ο καθηγητής του Πανεπιστημίου του Σάρεϊ, Άλαν Γούντγουορντ, τόνισε ότι παρότι τα ανοικτά μοντέλα μπορούν να πέσουν σε λάθος χέρια, παραμένουν πολύτιμα εργαλεία για την ενίσχυση της κυβερνοάμυνας, αναφέροντας ως παράδειγμα την ανάλυση κυβερνοεπιθέσεων από την πλατφόρμα Hugging Face.

Παράλληλα, ο καθηγητής εξέφρασε επιφυλάξεις για το αν ένα διεθνές ρυθμιστικό πλαίσιο μπορεί να ακολουθήσει τις ταχύτατες εξελίξεις της βιομηχανίας. Όπως σημείωσε, η διεθνής κοινότητα θα πρέπει να εστιάσει περισσότερο στον εντοπισμό και την ποινική δίωξη των κακόβουλων χρηστών που αξιοποιούν την τεχνητή νοημοσύνη ως όπλο, παρά στην υπερβολική γραφειοκρατική ρύθμιση.

ThePostPolitics Newsroom
ThePostPolitics Newsroom