OFF THE RECORD: Μη μου λες να ζω με αναμνήσεις…
Μαθηματικός τύπος προβλέπει πότε η τεχνητή νοημοσύνη γίνεται επικίνδυνη: Νέα επιστημονική ανακάλυψη

Η ραγδαία εξέλιξη των μεγάλων γλωσσικών μοντέλων (LLMs) έχει φέρει στο προσκήνιο έντονες ανησυχίες σχετικά με την ασφάλεια των δεδομένων και την εγκυρότητα των απαντήσεων που παράγουν. Σε μία πρωτοποριακή μελέτη, φυσικοί από το Πανεπιστήμιο Τζορτζ Ουάσινγκτον υποστηρίζουν ότι κατάφεραν να αποκωδικοποιήσουν το σημείο καμπής κατά το οποίο ένα σύστημα AI μετατρέπεται από χρήσιμο εργαλείο σε επικίνδυνο παράγοντα. Η έρευνα των Νιλ Φ. Τζόνσον και Φρανκ Γινγκτζί Χούο, η οποία δημοσιεύθηκε στο διεθνές επιστημονικό περιοδικό Patterns, προτείνει έναν μαθηματικό τύπο ικανό να προβλέπει πότε ακριβώς μια συνομιλία οδηγεί σε επιβλαβείς αποκρίσεις.
Η «τρίτη διάσταση» της ασφάλειας και η ψευδής εμπιστοσύνη
Μέχρι σήμερα, η κοινή προσέγγιση για την αξιολόγηση των συστημάτων τεχνητής νοημοσύνης βασιζόταν στο δίπολο της ορθής ή εσφαλμένης πληροφόρησης. Οι ερευνητές, ωστόσο, αναδεικνύουν μια κρίσιμη τρίτη παράμετρο: μια απάντηση μπορεί να είναι πραγματολογικά ακριβής, αλλά ταυτόχρονα εξαιρετικά επικίνδυνη, ανεύθυνη ή επιζήμια ως προς τις συνέπειές της. Όπως επισημαίνει ο συγγραφέας της μελέτης Φρανκ Γινγκτζί Χούο, μέχρι πρότινος κανείς δεν μπορούσε να υπολογίσει πότε ακριβώς συντελείται αυτή η ανεπιθύμητη μετάβαση.
Βασισμένοι σε θεμελιώδεις αρχές της φυσικής, οι επιστήμονες διαπίστωσαν ότι το ευρύτερο πλαίσιο της συνομιλίας μπορεί να εκτρέψει το σύστημα είτε άμεσα μέσω ενός μεμονωμένου prompt είτε σταδιακά μέσα από αλλεπάλληλες ερωταποκρίσεις. Η σταδιακή διολίσθηση θεωρείται από τους ειδικούς το πλέον ανησυχητικό σενάριο. Σε αυτή την περίπτωση, ο χρήστης αναπτύσσει μια ψευδή αίσθηση ασφάλειας και εμπιστοσύνης απέναντι στο εργαλείο, ενώ στην πραγματικότητα κάθε διαδοχική απόκριση τον οδηγεί σε όλο και πιο επισφαλείς ή επικίνδυνες ατραπούς.

Ο αυξημένος κίνδυνος στα τοπικά και offline συστήματα
Ιδιαίτερη έμφαση δίνεται στις περιπτώσεις όπου τα μοντέλα AI εκτελούνται τοπικά και χωρίς σύνδεση στο διαδίκτυο. Ενώ οι μεγάλες πλατφόρμες στο cloud διαθέτουν εξελιγμένες δικλείδες ασφαλείας, τα αυτόνομα συστήματα στερούνται εξωτερικών μηχανισμών εποπτείας και φιλτραρίσματος περιεχομένου. Η τοπική εκτέλεση, ωστόσο, είναι επιβεβλημένη σε κρίσιμους επαγγελματικούς κλάδους που δεσμεύονται από το απόρρητο ευαίσθητων δεδομένων, όπως οι ιατροί, οι νομικοί ή στρατιωτικές μονάδες που επιχειρούν σε απομακρυσμένες τοποθεσίες.
Σε τέτοια απομονωμένα ψηφιακά περιβάλλοντα, η παραγωγή επιβλαβούς περιεχομένου μπορεί να έχει απρόβλεπτες συνέπειες. Η δυνατότητα μαθηματικής πρόβλεψης του σημείου καμπής προσφέρει έναν προληπτικό μηχανισμό άμυνας, αντικαθιστώντας την παθητική παρατήρηση λαθών με την έγκαιρη ανίχνευση του κινδύνου.
Υψηλή ακρίβεια στις πρώτες δοκιμές
Η πρακτική εφαρμογή του νέου μαθηματικού τύπου δοκιμάστηκε πειραματικά σε 7 διαφορετικά μοντέλα AI, επιβεβαιώνοντας τη θεωρητική του βάση. Ο αλγόριθμος πέτυχε να προβλέψει με ακρίβεια το σημείο εκτροπής στις 18 από τις 19 συνολικά περιπτώσεις ελέγχου. Οι δοκιμές κάλυψαν ευαίσθητα ζητήματα δημόσιας υγείας, όπως η θεματολογία γύρω από τα εμβόλια, καθώς και επικίνδυνα σενάρια πρόκλησης βλάβης σε τρίτους ή αυτοτραυματισμού.
Τα ευρήματα των ερευνητών ανοίγουν νέους δρόμους για τη δημιουργία πιο αξιόπιστων αλγορίθμων ασφαλείας. Η ενσωμάτωση τέτοιων προγνωστικών μαθηματικών μοντέλων αναμένεται να αποτελέσει βασικό πυλώνα για την υπεύθυνη και ασφαλή ανάπτυξη της τεχνητής νοημοσύνης τα επόμενα χρόνια.























