OFF THE RECORD: Μη μου λες να ζω με αναμνήσεις…
Τεχνητή Νοημοσύνη: Γιατί η τυφλή εμπιστοσύνη στην ικανότητά της να λέει «όχι» εγκυμονεί κινδύνους

Από τις απαρχές της επιστημονικής φαντασίας έως τα σύγχρονα εργαστήρια τεχνολογίας, η ιδέα ότι μια μηχανή οφείλει να αρνείται την εκτέλεση επικίνδυνων εντολών θεωρείται θεμελιώδης. Το 2021, η εταιρεία Anthropic διατύπωσε το δόγμα ότι τα μεγάλα γλωσσικά μοντέλα πρέπει να είναι «χρήσιμα, ειλικρινή και, πρωτίστως, αβλαβή». Στην πράξη, αυτό σημαίνει πως όταν ένας χρήστης ζητά οδηγίες για την κατασκευή μιας βόμβας ή τη διασπορά ενός ιού, το σύστημα οφείλει να αρνηθεί ευγενικά. Ωστόσο, η βιομηχανία ίσως βασίζεται υπερβολικά σε αυτόν τον μηχανισμό άρνησης, αγνοώντας τις βαθύτερες δομικές του αδυναμίες.
Η ψευδαίσθηση της απόλυτης ασφάλειας
Η ανυπακοή δεν αποτελεί φυσικό χαρακτηριστικό των αλγορίθμων. Εκπαιδευμένα σε δισεκατομμύρια ιστοσελίδες, τα μοντέλα τεχνητής νοημοσύνης έχουν αφομοιώσει τεράστιο όγκο τοξικού και επικίνδυνου περιεχομένου. Όπως επισημαίνει ο Στίβεν Άντλερ, πρώην στέλεχος ασφαλείας στην OpenAI, τα πρώιμα μοντέλα απαντούσαν αδιακρίτως σε οτιδήποτε, ενώ ο ερευνητής του Πανεπιστημίου του Χάρβαρντ, Ράιαν ΜακΜπέιν, υπενθυμίζει ότι οι πρώτες εκδόσεις παρείχαν με ευκολία ακόμη και μεθόδους αυτοχειρίας.
Σήμερα, οι εταιρείες επενδύουν τεράστιους πόρους εκπαιδεύοντας τα μοντέλα να αρνούνται επιβλαβείς εντολές, χρησιμοποιώντας μάλιστα άλλα συστήματα τεχνητής νοημοσύνης ως «φρουρούς». Εντούτοις, η δυνατότητα πρόκλησης βλάβης παραμένει ενεργή στον πυρήνα τους. Το να διδάσκεις σε ένα μοντέλο να αρνείται, αφήνοντας ανέπαφη τη γνώση του για καταστροφικές πράξεις, μοιάζει με την τοποθέτηση ενός πολυβόλου σε κάθε αυτοκίνητο, ελπίζοντας απλώς ότι η σκανδάλη είναι καλά κρυμμένη κάτω από το καπό.

Ποιος αποφασίζει πού μπαίνει η διαχωριστική γραμμή;
Καθώς οι μηχανισμοί απόρριψης είναι πιθανολογικοί και όχι απόλυτοι, αποφασισμένοι κακόβουλοι χρήστες καταφέρνουν συχνά να παρακάμψουν τα ψηφιακά αναχώματα. Οι ανησυχίες εντείνονται καθώς τα νεότερα μοντέλα επιδεικνύουν ικανότητες εισβολής σε κρίσιμα δίκτυα ή υποβοήθησης στη σύνθεση παθογόνων παραγόντων. «Το πού ακριβώς χαράσσεται η γραμμή μεταξύ επιτρεπτού και απαγορευμένου είναι ένα τεράστιο ερώτημα», τονίζει ο Ζίκο Κόλτερ, μέλος του διοικητικού συμβουλίου της OpenAI και συνιδρυτής της Gray Swan.
Ένας ιολόγος μπορεί να χρειάζεται δεδομένα για επικίνδυνους ιούς για ερευνητικούς σκοπούς, ενώ ένας αναλυτής κυβερνοασφάλειας αναζητά τρωτά σημεία για να τα επιδιορθώσει. Προς το παρόν, τα όρια αυτά καθορίζονται μονομερώς και υπό καθεστώς μυστικότητας από τις τεχνολογικές εταιρείες. Σύντομα, όμως, τον έλεγχο θα διεκδικήσουν οι κυβερνήσεις. Σε δημοκρατικά πλαίσια, όπως δείχνουν και οι πιέσεις του Πενταγώνου για λιγότερους περιορισμούς, η συζήτηση αφορά την ασφάλεια. Σε αυταρχικά καθεστώτα, ωστόσο, η ίδια τεχνολογία άρνησης μπορεί εύκολα να μετατραπεί σε εργαλείο λογοκρισίας και φίμωσης της πολιτικής κριτικής.
Η προγραμματισμένη άρνηση έχει καταστεί ο φέρων τοίχος της ασφάλειας στην τεχνητή νοημοσύνη. Εφόσον όμως η ικανότητα του συστήματος να ωφελεί παραμένει άρρηκτα συνδεδεμένη με την ικανότητά του να βλάπτει, η απόλυτη εξάρτηση από ένα «ευγενικό όχι» ενδέχεται να αποδειχθεί μια επικίνδυνη ψευδαίσθηση.























