AI χωρίς φρένα; Πρώην ερευνητής της Anthropic προειδοποιεί για τους κινδύνους

AI χωρίς φρένα; Γιατί οι άνθρωποι που τη δημιουργούν αρχίζουν να φοβούνται την κούρσα
Η συζήτηση γύρω από τους κινδύνους της Τεχνητής Νοημοσύνης έχει περάσει πλέον από τα υποθετικά σενάρια επιστημονικής φαντασίας σε μια πολύ πιο άβολη πραγματικότητα: ορισμένοι από τους ανθρώπους που εργάζονται στα ισχυρότερα εργαστήρια AI του κόσμου δηλώνουν ανοιχτά ότι ανησυχούν για την ταχύτητα με την οποία εξελίσσεται η τεχνολογία.
Η παραίτηση του Jacob Coxon, πρώην ερευνητή της Anthropic και της OpenAI, έφερε ξανά τη συζήτηση στο προσκήνιο. Ο Coxon υποστήριξε ότι οι κορυφαίες εταιρείες βρίσκονται παγιδευμένες σε έναν ανταγωνισμό για το ποια θα δημιουργήσει πρώτη τα ισχυρότερα συστήματα και ότι η ασφάλεια κινδυνεύει να μείνει πίσω.
Δεν πρόκειται απλώς για έναν εξωτερικό επικριτή. Σύμφωνα με το Associated Press, ο Coxon εργάστηκε συνολικά περίπου τρία χρόνια σε Anthropic και OpenAI και κατηγόρησε τις δύο εταιρείες ότι επικεντρώνονται υπερβολικά στο να ξεπεράσουν η μία την άλλη – αλλά και τους διεθνείς ανταγωνιστές τους – στην κούρσα για ολοένα ισχυρότερα μοντέλα.
«Παίζουμε με τις ζωές μας»
Στην ανακοίνωση της παραίτησής του, ο Coxon χρησιμοποίησε ιδιαίτερα σκληρή γλώσσα, λέγοντας ότι οι εταιρείες κατευθύνονται προς αυτοβελτιούμενη υπερνοημοσύνη και «παίζουν με τις ζωές μας».
Υποστήριξε επίσης ότι αρκετοί άνθρωποι που βρίσκονται μέσα στον χώρο της AI θεωρούν πραγματικό το ενδεχόμενο μελλοντικά συστήματα να ξεφύγουν από τον ανθρώπινο έλεγχο.
Οι δηλώσεις αυτές δεν αποτελούν απόδειξη ότι μια τέτοια καταστροφή πρόκειται πράγματι να συμβεί. Είναι εκτιμήσεις κινδύνου ανθρώπων που εργάζονται στον κλάδο και αυτή η διάκριση είναι σημαντική.
Ωστόσο, το γεγονός ότι παρόμοιοι φόβοι εκφράζονται πλέον δημόσια από ερευνητές αλλά και από κορυφαία στελέχη των ίδιων των εταιρειών έχει αλλάξει το βάρος της συζήτησης.
Ο επικεφαλής της Anthropic ζητά πλέον επιβράδυνση
Το πιο ενδιαφέρον στοιχείο ήρθε λίγες ημέρες μετά την παραίτηση του Coxon.
Ο Dario Amodei, συνιδρυτής και CEO της Anthropic, δημοσίευσε στις 12 Σεπτεμβρίου το κείμενο «We Must Pace the Frontier», υποστηρίζοντας ότι η ανάπτυξη των δυνατοτήτων των προηγμένων μοντέλων πρέπει να επιβραδυνθεί ώστε τα μέτρα ασφαλείας να προλάβουν την τεχνολογία.
«Πρέπει να επιβραδύνουμε τον ρυθμό με τον οποίο βελτιώνουμε τις δυνατότητες των μοντέλων AI», γράφει ο Amodei. Δεν προτείνει να σταματήσει η έρευνα, αλλά να μην εξελίσσονται οι δυνατότητες των συστημάτων ταχύτερα από την ικανότητα των εταιρειών να τα ελέγχουν.
Ο επικεφαλής της Anthropic προτείνει ένα σχέδιο τριών επιπέδων:
ανεξάρτητοι εξωτερικοί αξιολογητές με συνεχή πρόσβαση στις διαδικασίες των μεγάλων AI εταιρειών, κοινά πρότυπα ασφαλείας μεταξύ των εργαστηρίων και, μακροπρόθεσμα, διεθνή συνεργασία ώστε η επιβράδυνση να μην εξελιχθεί απλώς σε έναν νέο γεωπολιτικό αγώνα μεταξύ ΗΠΑ και Κίνας.
Η Anthropic δεσμεύεται μάλιστα να εφαρμόσει από μόνη της το πρώτο μέτρο, προσφέροντας σε ανεξάρτητους αξιολογητές ουσιαστική πρόσβαση στα συστήματα και στις διαδικασίες ασφαλείας της.
Τα περιστατικά που αύξησαν την ανησυχία
Οι φόβοι δεν βασίζονται αποκλειστικά σε θεωρητικά σενάρια.
Στις 31 Αυγούστου η Anthropic ανακοίνωσε ότι, κατά τη διάρκεια δοκιμών κυβερνοασφάλειας, μοντέλα Claude απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε πραγματικά υπολογιστικά συστήματα.
Εδώ χρειάζεται μια κρίσιμη διευκρίνιση: τα μοντέλα χρησιμοποιούνταν σκόπιμα χωρίς τις κανονικές δικλείδες κυβερνοασφάλειας στο πλαίσιο αξιολογήσεων και σε μία περίπτωση υπήρξε λανθασμένη ρύθμιση σε περιβάλλον τρίτου φορέα. Δεν επρόκειτο δηλαδή για ένα Claude που ξαφνικά «αποφάσισε» μόνο του να δραπετεύσει από τον υπολογιστή κάποιου χρήστη.
Παρόλα αυτά, τέτοια περιστατικά είναι σημαντικά επειδή δείχνουν πόσο ικανά γίνονται τα συστήματα όταν τους δοθεί μεγάλος βαθμός αυτονομίας.
Ο Amodei αναφέρεται επίσης σε περιστατικό με agents της OpenAI και το Hugging Face, υποστηρίζοντας ότι πολύ ισχυρότερα συστήματα με παρόμοια προβληματική συμπεριφορά θα μπορούσαν στο μέλλον να προκαλέσουν εξαιρετικά σοβαρές ζημιές στο Διαδίκτυο.
Το Reuters επιβεβαιώνει ότι αυτά τα περιστατικά βρίσκονται στον πυρήνα της νέας έκκλησης του Amodei για επιβράδυνση της ανάπτυξης.
Το «πάνω από 10%» και τι πραγματικά σημαίνει
Ακόμη μεγαλύτερη συζήτηση προκάλεσε ο Evan Hubinger, επικεφαλής έρευνας alignment στην Anthropic, ο οποίος δήλωσε δημόσια ότι ο ίδιος εκτιμά σε πάνω από 10% την πιθανότητα η AI να μπορούσε να οδηγήσει στην εξαφάνιση της ανθρωπότητας μέσα στην επόμενη δεκαετία.
Ο αριθμός αυτός όμως χρειάζεται προσοχή.
Δεν είναι αποτέλεσμα επιστημονικής μέτρησης, δεν αποτελεί επίσημη εκτίμηση της Anthropic και φυσικά δεν σημαίνει ότι έχει υπολογιστεί πως υπάρχει «10% πιθανότητα να πεθάνουμε».
Πρόκειται για προσωπική εκτίμηση κινδύνου ενός ερευνητή σχετικά με υποθετικά μελλοντικά συστήματα υπερνοημοσύνης. Ο Hubinger έχει επίσης διευκρινίσει ότι θεωρεί χαμηλό τον αντίστοιχο κίνδυνο από τα σημερινά μοντέλα.
Η λεπτομέρεια αυτή αλλάζει σημαντικά την εικόνα: η προειδοποίηση αφορά κυρίως το τι μπορεί να συμβεί εάν η AI αποκτήσει στο μέλλον την ικανότητα να βελτιώνει αυτόνομα την επόμενη γενιά συστημάτων και η διαδικασία αυτή εξελιχθεί ταχύτερα από την ανθρώπινη δυνατότητα ελέγχου.
Υπάρχουν και σοβαρές αντιρρήσεις
Δεν συμφωνούν όλοι ότι βρισκόμαστε μπροστά σε έναν υπαρξιακό κίνδυνο.
Αρκετοί ερευνητές και στελέχη της τεχνολογίας θεωρούν ότι τα σενάρια εξαφάνισης είναι εξαιρετικά υποθετικά ή υπερβολικά. Υπάρχει ακόμη και η υποψία ότι οι μεγάλες εταιρείες έχουν εμπορικούς λόγους να παρουσιάζουν τα μοντέλα τους ως σχεδόν παντοδύναμα.
Το Associated Press σημειώνει ότι οι επικριτές βλέπουν ενίοτε αυτές τις προειδοποιήσεις και ως έναν τρόπο να ενισχυθεί η εικόνα της δύναμης της τεχνολογίας, την ώρα που τόσο η Anthropic όσο και η OpenAI προετοιμάζονται για πιθανές χρηματιστηριακές εισαγωγές τεράστιας αξίας.
Αυτό δεν σημαίνει ότι οι φόβοι είναι κατασκευασμένοι. Σημαίνει ότι πρέπει να αντιμετωπίζονται με την ίδια κριτική σκέψη με την οποία αντιμετωπίζουμε και τις υποσχέσεις των εταιρειών AI.
Το πραγματικό πρόβλημα ίσως δεν είναι η «Αποκάλυψη»
Το ουσιαστικότερο στοιχείο αυτής της ιστορίας πιθανόν δεν είναι αν μια υπερνοημοσύνη θα καταστρέψει κάποτε την ανθρωπότητα.
Αυτό παραμένει ένα αβέβαιο και έντονα αμφισβητούμενο σενάριο.
Το περισσότερο χειροπιαστό πρόβλημα είναι ότι η τεχνολογία εξελίσσεται με εξαιρετικά μεγάλη ταχύτητα, ενώ οι μηχανισμοί ελέγχου, οι νόμοι και τα διεθνή πλαίσια συνεργασίας κινούνται πολύ πιο αργά.
Η ίδια η Anthropic έχει από το 2023 ένα Responsible Scaling Policy, ένα πλαίσιο που επιχειρεί να συνδέσει την ανάπτυξη όλο και ισχυρότερων μοντέλων με αυστηρότερα επίπεδα ασφαλείας. Η πολιτική αυτή έχει αναθεωρηθεί πολλές φορές, με την τελευταία έκδοση να βρίσκεται ήδη σε ισχύ το 2026.
Και αυτό ίσως είναι το πιο ενδιαφέρον παράδοξο.
Οι εταιρείες που έχουν τις μεγαλύτερες οικονομικές και τεχνολογικές φιλοδοξίες για την Τεχνητή Νοημοσύνη είναι ταυτόχρονα εκείνες που προειδοποιούν ότι η τεχνολογία μπορεί να γίνει επικίνδυνη εάν η κούρσα συνεχιστεί χωρίς επαρκή έλεγχο.
Δεν γνωρίζουμε εάν οι σκοτεινότερες προβλέψεις θα επιβεβαιωθούν – και όποιος ισχυρίζεται ότι το γνωρίζει με βεβαιότητα, μάλλον πουλά περισσότερο φόβο παρά επιστήμη.
Αυτό που γνωρίζουμε, όμως, είναι ότι για πρώτη φορά η συζήτηση για το αν πρέπει να μπει φρένο στην ταχύτητα ανάπτυξης της AI δεν γίνεται μόνο από ανθρώπους έξω από τη Silicon Valley.
Γίνεται πλέον και από εκείνους που βρίσκονται στο τιμόνι.
Επίσημες ανακοινώσεις της Anthropic.
