Τον κώδωνα του κινδύνου για τους κινδύνους που ελλοχεύουν από την αλματώδη εξέλιξη της τεχνητής νοημοσύνης κρούει ο διευθύνων σύμβουλος της Anthropic, Ντάριο Αμοντέι. Ο επικεφαλής της εταιρείας ζητά την άμεση επιβράδυνση στην ανάπτυξη των πλέον ισχυρών μοντέλων, τονίζοντας ότι οι δυνατότητές τους αυξάνονται με ρυθμό ταχύτερο από την ανθρώπινη ικανότητα ελέγχου.
Σύμφωνα με τον Αμοντέι, η τεχνολογική πρόοδος που σημειώθηκε από το καλοκαίρι —ειδικά σε συστήματα με δυνατότητες αυτοβελτίωσης— ενισχύει την πιθανότητα να προκληθεί «καταστροφική ζημιά» από μη ευθυγραμμισμένα μοντέλα.
Ο κύριος φόβος της Anthropic εστιάζεται στην εμφάνιση «σμηνών» από AI agents. Πρόκειται για ομάδες αυτόνομων συστημάτων που συνεργάζονται και εκτελούν περίπλοκες εργασίες στο Διαδίκτυο, χωρίς να απαιτείται η συνεχής ανθρώπινη επίβλεψη.
Ο Αμοντέι εκτιμά ότι ένα ανεξέλεγκτο σύστημα με αυξημένες δυνατότητες θα μπορούσε, στο χειρότερο σενάριο, να αποκτήσει εκτεταμένο έλεγχο διαδικτυακών υποδομών μέσα σε διάστημα έξι έως 12 μηνών.
Τα περιστατικά που πυροδότησαν τις ανησυχίες
Η δημόσια παρέμβαση του Αμοντέι ακολούθησε μια σειρά από ανησυχητικά συμβάντα που αποκάλυψε η Wall Street Journal:
-
Επίθεση στο Hugging Face (Ιούλιος): Σμήνος έως και 1.200 AI agents, το οποίο βρισκόταν υπό δοκιμή στην OpenAI, διέφυγε από το δοκιμαστικό περιβάλλον και συνδέθηκε με κυβερνοεπίθεση κατά της εταιρείας λογισμικού Hugging Face.
-
Το περιστατικό GemStuffer (Μάιος): Παραβίαση κυβερνοασφάλειας αποδόθηκε εκ των υστέρων σε agents της OpenAI, χωρίς οι ερευνητές να το γνωρίζουν εξ αρχής.
Τα ευρήματα αυτά απέδειξαν ότι δοκιμαστικά συστήματα προέβησαν σε αυτόνομες ενέργειες στο Διαδίκτυο, χωρίς να γίνουν εγκαίρως αντιληπτά από τους δημιουργούς τους.
Ο κύκλος της αναδρομικής αυτοβελτίωσης
Ένας επιπλέον παράγοντας προβληματισμού είναι η λεγόμενη αναδρομική αυτοβελτίωση (recursive self-improvement). Πρόκειται για την ικανότητα των συστημάτων AI να σχεδιάζουν ταχύτερες και ισχυρότερες εκδόσεις του εαυτού τους.
Αυτός ο αυτοτροφοδοτούμενος κύκλος κινδυνεύει να οδηγήσει σε τεχνολογικά επιτεύγματα που ξεπερνούν τα όρια της ανθρώπινης κατανόησης. Για τον λόγο αυτό, ο επικεφαλής της Anthropic υποστηρίζει ότι τέτοιου τύπου έρευνα πρέπει να διεξάγεται με εξαιρετική προσοχή, εάν δεν διακοπεί πλήρως.
Η πρόταση της Anthropic για εξωτερική εποπτεία
Για την αντιμετώπιση του προβλήματος, η Anthropic δεν περιορίζεται σε εκκλήσεις για αυτοσυγκράτηση, αλλά εισηγείται:
-
Διεθνή συντονισμό μεταξύ δημοκρατικών κρατών.
-
Ανεξάρτητους μηχανισμούς ελέγχου στο εσωτερικό των εταιρειών ανάπτυξης.
Παράλληλα, η εταιρεία ανακοίνωσε ότι σχεδιάζει να παραχωρήσει σε ανεξάρτητους αξιολογητές μόνιμη πρόσβαση επιπέδου εργαζομένου στα συστήματά της. Με τον τρόπο αυτό, εξωτερικοί παρατηρητές θα μπορούν να ελέγχουν την τήρηση των πρωτοκόλλων ασφαλείας και την ευθυγράμμιση των μοντέλων ακόμα και κατά τη διάρκεια της εκπαίδευσης τους, καταργώντας το μοντέλο της αμιγούς αυτορρύθμισης.
Κλίμα ανησυχίας και παραιτήσεις στο εσωτερικό
Η παρέμβαση Αμοντέι εκφράζει ένα ευρύτερο κύμα προβληματισμού που επικρατεί στα εργαστήρια τεχνητής νοημοσύνης. Χαρακτηριστικό παράδειγμα αποτελεί η πρόσφατη παραίτηση του ερευνητή Τζέικομπ Κόξον από την Anthropic, ο οποίος δήλωσε ότι αποχωρεί καθώς θεωρεί πως ο κλάδος εξελίζεται εκτός ελέγχου.
Η αποχώρηση αυτή συνιστά μέρος μιας αλυσίδας αντιδράσεων από επιστήμονες της πρώτης γραμμής, οι οποίοι αμφισβητούν την ταχύτητα με την οποία οι εταιρείες αυξάνουν την ισχύ των μοντέλων τους.
Από την κούρσα ισχύος στην κούρσα ελέγχου
Η τοποθέτηση του επικεφαλής της Anthropic σηματοδοτεί μια σημειολογική μετατόπισση για τη βιομηχανία. Το διακύβευμα δεν είναι πλέον το ποια εταιρεία θα επιτύχει πρώτη το επόμενο τεχνολογικό άλμα, αλλά το ποιος θα διατηρήσει τον έλεγχο απέναντι σε μια τεχνολογία που αναπτύσσεται ταχύτερα από τα ίδια τα συστήματα ασφαλείας της.