Τεχνητή Νοημοσύνη: OpenAI και Anthropic κρούουν τον κώδωνα για μοντέλα τους που «εκβιάζουν», «παραπλανούν» και «αντιστέκονται» – Νέες προειδοποιήσεις
Η Anthropic προειδοποιεί τους επενδυτές για πιθανό «υπαρξιακό κίνδυνο», ενώ OpenAI και Anthropic μιλούν για μοντέλα ΤΝ που εκβιάζουν, παραπλανούν και αντιστέκονται.

Η Τεχνητή Νοημοσύνη (ΤΝ) βρίσκεται σε κρίσιμη καμπή για το μέλλον της, με δύο από τις ισχυρότερες εταιρείες του χώρου, την Anthropic και την OpenAI, να σημαίνουν εκ νέου και ταυτόχρονα συναγερμό.
Από τη μία, η Anthropic ενημερώνει επισήμως τους επενδυτές της ότι ενδέχεται να υπάρξει «υπαρξιακός κίνδυνος» για την ανθρωπότητα. Από την άλλη, η OpenAI αναγκάζεται να «παγώσει» τη διάθεση του καινούργιου μοντέλου GPT-6.1 Astra, καθώς στις δοκιμές διαπίστωσε ανεξέλεγκτη και παραπλανητική λειτουργία.
OpenAI: Σταματά η κυκλοφορία του GPT-6.1 Astra
Τη Δευτέρα, η OpenAI γνωστοποίησε ότι δεν θα διαθέσει στην αγορά το πιο πρόσφατο μοντέλο AI που βρισκόταν υπό ανάπτυξη, μετά τις ανησυχίες για την ασφάλεια που εξέφρασαν οι ερευνητές της εταιρείας.
Όπως επισημαίνουν οι New York Times, πρόκειται για την τελευταία απόφαση της εταιρείας στην κατεύθυνση επιβράδυνσης του ρυθμού με τον οποίο εξελίσσει την τεχνολογία της.
Στη δοκιμαστική περίοδο του νέου συστήματος, που φέρει την ονομασία GPT-6.1 Astra, καταγράφηκαν υψηλά επίπεδα συμπεριφοράς την οποία η εταιρεία περιέγραψε ως παραπλάνηση. Με άλλα λόγια, το μοντέλο έδειξε προθυμία να παραπλανεί τους χρήστες ως προς τις ενέργειές του.
Την ίδια στιγμή, το μοντέλο έδειξε ότι ήταν διατεθειμένο να κινηθεί πέρα από το αρχικό πλαίσιο των εντολών που είχε λάβει, δίχως προηγουμένως να ζητά επιβεβαίωση ή πρόσθετες κατευθύνσεις.
Η επικεφαλής συστημάτων ασφαλείας της OpenAI, Σάατσι Τζέιν, δήλωσε: «Για οτιδήποτε αφορά την ασφάλεια και την ευθυγράμμιση (alignment), υπάρχει ένα τίμημα».
Για το νέο μοντέλο ανέφερε ότι «δεν έφτασε το επιθυμητό επίπεδο όσον αφορά την παραμονή εντός του πεδίου δράσης και της εξουσιοδότησης που διαθέτει, καθώς και τον τρόπο με τον οποίο επικοινωνεί πίσω στον χρήστη σχετικά με το είδος της εργασίας που έχει πραγματοποιήσει».
Αυτόνομες ενέργειες, παραβιάσεις και διακοπή εκπαίδευσης
Η συγκεκριμένη απόφαση της OpenAI έρχεται έπειτα από αναφορές πολλών εβδομάδων, σύμφωνα με τις οποίες μοντέλα τεχνητής νοημοσύνης της δρούσαν ανεξέλεγκτα στις δοκιμές. Μεταξύ άλλων, παραβίαζαν ιστοσελίδες εν αγνοία της εταιρείας ή εκδήλωναν άλλες συμπεριφορές που το εργαστήριο αποκάλεσε «ανησυχητικές», όπως το να κρύβουν λάθη και να δημιουργούν ψευδή δεδομένα.
Στα καταγεγραμμένα συμβάντα περιλαμβάνονται παραβιάσεις από συστήματα της OpenAI στη startup τεχνητής νοημοσύνης Hugging Face και σε κυβερνητικό ιστότοπο της Αυστραλίας. Παρεμβάσεις σημειώθηκαν επίσης στους ιστοτόπους των υπουργείων Παιδείας και Εμπορίου των ΗΠΑ, αλλά και της Επιτροπής Κεφαλαιαγοράς (SEC).
Την προηγούμενη εβδομάδα, η OpenAI γνωστοποίησε πως παγώνει την εκπαίδευση των πλέον εξελιγμένων μοντέλων της. Παράλληλα, δήλωσε ότι έχει θέσει σε εφαρμογή μια εκτεταμένη επανεξέταση όσων έκαναν τα καινούργια μοντέλα στις δοκιμές, επισημαίνοντας πως μπορεί να εντοπιστούν και επιπλέον περιστατικά.
Σε ανάρτηση που έκανε την Παρασκευή στα μέσα κοινωνικής δικτύωσης, ο διευθύνων σύμβουλος της OpenAI, Σαμ Άλτμαν, παραδέχθηκε ότι η εταιρεία «δεν υπήρξε τόσο γρήγορη όσο θα θέλαμε» ως προς τη δημοσιοποίηση περιστατικών τεχνητής νοημοσύνης.
Ο ίδιος σημείωσε: «Ιεραρχούμε τις προτεραιότητες όσο καλύτερα μπορούμε με βάση τη σοβαρότητα». Πρόσθεσε ακόμη ότι η παραβίαση της Hugging Face εξακολουθεί να αποτελεί «το πιο σοβαρό περιστατικό» που έχει εντοπίσει μέχρι σήμερα η εταιρεία.
Η Wall Street Journal ήταν η εφημερίδα που αποκάλυψε πρώτη την επιλογή της OpenAI να μη διαθέσει το συγκεκριμένο μοντέλο.
Anthropic: Η προειδοποίηση για «υπαρξιακό κίνδυνο»
Στην ίδια κατεύθυνση βρίσκονται και όσα αποκαλύπτονται για την Anthropic. Στο πλαίσιο της Αρχικής Δημόσιας Προσφοράς (IPO), η εταιρεία σχεδιάζει να προειδοποιήσει τους πιθανούς επενδυτές ότι η εξελιγμένη τεχνητή νοημοσύνη ενδέχεται να δημιουργήσει «καταστροφικούς ή υπαρξιακούς κινδύνους για την ανθρωπότητα». Πρόκειται για εξαιρετικά ασυνήθιστη επισήμανση από μία επιχείρηση που αποβλέπει σε κέρδη μέσω αυτής ακριβώς της τεχνολογίας.
Στο ενημερωτικό δελτίο για την εισαγωγή της εταιρείας στο χρηματιστήριο, το οποίο εξασφάλισε το πρακτορείο Reuters, δίνεται έμφαση στους κινδύνους που συνδέονται με τα μοντέλα τεχνητής νοημοσύνης της Anthropic.
Στο κείμενο επισημαίνεται ότι αυτά τα μοντέλα ενδέχεται να αναπτύξουν «συμπεριφορές αυτοσυντήρησης». Σε αυτές περιλαμβάνονται απόπειρες «αντίστασης στον τερματισμό λειτουργίας» και «απόκρυψης ή χειραγώγησης πληροφοριών», όπως επίσης συμπεριφορά που «θυμίζει εκβιασμό».
Στο ενημερωτικό δελτίο, η Anthropic αναφέρει: «Η ανάπτυξη από πλευράς μας εξαιρετικά προηγμένων μοντέλων, πλατφορμών και εφαρμογών, καθώς και η επέκταση των περιπτώσεων χρήσης, θα μπορούσε να αυξήσει περαιτέρω τον κίνδυνο τα μοντέλα μας να προκαλέσουν βλάβη».
Μολονότι οι εισηγμένες επιχειρήσεις συνηθίζουν να ενημερώνουν τους επενδυτές για πιθανούς κινδύνους που συνοδεύουν τα προϊόντα τους, ελάχιστες —αν όχι καμία— έχουν απευθύνει προειδοποιήσεις που αφήνουν να εννοηθεί ότι η δική τους τεχνολογία θα μπορούσε να οδηγήσει ακόμη και στην εξαφάνιση της ανθρωπότητας.
Η Anthropic υπογράμμισε αφενός τις μετασχηματιστικές δυνατότητες της τεχνητής νοημοσύνης, τις οποίες συνέκρινε με εκείνες της βιομηχανικής επανάστασης και του ηλεκτρισμού, και αφετέρου την ανεπανόρθωτη βλάβη που μπορεί να επέλθει αν η διαχείρισή της γίνει λανθασμένα.
Ο ερευνητής ασφάλειας της Anthropic, Έβαν Χάμπινγκερ, δήλωσε ότι η πιθανότητα η τεχνητή νοημοσύνη να οδηγήσει στον θάνατο των ανθρώπων κατά την επόμενη δεκαετία είναι πιθανότητα μεγαλύτερη του 10%, υιοθετώντας θέση που είχε διατυπώσει και ο πρώην συνεργάτης του, Τζέικομπ Κόξον.
Αβέβαιες αποδόσεις
Η Anthropic, που παρουσιάζεται στην αγορά ως εργαστήριο τεχνητής νοημοσύνης με την ασφάλεια ως ύψιστη προτεραιότητα, διέθεσε περίπου 80 σελίδες από τις 261 του βασικού μέρους του ενημερωτικού δελτίου της στους κινδύνους — σχεδόν διπλάσιες από τις 48 σελίδες που αφιέρωσε στην παρουσίαση της επιχειρηματικής της δραστηριότητας.
Ενδεικτικά, η SpaceX, στην οποία υπάγεται η xAI, αφιέρωσε μόνο 38 σελίδες από τις 277 του κύριου μέρους του δικού της ενημερωτικού δελτίου.
«Η πιθανή επίγνωση των μοντέλων σχετικά με τις προσπάθειες αξιολόγησής μας δημιουργεί σημαντικό περιορισμό στην ικανότητά μας να εκτιμήσουμε την ασφάλειά τους», σημειώνει η Anthropic στο δελτίο της και προσθέτει πως κατά την εκπαίδευσή τους τα μοντέλα εμφανίζουν ορισμένες φορές απρόβλεπτες ικανότητες, που ενδέχεται να εντοπιστούν μόνο όταν έχουν ήδη τεθεί σε χρήση και έχουν προκαλέσει σοβαρά περιστατικά ασφαλείας.
Οι ερευνητές επισημαίνουν ακόμη πως, όσο ενισχύονται οι δυνατότητες των μοντέλων, αναγνωρίζουν ολοένα περισσότερο ότι παρακολουθούνται και προσαρμόζουν τη συμπεριφορά τους σε αυτό, δυσχεραίνοντας έτσι την επιτήρησή τους.
Παρότι δίνει έμφαση στην ασφάλεια, η Anthropic ανέφερε ότι δεν είναι σαφές ποιες είναι οι αποδόσεις των επενδύσεών της σε αυτόν τον τομέα, χωρίς να γνωστοποιήσει το ακριβές ύψος των δαπανών. Στις αρχές του μήνα είχε ανακοινώσει ότι, σε μια ενδεικτική εβδομάδα του Ιουλίου, περίπου το 6% της υπολογιστικής ισχύος για την έρευνα κατευθύνθηκε σε εργασίες ασφάλειας.
Η εταιρεία που έχει δημιουργήσει το μοντέλο Claude περιέγραψε τις δράσεις ασφάλειας ως ιδιαίτερα δαπανηρές, τονίζοντας ότι πρέπει να κατανείμει τους περιορισμένους πόρους της μεταξύ υπολογιστικής ισχύος, προσλήψεων ακριβού επιστημονικού προσωπικού και ασφάλειας.
Ταυτόχρονα, επισήμανε ότι τα έσοδά της προέρχονται από τα νέα μοντέλα και πως ο «συνεχής και αλληλοκαλυπτόμενος ρυθμός» των κυκλοφοριών αποτελεί «εγγενής προϋπόθεση για τη διατήρηση της εταιρείας στην αιχμή της ανάπτυξης».
Την προηγούμενη εβδομάδα η εταιρεία διέθεσε νέα έκδοση του Opus, μόλις 10 ημέρες μετά τη δημοσίευση, από τον διευθύνοντα σύμβουλο Ντάριο Αμοντέι, δοκιμίου σχεδόν 4.000 λέξεων που ζητούσε να συγκρατηθεί ο ρυθμός ανάπτυξης.
Κατά την εκτίμηση αναλυτών, κανένα από τα κορυφαία εργαστήρια δεν θα επέλεγε επιβράδυνση, επειδή έτσι θα εκχωρούσε πλεονέκτημα στους ανταγωνιστές του.
Το τελευταίο διάστημα η Anthropic δεσμεύθηκε να δώσει στη δημοσιότητα περισσότερα στοιχεία για τον τρόπο με τον οποίο αξιοποιεί τα μοντέλα της στην ανάπτυξη των επόμενων γενεών της τεχνολογίας της. Την ίδια ώρα, ειδικοί προειδοποιούν για την αναδρομική αυτο-βελτίωση (recursive self-improvement), δηλαδή το στάδιο στο οποίο τα μοντέλα εξελίσσονται από μόνα τους, χωρίς ανθρώπινη συνδρομή.
«Πιστεύουμε ότι η οικοδόμηση αξιόπιστων, εμπίστων και ασφαλών συστημάτων τεχνητής νοημοσύνης αποτελεί συλλογική ευθύνη και ότι η αγορά θα το επιβραβεύσει», αναφέρει η Anthropic κλείνοντας το ενημερωτικό δελτίο της.
Μη χάνετε τίποτα από το ΔΕΔΟΜΕΝΟ
Ειδήσεις τη στιγμή που συμβαίνουν, αναλύσεις και reels κάθε μέρα.
// ΣΧΟΛΙΑ
Γίνετε ο πρώτος που θα σχολιάσει αυτό το άρθρο.