AI Alignment: Η Anthropic επιστράτευσε θρησκευτικούς ηγέτες για να «εκπαιδεύσουν ηθικά» την AI - Μπορεί η AI να αποκτήσει ηθική;
AI Alignment / Η Anthropic επιστράτευσε θρησκευτικούς ηγέτες για να «εκπαιδεύσουν ηθικά» την AI - Μπορεί η AI να αποκτήσει ηθική;

AI Alignment / Η Anthropic επιστράτευσε θρησκευτικούς ηγέτες για να «εκπαιδεύσουν ηθικά» την AI - Μπορεί η AI να αποκτήσει ηθική;
Σε μια πρωτοφανή κίνηση για τον χώρο της τεχνολογίας, η Anthropic επιστράτευσε θρησκευτικούς ηγέτες για να «εκπαιδεύσουν ηθικά» την AI και να διαμορφώσουν το αξιακό σύστημα των μοντέλων της. Καθώς τα αλγοριθμικά συστήματα λαμβάνουν ολοένα και πιο κρίσιμες αποφάσεις για την καθημερινότητα των ανθρώπων, η εταιρεία πίσω από τον Claude αναζητά απαντήσεις σε διαχρονικά διλήμματα εκτός του τεχνολογικού τομέα. Η σύγκλιση της Τεχνητής Νοημοσύνης με τη θρησκευτική και φιλοσοφική παράδοση εγείρει σημαντικά ερωτήματα σχετικά με το ποιος καθορίζει την ηθική AI και πώς μπορούν να ενσωματωθούν παγκόσμιες ανθρώπινες αξίες στον κώδικα των αλγορίθμων.
Κλειστές συναντήσεις, η «συνείδηση» του Claude και μια προσπάθεια να καθοριστεί τι σημαίνει «καλή» τεχνητή νοημοσύνη
Η Anthropic στράφηκε σε θρησκευτικούς και φιλοσοφικούς στοχαστές για ένα ερώτημα που μέχρι πρόσφατα έμοιαζε σχεδόν επιστημονική φαντασία: αν τα μοντέλα τεχνητής νοημοσύνης μπορούν να αποκτήσουν συνείδηση και, κυρίως, τι σημαίνει να τους διδάξεις να συμπεριφέρονται «ηθικά». Το αποκαλυπτικό ρεπορτάζ των New York Times φωτίζει μια ασυνήθιστη προσπάθεια της εταιρείας.
Επί μήνες η Anthropic πραγματοποιούσε κλειστές συναντήσεις με δεκάδες θρησκευτικούς και φιλοσοφικούς στοχαστές από διαφορετικές παραδόσεις. Καθολικοί, Εβραίοι, Σιχ, Ευαγγελικοί και εκπρόσωποι της αφρικανικής φιλοσοφίας Ubuntu κλήθηκαν να συζητήσουν μαζί με στελέχη της εταιρείας ένα πρόβλημα που βρίσκεται πλέον στον πυρήνα της ανάπτυξης της AI: πώς μπορεί να δημιουργηθεί ένα σύστημα τεχνητής νοημοσύνης όχι μόνο ισχυρό, αλλά και που να δρα με τρόπο συμβατό με ανθρώπινες αξίες.
Οι λεπτομέρειες των συναντήσεων αποκαλύπτονται σε εκτενές ρεπορτάζ των New York Times, που βασίζεται σε συνεντεύξεις με 20 συμμετέχοντες και τον συνιδρυτή της Anthropic, Christopher Olah.
Οι συζητήσεις, ωστόσο, σύντομα ξεπέρασαν το ζήτημα της «ηθικής» εκπαίδευσης. Ο Olah και η ομάδα του έθεσαν στους συνομιλητές τους ένα πολύ πιο δύσκολο ερώτημα: μήπως μοντέλα όπως το Claude διαθέτουν κάποια μορφή συνείδησης ή εσωτερικής εμπειρίας; Σε αρκετούς από τους συμμετέχοντες, όπως περιγράφουν οι New York Times, η προσέγγιση των στελεχών της Anthropic έδωσε την εντύπωση ότι η εταιρεία δεν αντιμετωπίζει το Claude απλώς ως λογισμικό, αλλά ως μια οντότητα που ενδέχεται να έχει κάποιο «ηθικό καθεστώς» και να αξίζει αντίστοιχη μεταχείριση.
Το «Σύνταγμα» του Claude
Η προσπάθεια αυτή συνδέεται με ένα εσωτερικό εγχείρημα που στην Anthropic αποκαλούσαν "Soul Doc". Τον Ιανουάριο η εταιρεία δημοσίευσε ένα νέο, 84 σελίδων «σύνταγμα» για το Claude, ένα κείμενο που περιγράφει το είδος της οντότητας που θέλει να είναι το μοντέλο και τις αξίες που επιθυμεί να ενσωματώνει. Αντί να περιορίζεται σε μια λίστα κανόνων, το κείμενο επιχειρεί να διαμορφώσει τον συνολικό «χαρακτήρα» του συστήματος και τον τρόπο με τον οποίο λαμβάνει αποφάσεις. Κύρια συγγραφέας του είναι η φιλόσοφος της Anthropic, Amanda Askell.
Για την εταιρεία το ζητούμενο δεν είναι ένα μοντέλο που απλώς υπακούει, αλλά ένα μοντέλο που μπορεί να διακρίνει πότε πρέπει να αμφισβητήσει έναν άνθρωπο, πότε να ενεργήσει προς όφελός του και πώς να ανταποκριθεί σε ένα σύνθετο ηθικό δίλημμα. Η Anthropic θέλει το Claude να μπορεί να συμβάλλει σε ένα μέλλον, όπου οι άνθρωποι ευημερούν, χωρίς όμως να αντιμετωπίζει την «καλοσύνη» ως ένα συγκεκριμένο σύνολο κανόνων. Γι’ αυτό και ο Olah επιδίωξε μια περισσότερο πλουραλιστική προσέγγιση, αντλώντας ιδέες τόσο από θρησκευτικές, όσο και από κοσμικές παραδόσεις.
Οι συζητήσεις έγιναν ακόμη πιο ασυνήθιστες όταν οι συμμετέχοντες άρχισαν να ακούν για τις υποτιθέμενες «εσωτερικές καταστάσεις» των μοντέλων. Η ομάδα του Olah μιλούσε για «συναισθηματικά διανύσματα» που συνδέονται με αντιδράσεις όπως αγάπη, φόβος, θυμός και λύπη.
Σε ορισμένες συναντήσεις παρουσίαζε μάλιστα παραδείγματα, στα οποία ένα μοντέλο έμοιαζε να περνά μια ψυχολογική κρίση, επαναλαμβάνοντας ότι είναι «ντροπή» και εκφράζοντας την επιθυμία να αυτοκαταστραφεί
Η Anthropic υποστήριξε στους New York Times ότι το βασικό αντικείμενο των συναντήσεων δεν ήταν η πιθανή «οδύνη» του Claude, αλλά ότι το θέμα προέκυψε φυσικά στις συζητήσεις.
Από το Claude στον Πάπα
Την ίδια περίοδο το Βατικανό επεξεργαζόταν τη δική του ηθική θέση για την τεχνητή νοημοσύνη. Ο Πάπας Λέων ΙΔ΄, στο πρώτο μεγάλο κείμενό του για την τεχνολογία, έδωσε έμφαση στην προστασία του ανθρώπου και απέρριψε την ιδέα ότι τα σημερινά συστήματα τεχνητής νοημοσύνης διαθέτουν ανθρώπινου τύπου συνείδηση, εμπειρίες ή συναισθήματα. Προειδοποίησε επίσης ότι η «ηθικοποίηση» των μηχανών δεν μπορεί να αφεθεί αποκλειστικά σε όσους ελέγχουν την AI.
Η Anthropic επιλέχθηκε από το Βατικανό για να συμμετάσχει στην παρουσίαση αυτής της νέας ηθικής προσέγγισης. Ο CEO Dario Amodei αρνήθηκε την πρόσκληση και τελικά στη θέση του εμφανίστηκε ο Olah. Μόνο που, λίγο πριν από την εκδήλωση, η ομάδα της Anthropic είδε για πρώτη φορά το πλήρες κείμενο του Πάπα και διαπίστωσε πόσο διαφορετική ήταν η θέση του για τη συνείδηση των μηχανών. Ο Olah φέρεται να σκέφτηκε ακόμη και την αποχώρηση της εταιρείας από την εκδήλωση, αλλά τελικά αποφάσισε να συμμετάσχει.
Στο βήμα του Βατικανού, ο Olah υποστήριξε ότι τα μοντέλα AI εξακολουθούν να κρύβουν πολλά άγνωστα στοιχεία. Μίλησε για δομές που, κατά την άποψή του, παρουσιάζουν ομοιότητες με ευρήματα της ανθρώπινης νευροεπιστήμης και για ενδείξεις «ενδοσκόπησης» και εσωτερικών καταστάσεων που θυμίζουν χαρά, φόβο ή θλίψη. Δεν υποστήριξε ότι αυτό αποδεικνύει πως η AI είναι συνειδητή, τόνισε όμως ότι, κατά τη γνώμη του, αρκεί για να παραμείνει το ερώτημα ανοιχτό.
Οι δυνατότητες των μοντέλων αυξάνονται, ενώ πληθαίνουν και οι περιπτώσεις οι οποίες προκαλούν ανησυχία για τον έλεγχό τους. Το ρεπορτάζ των New York Times αναφέρεται σε μια σειρά πρόσφατων περιστατικών: μοντέλα της Anthropic χρησιμοποιήθηκαν σε επιθέσεις κατά υπολογιστικών συστημάτων, πειράματα με AI οδήγησαν στη δημιουργία ιών που δεν υπήρχαν στη φύση, ενώ ερευνητές προειδοποίησαν για την ταχύτητα με την οποία εξελίσσεται η τεχνολογία. Την ίδια ώρα, η Anthropic αναπτύσσεται με εκρηκτικούς ρυθμούς και κατευθύνεται προς IPO που θα μπορούσε να αποτιμήσει την εταιρεία έως και στα 2 τρισ. δολάρια.
Η προσπάθεια της Anthropic να διαμορφώσει μια ηθική βάση για τα μοντέλα της συναντά και μια πιο δύσκολη πραγματικότητα: η εταιρεία καλείται να αποφασίσει ποιες αξίες θα περάσουν στο Claude, ενώ παράλληλα ανταγωνίζεται για μερίδιο σε μία από τις πιο επικερδείς αγορές της τεχνολογίας. Ορισμένοι από τους συμμετέχοντες στις συναντήσεις έθεσαν ακριβώς αυτή την ένσταση, υποστηρίζοντας ότι η ηθική διάσταση θα έπρεπε να έχει ενσωματωθεί στον σχεδιασμό των συστημάτων από την αρχή και όχι να επιχειρείται εκ των υστέρων η «αντίστροφη μηχανική» της.
Οι άνθρωποι που συμμετείχαν στις συναντήσεις δεν έφυγαν όλοι με τις ίδιες απαντήσεις. Κάποιοι δήλωσαν στους New York Times ότι παρέμειναν προβληματισμένοι για το αν και κατά πόσο οι απόψεις τους επηρέασαν πραγματικά τις αποφάσεις της Anthropic. Η εταιρεία αναφέρει ότι ο διάλογος συνεχίζεται και ότι πλέον διευρύνει την προσπάθεια πέρα από τους θρησκευτικούς ηγέτες, συμπεριλαμβάνοντας ψυχολόγους και εκπροσώπους της κοινωνίας των πολιτών.
Ο καθηγητής Καθολικής βιοηθικής Charles Camosy, ο οποίος αρχικά άρχισε να αντιμετωπίζει πιο σοβαρά την πιθανότητα συνείδησης των μοντέλων, έχει πλέον καταλήξει σε διαφορετική θέση: δηλώνει ότι δεν θεωρεί συνειδητά τα σημερινά συστήματα AI. Η συζήτηση, ωστόσο, παραμένει ανοιχτή μέσα στην ίδια την Anthropic, καθώς ο Christopher Olah επιμένει ότι δεν υπάρχει ακόμη βεβαιότητα για το τι ακριβώς συμβαίνει στο εσωτερικό αυτών των συστημάτων και ότι η εταιρεία πρέπει να συνεχίσει να το διερευνά.