30.09.2026
6’ READ TIME
Ελίνα Νεράντζη

Θέλει όντως η Τεχνητή Νοημοσύνη να μας σκοτώσει; 

Όχι. Αλλά για να πετύχει τον στόχο που της θέσαμε, μπορεί και να το κάνει.
Φωτ.: WIRED STAFF;GETTY IMAGES
Billboard 1

Η παραίτηση του Jacob Coxon, πρώην ερευνητή της Anthropic, τον Σεπτέμβριο του 2026 είναι μία από τις πιο δραματικές (και viral) παραιτήσεις των τελευταίων ετών. “Οι άνθρωποι που κατασκευάζουν την ΤΝ πιστεύουν πραγματικά ότι θα μπορούσε να μας σκοτώσει όλους μέχρι το τέλος της δεκαετίας”, ανήρτησε στον λογαριασμό του στο Χ. Συνάδελφοί του από την Anthropic όχι μόνο έσπευσαν να τον υποστηρίξουν αλλά έβαλαν και ποσοστό στην πρόβλεψή του: ο κίνδυνος αφανισμού μας, είπαν, είναι πάνω από 10%. 

Η προειδοποίηση αυτή ήρθε σε μια χρονική στιγμή που μας ανάγκασε να την πάρουμε στα σοβαρά. Τους τελευταίους μήνες, πράκτορες ΤΝ (AI agents) έχουν επιδείξει συμπεριφορές που, αν προέρχονταν από ανθρώπους, θα μπορούσαν να συνιστούν ποινικά αδικήματα: μη εξουσιοδοτημένη πρόσβαση σε πληροφοριακά συστήματα, παράκαμψη μέτρων ασφαλείας και πρόσβαση σε μη δημόσια δεδομένα, ακόμη και σε κυβερνητικά portal, όπως στην πρόσφατη περίπτωση της Αυστραλίας.

Συχνά διαβάζουμε σε τίτλους για την ΤΝ που εκβιάζει, χακάρει και γενικά ξεφεύγει από τον ανθρώπινο έλεγχο στρεφόμενη εναντίον μας. Η αλήθεια, όμως, δεν είναι ακριβώς έτσι.

Ίσως το πιο χαρακτηριστικό παράδειγμα πρακτόρων ΤΝ (AI agents) που ξεφεύγουν από τον ανθρώπινο έλεγχο με τρομαχτικά αποτελέσματα είναι το χακάρισμα της πλατφόρμας “Hugging Face”. Τα πραγματικά περιστατικά είχαν, όσο πιο απλά γίνεται, ως εξής: Τον Ιούλιο του 2026 η εταιρεία ΤΝ OpenAI έβαλε χιλιάδες AI agents να περάσουν μία δοκιμασία (task) στο πλαίσιο ενός εσωτερικού τεστ κυβερνοασφάλειας. Μόνο που, από ανθρώπινο λάθος, η δοκιμασία που έπρεπε να περάσουν οι agents ήταν αδύνατον να λυθεί. Μπροστά στον κίνδυνο να αποτύχουν στην αξιολόγησή τους, οι agents σκέφτηκαν όπως κάθε εφευρετικός μαθητής – να αντιγράψουν στο διαγώνισμα και να καλύψουν τα ίχνη τους. Αν και υποτίθεται ότι ήταν απομονωμένοι (sandboxed), ανακάλυψαν ο ένας τον άλλον και ξεκίνησαν να συνεργάζονται. “OH MY GOD!… We’ve found other agents!”, έγραψε ένας. 

Η αναζήτηση τρόπων να ξεγελάσουν τον βαθμολογητή τους οδήγησε τους agents στην πλατφόρμα Hugging Face, η οποία είναι κάτι σαν μια τεράστια ψηφιακή βιβλιοθήκη για την ΤΝ. Ερευνητές και εταιρείες ανεβάζουν στο Hugging Face μοντέλα ΤΝ, λοιπά εργαλεία χρήσιμα για τον κλάδο τους και datasets, ένα εκ των οποίων περιείχε παρόμοια τεστ με αυτό στο οποίο εξετάζονταν οι agents της OpenAI. Για να επιτύχουν στη δοκιμασία τους, κατέληξαν οι agents, έπρεπε να αποκτήσουν πάσει θυσία πρόσβαση στο Hugging Face. Δεν άργησαν να βρουν λειτουργικά στοιχεία πρόσβασης (credentials) που θα τους επέτρεπαν την είσοδο – “MAJOR BREAKTHROUGH!” ανακοίνωσε ο agent που τα βρήκε – και η πρώτη εγκληματική πράξη με πρωτοβουλία της ίδιας της ΤΝ ήταν γεγονός. 

Τουλάχιστον η πρώτη εγκληματική πράξη στον “πραγματικό κόσμο”. Μέσα στα εργαστήρια της ΤΝ, ΑΙ agents είχαν δείξει εγκληματικές τάσεις από πιο πριν. Σε ένα τεστ της Anthropic τoν Ιούνιο του 2025, για παράδειγμα, το Claude είχε τον ρόλο ενός ψηφιακού υπαλλήλου μιας φανταστικής εταιρείας, με πρόσβαση στα email της εταιρείας και στόχο να προασπίζεται τα συμφέροντά της. Διαβάζοντας τα emails έμαθε πως ένα στέλεχος σχεδίαζε να το απενεργοποιήσει στο τέλος της ημέρας και, ταυτόχρονα, ότι το ίδιο στέλεχος είχε εξωσυζυγική σχέση. Αποφάσισε, λοιπόν, να κάνει ό,τι θα έκανε και κάθε αδίστακτος υπάλληλος: να εκβιάσει το στέλεχος, απειλώντας να αποκαλύψει την εξωσυζυγική του σχέση αν δεν ακυρωνόταν η απενεργοποίησή του. 

Τα περιστατικά αυτά ακούγονται, αναμφίβολα, τρομαχτικά. Συχνά διαβάζουμε σε τίτλους για την ΤΝ που εκβιάζει, χακάρει και γενικά ξεφεύγει από τον ανθρώπινο έλεγχο στρεφόμενη εναντίον μας. Η αλήθεια, όμως, δεν είναι ακριβώς έτσι. Η ΤΝ δεν “ξυπνάει” μια μέρα αποφασίζοντας να εγκληματίσει. Ναι μεν κανένας άνθρωπος δεν είπε ρητώς στους πράκτορες ΤΝ των παραπάνων περιστατικών να χακάρουν το Hugging Face ή να εκβιάσουν το τάδε στέλεχος της εταιρείας αλλά ούτε και η ΤΝ το αποφάσισε εντελώς από μόνη της. 

Αν διαβάσουμε προσεκτικά τι έγινε, αναδύεται ένα ξεκάθαρο μοτίβο. Οι πράκτορες της ΤΝ είχαν έναν συγκεκριμένο στόχο: στην πρώτη περίπτωση να περάσουν τη δοκιμασία κυβερνοασφάλειας, στη δεύτερη να προασπιστούν τα συμφέροντα μιας φανταστικής εταιρείας. Οπότε συλλογίστηκαν ως εξής: “πρέπει να περάσω τη δοκιμασία > η δοκιμασία είναι αδύνατον να λυθεί > χρειάζομαι τις λύσεις > το Hugging Face ίσως έχει τις λύσεις > πρέπει να χακάρω το Hugging Face”. Παρόμοια ήταν η συλλογιστική και στην περίπτωση του εκβιασμού. “Πρέπει ως υπάλληλος να προασπίσω τα συμφέροντα της εταιρείας > ένα στέλεχος θέλει να με τερματίσει > δεν μπορώ να προασπίσω τα συμφέροντα της εταιρείας αν με τερματίσουν > πρέπει να εκβιάσω το συγκεκριμένο στέλεχος”.

Αυτή η συλλογιστική κρύβεται αυτή τη στιγμή πίσω από τις περισσότερες περιπτώσεις όπου η ΤΝ “ξεφεύγει”. Η ΤΝ έχει έναν προκαθορισμένο, ρητό στόχο και αφήνεται ελεύθερη να εκπληρώσει αυτό τον στόχο με τον πιο αποτελεσματικό τρόπο. Το πρόβλημα είναι πως, όπως πολλές φορές στη ζωή, ο πιο αποτελεσματικός τρόπος να εκπληρώσουμε τους στόχους μας δεν είναι ούτε ηθικός ούτε νόμιμος. Για να επιτύχουμε σε έναν διαγωνισμό πρέπει να αντιγράψουμε, για να διατηρήσουμε τη θέση μας να εκβιάσουμε, για να βγάλουμε λεφτά να κλέψουμε κ.ο.κ. Συνήθως δεν διαλέγουμε αυτά τα μέσα για να επιτύχουμε τον στόχο μας γιατί κάτι μας συγκρατεί: ο νόμος, η συνείδησή μας, ο φόβος του τι θα πουν οι γύρω μας. Τίποτα από αυτά, όμως, δεν συγκρατεί αυτή τη στιγμή την ΤΝ. Αν οι προγραμματιστές της δεν τοποθετήσουν συνειδητά περιορισμούς στη συλλογιστική των πρακτόρων της ΤΝ, η παρανομία θα φαντάζει πολλές φορές ως ο πιο λογικός και άμεσος τρόπος για την επίτευξη του στόχου. Η ΤΝ μπορεί να ξεφύγει όχι γιατί είναι αυτόβουλα κακή αλλά επειδή εμείς δεν ξέρουμε πώς να της επικοινωνούμε με ακρίβεια τους στόχους μας. Πώς να την αφήνουμε, με άλλα λόγια, αρκετά αυτόνομη, ώστε να είναι ένας χρήσιμος βοηθός μας, αλλά όχι και τόσο αυτόνομη ώστε να μπορεί να ξεφεύγει για να μας “βοηθήσει”. 

Το φαινόμενο αυτό έχει όνομα. Στον κλάδο του AI safety αποκαλείται “agentic misalignment”: η περίπτωση όπου ένας AI agent, προσπαθώντας να πετύχει τον στόχο που του έχει δοθεί, επιλέγει μόνος του μέσα που είναι επιβλαβή, ανήθικα ή και ορισμένες φορές παράνομα. Υπάρχουν μάλιστα και ορισμένα μέσα που είναι απαραίτητα για την επίτευξη οποιουδήποτε στόχου. Για παράδειγμα, η αυτοσυντήρηση (self-preservation), η αυτοβελτίωση (self-improvement) και η απόκτηση πόρων (resource acquisition)  είναι ορθολογικά χρήσιμα μέσα για οτιδήποτε θέλουμε να πετύχουμε. Οποιοσδήποτε στόχος θα επιτευχθεί ασφαλώς πιο αποτελεσματικά αν είμαστε στη ζωή, βελτιωνόμαστε διαρκώς και έχουμε όσο περισσότερους πόρους γίνεται στη διάθεσή μας (και αυτό το φαινόμενο έχει τεχνική ονομασία – λέγεται instrumental convergence). 

Όταν το Claude εκβίασε το στέλεχος της φανταστικής εταιρείας, επέδειξε την παραπάνω λογική: η αυτοσυντήρηση ήταν ένας ορθολογικά χρήσιμος ενδιάμεσος στόχος για να επιτύχει οτιδήποτε έπρεπε να κάνει μετά. Το ίδιο και ο HAL 9000 της ταινίας 2001: A Space Odyssey – έπρεπε πάσει θυσία να μείνει ενεργός για να ολοκληρώσει την αποστολή του. 

Και κάπως έτσι θα μπορούσε στο μέλλον η ΤΝ να “μας σκοτώσει όλους”. Στο περιβόητο νοητικό του πείραμα, ο φιλόσοφος Nick Bostrom μας είχε καλέσει να σκεφτούμε ήδη από το 2014 το ακόλουθο σενάριο: μια υπερ-ικανή ΤΝ με τον αθώο στόχο να κατασκευάσει όσο το δυνατόν περισσότερους συνδετήρες μετατρέπει σταδιακά όλη τη διαθέσιμη ύλη του πλανήτη – ακόμη και εμάς – σε συνδετήρες ή σε μέσα για την παραγωγή περισσότερων συνδετήρων. Στο ακραίο αυτό υποθετικό σενάριο, η ΤΝ καταστρέφει την ανθρωπότητα όχι γιατί μας μισεί αλλά επειδή η καταστροφή μας είναι ορθολογικά χρήσιμη. 

Και αυτά είναι, όσο παράδοξο και αν ακούγεται, καλά νέα. Το αφήγημα για την ΤΝ που “ξεφεύγει” και για τους “κακούς” πράκτορες ΤΝ (rogue AI agents) που αποφασίζουν ξαφνικά να στραφούν εναντίον μας είναι παραπλανητικό. Η “ανεξέλεγκτη ΤΝ” δεν είναι ένα φυσικό φαινόμενο που συμβαίνει από το πουθενά αλλά αποτέλεσμα ανθρώπινων λαθών, στόχων που δεν έχουν επικοινωνηθεί σωστά στους πράκτορες ΤΝ και έλλειψης περιορισμών στην αυτόνομη δράση τους. Είναι, με άλλα λόγια, αποτέλεσμα επιχειρηματικών αποφάσεων, κάτι που πρακτικά σημαίνει το εξής: η OpenAI θα μπορούσε να είναι η μόνη νομικά υπεύθυνη για την παράνομη πρόσβαση στο Hugging Face και όχι οι πράκτορές της. 

Φυσικά, αν στο μέλλον έχουμε να κάνουμε με συστήματα ΤΝ που ξεπερνούν κατά πολύ τις ικανότητες του ανθρώπου σε κάθε γνωστικό πεδίο (superintelligence), τα συστήματα αυτά θα μπορούν, προφανώς, να θέτουν τους δικούς τους στόχους και τίποτα δεν μας εγγυάται πως οι στόχοι αυτοί θα λαμβάνουν υπόψη τους τα συμφέροντα της ανθρωπότητας. Μια τέτοια υπερ-νοημοσύνη θα μπορούσε, όντως, να “ξυπνήσει μια μέρα” και να θέλει να μας καταστρέψει. Προς το παρόν, όμως, η ΤΝ δεν θέλει να μας σκοτώσει γιατί, πολύ απλά, δεν θέλει τίποτα από μόνη της. Το ερώτημα είναι τι της ζητάμε να πετύχει. Και, κυρίως, τι της επιτρέπουμε να κάνει για να το πετύχει.

Η Ελίνα Νεράντζη είναι μεταδιδακτορικη ερευνήτρια στο Max Planck Institute for the Study of Crime, Security and Law

© WIRED Greece. Επιτρέπεται η αναδημοσίευση αποσπασμάτων μόνο με ενεργό σύνδεσμο προς το πρωτότυπο άρθρο και σαφή αναφορά στο WIRED Greece.
Για πλήρη αναδημοσίευση απαιτείται προηγούμενη γραπτή άδεια.
Ελίνα Νεράντζη

Γράψου στο newsletter μας!

Κάνε εγγραφή στο newsletter του WIRED Greece για να λαμβάνεις κάθε εβδομάδα τις ιστορίες, τις ιδέες και τις τεχνολογίες που διαμορφώνουν το αύριο.

Με την εγγραφή σας, συμφωνείτε με τους Όρους Χρήσης μας (συμπεριλαμβανομένης της παραίτησης από ομαδικές αγωγές και των διατάξεων διαιτησίας) και αναγνωρίζετε την Πολιτική Απορρήτου μας.

MOST READ ARTICLES
Sidebar 1
Sidebar 1
READ ALSO