Με την πρώτη ματιά είναι απλώς θόρυβος. Χιλιάδες μικροσκοπικές κουκκίδες, ίδιες στο χρώμα και στο μέγεθος, σκορπισμένες στην οθόνη. Μόλις το βίντεο αρχίσει να παίζει, ανάμεσά τους ξεπροβάλλουν λέξεις.
Αυτό είναι το Ghost Font, ένα πειραματικό εργαλείο του σχεδιαστή Eric Lu από τη Mixfont, εταιρεία με έδρα το Σαν Φρανσίσκο. Παρά το όνομά του, δεν είναι γραμματοσειρά που εγκαθιστάς στον υπολογιστή σου, αλλά παράγει σύντομα βίντεο σε λούπα, όπου τα γράμματα υπάρχουν μόνο ως κίνηση. Οι κουκκίδες που σχηματίζουν τα γράμματα κινούνται αντίθετα από εκείνες του φόντου. Σε ένα μεμονωμένο καρέ, δεν φαίνεται τίποτα.
Ο Lu πρόσθεσε κι ένα δεύτερο επίπεδο: σε κάθε βίντεο ενσωματώνεται ένα μήνυμα-δόλωμα (decoy), σχεδιασμένο να παραπλανά τα μοντέλα τεχνητής νοημοσύνης. Όταν έδωσε τα βίντεο στο GPT-5.6 Sol Ultra της OpenAI και στο Claude Fable της Anthropic, εκείνα διάβασαν το δόλωμα αλλά όχι το πραγματικό μήνυμα. Άλλες φορές τα μοντέλα δεν εντόπιζαν τίποτα ή «έβλεπαν» λέξεις που δεν υπήρχαν.
Στα τέλη Ιουλίου, η Mixfont παρουσίασε και ένα δεύτερο, στατικό πείραμα, το Decoy Font. Εδώ δύο μηνύματα μπαίνουν το ένα πάνω στο άλλο: τα γράμματα του προσκηνίου έχουν καθαρά περιγράμματα, ενώ πίσω τους βρίσκονται σκουρότερα γράμματα, τα οποία ο ανθρώπινος θεατής συνήθως βλέπει πιο έντονα. Τα μοντέλα, που διαβάζουν τα pixels μιας εικόνας από κοντά, εστιάζουν στο προσκήνιο. Στο παράδειγμα της εταιρείας, η ΤΝ διαβάζει «Sorry Robot», ενώ ο άνθρωπος βλέπει επιπλέον το «Happy Human» πίσω του.
Πώς λειτουργεί το κρυφό μήνυμα
Ο ανθρώπινος εγκέφαλος τείνει να ομαδοποιεί αυτόματα ό,τι κινείται στην ίδια κατεύθυνση ή με τον ίδιο ρυθμό, κάτι που οι ψυχολόγοι ονομάζουν αρχή της «κοινής μοίρας» (common fate). Τα μοντέλα τεχνητής νοημοσύνης, αντίθετα, συχνά επεξεργάζονται το βίντεο μέσω δειγματοληπτημένων καρέ, αντί να αναλύουν εξαρχής την κίνηση ως συνεχή πληροφορία.
«Τα σημερινά πολυτροπικά μοντέλα δεν μοντελοποιούν το βίντεο ως μια συνεχή ροή δεδομένων, αλλά δειγματοληπτούν (σχετικά) αραιά επιμέρους καρέ, συχνά ένα ανά δευτερόλεπτο, και τα επεξεργάζονται κυρίως ως ένα σύνολο στατικών εικόνων, με περιορισμένη χρονική συλλογιστική», λέει στο WIRED Greece ο Γεώργιος Παπαδόπουλος, επίκουρος καθηγητής στο Τμήμα Πληροφορικής και Τηλεματικής του Χαροκόπειου Πανεπιστημίου, ειδικός στην υπολογιστική όραση.
Στο SpookyBench, ένα benchmark που παρουσιάστηκε στο συνέδριο υπολογιστικής όρασης CVPR 2026, κάθε καρέ είναι σκέτος θόρυβος και η πληροφορία υπάρχει μόνο στον τρόπο που αυτός κινείται. Οι άνθρωποι αναγνώρισαν σχήματα, κείμενο και μοτίβα με ακρίβεια πάνω από 98%, τα κορυφαία μοντέλα με 0%. Το αποτέλεσμα ήταν ίδιο σε πάνω από 25 μοντέλα, ανοιχτού και κλειστού κώδικα.
Για τον Παπαδόπουλο, το Ghost Font δεν εφευρίσκει κάτι καινούργιο. Ουσιαστικά αναπαράγει τα «κινηματογράμματα τυχαίων κουκκίδων» (random-dot kinematograms), τα ερεθίσματα που χρησιμοποιούσε η ψυχοφυσική ήδη από τη δεκαετία του 1970.
Χωρίς αυστηρές οδηγίες
Το χάσμα δεν είναι όμως τόσο βαθύ όσο δείχνει. Όταν το Ghost Font έγινε viral, ο Riley Goodside, πρώην prompt engineer της Google DeepMind, έγραψε στο X ότι έκανε το GPT-5.6 Sol να το διαβάσει απλώς λέγοντάς του προς τα που μοιάζει να κινείται ο θόρυβος. Το εργαλείο σχεδιάστηκε για να λειτουργεί χωρίς να έχει ειπωθεί στο μοντέλο τι ακριβώς να ψάξει.
«Η οπτική ροή και η αφαίρεση φόντου είναι ήδη τεχνολογία περίπου σαράντα πέντε ετών», λέει ο Παπαδόπουλος. «Αρκεί το μοντέλο ΤΝ να κληθεί να τις εφαρμόσει (ή να γράψει τον σχετικό πηγαίο κώδικα) ή να εκπαιδευτεί με πυκνότερη χρονική δειγματοληψία. Πρόκειται επί της αρχής για μια αρχιτεκτονική επιλογή, όχι ένα θεμελιώδες όριο».
Η ταχύτητα με την οποία έσπασε η «ανοσία» δεν τον εξέπληξε. «Κάθε προσπάθεια ή μέτρο απόκρυψης που βασίζεται στην άγνοια του αντιπάλου καταρρέει μόλις ο μηχανισμός αυτός γίνει γνωστός», λέει. Στην περίπτωση του Ghost Font, αρκούσε να δοθεί στο μοντέλο η βασική αρχή του μηχανισμού.
CAN YOU READ THIS?
Τρεις μήνες μετά την κυκλοφορία του Ghost Font, δώσαμε ένα σχετικό βίντεο στο Claude Opus 5.5 της Anthropic, ρωτώντας μόνο «τι βλέπεις;». Δεν του δώσαμε καμία υπόδειξη για το τι περιέχει ή πως λειτουργεί. Όταν το μοντέλο κοίταξε ένα μεμονωμένο καρέ με την όρασή του, είδε μόνο θόρυβο. Αλλά δεν έμεινε εκεί.
Η απάντηση ήρθε όταν έγραψε, μόνο του, ένα σύντομο πρόγραμμα μέσω του εργαλείου εκτέλεσης κώδικα που διαθέτει το Claude. Το πρόγραμμα χώρισε το βίντεο των έξι δευτερολέπτων σε 186 καρέ και υπολόγισε την οπτική ροή, δηλαδή προς τα που μετακινείται κάθε σημείο της εικόνας από το ένα καρέ στο επόμενο. Μετά έκανε σύγκριση, για κάθε σημείο, για να δει αν ταιριάζει καλύτερα με κίνηση προς τα πάνω ή προς τα κάτω, και αθροίσε το αποτέλεσμα σε όλη τη διάρκεια. Στον «χάρτη κίνησης» που προέκυψε, τα γράμματα ξεχώριζαν από το φόντο και διαβαζόταν: «CAN YOU READ THIS?». Την κατεύθυνση της κίνησης δεν την είχε πει κανείς στο μοντέλο.
Το δόλωμα το εντόπισε με το αντίθετο κόλπο. Πήρε τον μέσο όρο όλων των καρέ: οι κουκκίδες που κινούνται «σβήνουν», ενώ ό,τι μένει ακίνητο αθροίζεται και γίνεται ορατό. Από κάτω ανέβηκε το «WRITTEN IN GHOST FONT», το ψεύτικο μήνυμα που παραπλανούσε τα μοντέλα.
Το ίδιο βίντεο το δώσαμε και σε δύο ακόμα μοντέλα, με την ίδια ερώτηση. Το Gemini της Google απάντησε ότι βλέπει μόνο στατικά παράσιτα. Όταν του ζητήσαμε να ψάξει καλύτερα, επέμεινε ότι το βίντεο δεν περιέχει τίποτα πέρα από θόρυβο και ότι «δεν υπάρχει κανένα κρυφό κείμενο».
Το ChatGPT της OpenAI είδε κι αυτό «χιόνι», αλλά πρότεινε μόνο του να εξετάσει το βίντεο πιο τεχνικά, καρέ-καρέ. Όταν του το ζητήσαμε, χωρίς να του πούμε τι ακριβώς να αναζητήσει, ανέλυσε και τα 186 καρέ, απομόνωσε ένα από τα bits των pixels και βρήκε ένα κείμενο που παρέμενε σταθερό από την αρχή έως το τέλος. Ανακοίνωσε με βεβαιότητα ότι το κρυφό μήνυμα είναι το «WRITTEN IN GHOST FONT». Η τεχνική του δουλεύει και το κείμενο βρίσκεται πράγματι εκεί, όμως είναι το δόλωμα. Ψάχνοντας μέσα στα ακίνητα καρέ αντί για την κίνηση ανάμεσά τους, το μοντέλο έπεσε στην παγίδα. Δεν εντόπισε το πραγματικό μήνυμα.
Ένα μοντέλο με πρόσβαση σε εργαλεία δεν χρειάζεται πια ούτε την πρόταση του Goodside: βρίσκει μόνο του τη μέθοδο που περιγράφει ο Παπαδόπουλος και την εφαρμόζει. O Lu έχει δηλώσει ότι όσοι προσπαθούν να αποδείξουν ότι ένας AI agent μπορεί να διαβάσει τα κρυφά μηνύματα χάνουν το νόημα του προτζέκτ.
Ένα μοτίβο που επαναλαμβάνεται
Το ίδιο έχει συμβεί ξανά στο παρελθόν. Το 2012, ερευνητές από το Πανεπιστήμιο της Βόρειας Καρολίνας και το Carleton του Καναδά παρουσίασαν επίθεση που έσπαγε το NuCaptcha, ένα CAPTCHA με κινούμενο κείμενο που τότε θεωρούνταν το πιο προηγμένο του είδους του.
Το 2018, ερευνητές εξέτασαν εννέα άμυνες κατά των αντιπαραθετικών παραδειγμάτων (adversarial examples -δεδομένα που έχουν υποστεί σκόπιμες, ανεπαίσθητες αλλαγές με σκοπό να παραπλανήσουν ένα μοντέλο) από το συνέδριο ICLR της ίδιας χρονιάς: επτά βασίζονταν στο ίδιο ελάττωμα, και οι ερευνητές παρέκαμψαν τις επτά. Το 2024, άλλη ομάδα έδειξε ότι εργαλεία προστασίας καλλιτεχνών όπως το Glaze παρακάμπτονται με απλές τεχνικές, όπως η αναβάθμιση ανάλυσης (upscaling). Οι δημιουργοί του Glaze αμφισβήτησαν μέρος των ευρημάτων και κυκλοφόρησαν νέα έκδοση.
«Η ασυμμετρία είναι δομική: ο αμυνόμενος δεσμεύεται μία φορά, ενώ ο επιτιθέμενος προσαρμόζεται επ’ αόριστον», λέει ο Παπαδόπουλος. Ως μέτρα ασφαλείας, κατά τον ίδιο, τέτοιες τεχνικές είναι «παρωχημένες εξ αρχής». «Ως πειράματα αντίληψης και διαγνωστικά των αδυναμιών των μοντέλων, όμως, έχουν πραγματική επιστημονική αξία».
Μπορεί να γίνει το νέο CAPTCHA;
Κάτι που έχει συζητηθεί είναι το ενδεχόμενο το Ghost Font, ή ένα παρόμοιο εργαλείο, να χρησιμοποιηθεί κάποτε ως CAPTCHA. Ο Παπαδόπουλος είναι επιφυλακτικός: «Η ιστορία των CAPTCHA είναι ένα πεδίο με πολλές αστοχίες τα τελευταία είκοσι χρόνια», λέει.
Το 2017, η εταιρεία Vicarious δημοσίευσε στο Science ένα μοντέλο που έσπαγε τα CAPTCHA κειμένου. Ήδη τότε, οι μεγάλες εταιρείες είχαν εγκαταλείψει το συγκεκριμένο είδος. Το 2024, ερευνητές του ETH Ζυρίχης έλυσαν το 100% των οπτικών γρίφων του reCAPTCHA v2 της Google. Και σε μελέτη με 1.400 συμμετέχοντες, με επικεφαλής το Πανεπιστήμιο της Καλιφόρνιας στο Ιρβάιν, τα bots ήταν ταχύτερα και ακριβέστερα: στο παραμορφωμένο κείμενο, οι άνθρωποι χρειάζονταν 9-15 δευτερόλεπτα με ακρίβεια 50-84%, τα bots λιγότερο από ένα δευτερόλεπτο με 99,8%.
Υπάρχει και το ζήτημα της προσβασιμότητας. «Ό,τι δυσκολεύει τον υπολογιστή δυσκολεύει και τον άνθρωπο, ιδίως άτομα με μειωμένη όραση», λέει ο Παπαδόπουλος. O Lu παραδέχεται ότι το Ghost Font δεν διαβάζεται εύκολα ούτε από ανθρώπους. Γι’ αυτό, σύμφωνα με τον καθηγητή, η έρευνα μετατοπίζεται από τους οπτικούς γρίφους σε κρυπτογραφικά διαπιστευτήρια, όπως το Privacy Pass και τα personhood credentials, και στην ανίχνευση συμπεριφοράς.
Όσο για την προστασία από το scraping, τα πράγματα είναι ακόμα πιο απλά. «Ο scraper διαβάζει το αρχείο HTML, όχι την εικόνα», λέει ο Παπαδόπουλος. Το νόημα τέτοιων τεχνικών, όπως το βλέπει, βρίσκεται αλλού: «Ως ήπια, πρόσκαιρη απόκρυψη και, κυρίως, ως ερευνητικά ερεθίσματα για τη βελτίωση της χρονικής αντίληψης των μοντέλων».