Μια ψηφιακή τάξη. Στα «θρανία», τέσσερα γλωσσικά μοντέλα γράφουν θέματα Πανελλαδικών. Στην «έδρα», ένα άλλο μοντέλο διορθώνει τα γραπτά τους. Πόσο καλά τα καταφέρνει η τεχνητή νοημοσύνη όταν οι εξετάσεις είναι στα ελληνικά;
Το ερώτημα δεν είναι εύκολο να απαντηθεί. Τα περισσότερα benchmarks, τα τυποποιημένα «διαγωνίσματα» με τα οποία συγκρίνονται τα γλωσσικά μοντέλα, είναι γραμμένα στα αγγλικά.
Αυτό εξετάζει μια νέα μελέτη της Παναγιώτας Κυριαζή, της Ελένης Κασούρα και του Προκόπη Προκοπίδη από το Ινστιτούτο Επεξεργασίας του Λόγου (ΙΕΛ) του Ερευνητικού Κέντρου «Αθηνά». Το ΙΕΛ/ΕΚ Αθηνά, το οποίο συμμετέχει στο AI Factory «Pharos» -το εργοστάσιο ΤΝ της Ελλάδας- και συντονίζει τον πυλώνα του έργου που εστιάζει στη γλώσσα και τον πολιτισμό, διαθέτει μεγάλη παράδοση στην ανάπτυξη γλωσσικών πόρων για την ελληνική γλώσσα. Στο πλαίσιο αυτό, το ΙΕΛ/ΕΚ Αθηνά αναπτύσσει, μεταξύ άλλων, benchmarks για μεγάλα γλωσσικά μοντέλα που εστιάζουν στην ελληνική πραγματικότητα, την κοινωνία, την ιστορία, τα έθιμα, ακόμη και την ελληνική αργκό.
Η ομάδα έφτιαξε δύο νέα benchmarks: το Prot-Ex, με θέματα από τις εισαγωγικές εξετάσεις των Πρότυπων και Πειραματικών σχολείων, και το Pan-Ex, με θέματα Πανελλαδικών. Πάνω τους δοκίμασε τέσσερα ανοιχτά μοντέλα, σε μαθήματα από τη Νέα Ελληνική Γλώσσα και τα Αρχαία μέχρι τα Μαθηματικά, τη Φυσική, τη Χημεία και την Πληροφορική.
Η μελέτη είναι κομμάτι μιας ευρύτερης δουλειάς του ΙΕΛ, που φτιάχνει από τη μία μοντέλα με έμφαση στα ελληνικά και από την άλλη τα «διαγωνίσματα» για να τα αξιολογεί. « Θέλουμε να μπορούμε να αξιολογούμε τόσο τα δικά μας μοντέλα όσο και μοντέλα που αναπτύσσουν άλλοι ερευνητές, και ταυτόχρονα να δίνουμε την ίδια δυνατότητα και σ’ εκείνους», λέει ο Προκοπίδης στο WIRED Greece. «Όλα τα benchmarks που κατασκευάζουμε τα διαθέτουμε ανοιχτά μετά από λίγο καιρό». Τα περισσότερα βρίσκονται ήδη στη σελίδα του ινστιτούτου στο Hugging Face.
Ένα μοντέλο λύνει, ένα άλλο βαθμολογεί
Η διαδικασία θυμίζει εξεταστικό κέντρο. Ένα μοντέλο, ο «μαθητής», λύνει τα θέματα. Ένα δεύτερο μοντέλο, το Gemma-3-27B της Google στα πρώτα πειράματα που αναφέρονται στο άρθρο, διορθώνει τις απαντήσεις. Οι ερευνητές δεν αρκέστηκαν στις μετρήσεις που απλώς ελέγχουν πόσο μοιάζει μια απάντηση λέξη προς λέξη με την επίσημη λύση. Κατά τη μελέτη, τέτοιες μετρήσεις δεν φτάνουν για να κρίνουν ένα σύνθετο συλλογισμό.
«Θέλαμε να αξιολογήσουμε και τη συλλογιστική πορεία που ακολουθεί το LLM-μαθητής», εξηγεί η Κυριαζή. Ο βαθμολογητής μπορεί να δώσει μονάδες ακόμη κι όταν το τελικό αποτέλεσμα είναι λανθασμένο, αν ο δρόμος προς αυτό έχει σωστά στοιχεία, «όπως πιθανώς θα έδινε και κάποιος άνθρωπος βαθμολογητής».
Ο βαθμολογητής όμως δεν είναι αλάνθαστος. Στις ανοιχτές ερωτήσεις, λέει η Κασούρα, «τείνει να δίνει λίγο περισσότερους βαθμούς από αυτούς που θα έδινε ένας άνθρωπος». Ο Προκοπίδης προσθέτει δύο γνωστές παγίδες: μοντέλα της ίδιας οικογένειας τείνουν να είναι επιεικέστερα μεταξύ τους, και τα μοντέλα-κριτές συχνά ανταμείβουν απαντήσεις μεγαλύτερου μήκους. Γι’ αυτό η ομάδα έχει ανεβάσει δείγμα των απαντήσεων σε πλατφόρμα όπου τις βαθμολογούν και άνθρωποι, για να δει πόσο συμφωνούν οι δύο βαθμοί.
Πόσο καλά έγραψαν;
Σε μεγάλο βαθμό ορισμένα από αυτά τα καταφέρνουν, λέει η Κασούρα. Η εικόνα αλλάζει ανάλογα με το μάθημα και το είδος της ερώτησης: άλλο μια ερώτηση πολλαπλής επιλογής και άλλο μια ανοιχτή, που ζητά ολόκληρη απάντηση με πλήρη αιτιολόγηση.
Το ενδιαφέρον της μελέτης βρίσκεται στο KriKri-8B, το ελληνικό μοντέλο του ΙΕΛ. Είναι χτισμένο πάνω στο Llama-3.1-8B της Meta, που επίσης δοκιμάστηκε, μαζί με δύο αρκετά μεγαλύτερα μοντέλα, το Gemma-4-26B της Google και το Qwen3-32B της Alibaba.
Το KriKri δεν κερδίζει παντού. Η πιο καθαρή σύγκριση της μελέτης είναι με το Llama-3.1-8B, το μοντέλο πάνω στο οποίο χτίστηκε: ίδιο μέγεθος, με και χωρίς ελληνική εξειδίκευση. Στο Pan-Ex, το benchmark των Πανελλαδικών, το KriKri έφτασε στα ανοιχτά θέματα το 59,33%, σχεδόν διπλάσιο από το 30,81% του Llama. Το μεγαλύτερο άλμα ήταν στα ανοιχτά θέματα των Μαθηματικών: 61,47% έναντι 19,47%.
Απέναντι στα μεγαλύτερα μοντέλα, η εικόνα αλλάζει. Στα ίδια θέματα Μαθηματικών, το Gemma-4-26B έφτασε το 91,58% και το Qwen3-32B το 93,42%, και συνολικά στα ανοιχτά θέματα και τα δύο ξεπέρασαν το 74%. Στη Νέα Ελληνική Γλώσσα όμως, το KriKri ισοφάρισε το Gemma στις ανοιχτές ερωτήσεις (82,02%) και ξεπέρασε το Qwen (79,88%), ενώ στις κλειστές έφτασε το 96,67%, δέκα μονάδες πάνω και από τα δύο. Στην Ιστορία, βρέθηκε μπροστά και από τα δύο.
Στα θεωρητικά μαθήματα, εξηγεί η Κασούρα, τα μοντέλα έχουν ένα πλεονέκτημα: «Δίνεται και ένα αρχικό κείμενο, από το οποίο μπορεί το μοντέλο να αντλήσει πληροφορίες, και άρα του είναι και λίγο πιο εύκολο σε σχέση με το να ακολουθήσει τη συλλογιστική πορεία των Μαθηματικών ή της Φυσικής». Στη Γλώσσα το KriKri τα πήγε καλύτερα. Στη Φυσική, τη Χημεία και τα Μαθηματικά, όμως, τα «μαμούθ», όπως τα λέει, εξακολουθούν να είναι μπροστά. Εκεί, το πλεονέκτημα των μεγαλύτερων μοντέλων γίνεται πιο εμφανές.
Όταν τα παραδείγματα μπερδεύουν
Υπάρχει και ένα εύρημα που ξαφνιάζει. Μια συνηθισμένη τεχνική είναι να δίνεις στο μοντέλο μερικά λυμένα παραδείγματα μέσα στο prompt, πριν από την ερώτηση. Η λογική λέει ότι έτσι θα τα πάει καλύτερα. Στις κλειστές ερωτήσεις αυτό πράγματι ίσχυε. Στις δομημένες, τα μικρά μοντέλα των 8 δισεκατομμυρίων παραμέτρων υπερφορτώθηκαν και η απόδοσή τους έπεσε σημαντικά.
«Είδαμε ότι υπήρχε η λεγόμενη κατάρρευση, όπου τα μοντέλα αυτά πήγαιναν καλύτερα όταν δεν είχαν κάποιο παράδειγμα», λέει η Κυριαζή. «Εικάζαμε εξ αρχής ότι θα τα πάνε καλύτερα, αλλά δεν συνέβη αυτό στα μικρότερα». Η ομάδα ψάχνει τώρα το «sweet spot»: πόσα παραδείγματα βοηθούν πριν αρχίσουν να βλάπτουν. Ο Προκοπίδης υπενθυμίζει ότι η δημοσίευση είναι preprint, δεν έχει δηλαδή περάσει ακόμη από αξιολόγηση: «Είναι τα πρώτα ευρήματα από την έρευνά μας. Στην επόμενη έκδοση θα έχουμε περισσότερες λεπτομέρειες».
Γιατί δεν δοκιμάστηκαν τα ChatGPT και Gemini
Οι μαθητές πάντως δεν χρησιμοποιούν το KriKri. Χρησιμοποιούν μοντέλα όπως τα ChatGPT και Gemini, που δεν δοκιμάστηκαν. «Σίγουρα αυτά τα μοντέλα είναι πάρα πολύ προχωρημένα», λέει ο Προκοπίδης. «Όχι πάντα. Εκεί που δίνει καταπληκτικές απαντήσεις, μπορεί να πετάξει και κάποια ανορθόγραφη λέξη στα ελληνικά», υπενθυμίζει τους περιορισμούς, ειδικά στη γλώσσα μας.
Η επιλογή όμως είναι θέμα αρχής. Το ΙΕΛ ενδιαφέρεται για ανοιχτά μοντέλα, που μπορεί κανείς να τα κατεβάσει, να τα τρέξει και να καταλάβει πώς προέκυψε μια απάντηση. «Δεν μας ενδιαφέρει να χρησιμοποιήσουμε κάποιο μοντέλο για το οποίο διαβάζουμε ένα technical report, αλλά δεν ξέρουμε πραγματικά τη μαγιά πάνω στην οποία χτίστηκε», λέει.
Τέτοιες μελέτες αγγίζουν και ένα ευρύτερο ερώτημα: χρειάζεται μια χώρα σαν την Ελλάδα δικά της γλωσσικά μοντέλα, όταν τα μεγάλα έρχονται από την Αμερική και την Κίνα; Για τον Προκοπίδη, η απάντηση βρίσκεται ακριβώς σε τέτοια πειράματα. Κάθε φορά που ένα μικρό, εξειδικευμένο μοντέλο στέκεται απέναντι σε μεγαλύτερα, λέει, «μας κεντρίζει το ενδιαφέρον για να προσπαθήσουμε να χτίσουμε κι άλλα τέτοια Greek-specific, culturally-specific μοντέλα».
Τι κάνει ένα μοντέλο καλό στα ελληνικά
Πώς ένα μικρότερο μοντέλο στέκεται απέναντι σε μεγαλύτερα, που έχουν δει συνολικά πολύ περισσότερα δεδομένα; Κατά τον Προκοπίδη, ένα μυστικό είναι η ποιότητα. Το ελληνικό μοντέλο «έχει δει περισσότερα και ποιοτικότερα δεδομένα» στη γλώσσα μας, που ειδικοί ερευνητές στο ΙΕΛ φροντίζουν να περνούν από προσεκτικό φιλτράρισμα για να αφαιρεθούν διπλότυπα, και τοξικό περιεχόμενο και τελικά το μοντέλο να μπορεί να ακολουθεί οδηγίες και να αποφεύγει την παραγωγή «παραισθήσεων» στις απαντήσεις του. Μετράει επίσης η αναλογία με την οποία αναμειγνύονται τα δεδομένα στην εκπαίδευση.
Ο στόχος δεν είναι ένα μοντέλο που ξέρει μόνο ελληνικά. Η ομάδα προσπαθεί να αποφύγει αυτό που οι ερευνητές λένε catastrophic forgetting: όταν ένα μοντέλο μαθαίνει κάτι νέο και ξεχνάει όσα ήξερε. «Θέλουμε τα καινούργια μοντέλα να είναι όσο το δυνατόν περισσότερο πολύγλωσσα, και ταυτόχρονα κοιτάζουμε με περισσότερη φροντίδα τα ελληνικά», λέει.
Υπάρχει και ο κίνδυνος ένα μοντέλο να «θυμάται» αντί να λύνει. Τα θέματα των Πανελλαδικών κυκλοφορούν ελεύθερα στο διαδίκτυο, μαζί με τις λύσεις τους, και μπορεί να έχουν μπει στα δεδομένα εκπαίδευσης -το λεγόμενο data contamination. Για να το αντιμετωπίσει, το ΙΕΛ κρατά σε κάθε benchmark ένα μικρό κομμάτι ιδιωτικό, που δεν δημοσιεύεται ποτέ. «Βέβαιοι δεν είμαστε ποτέ 100%», παραδέχεται ο Προκοπίδης, «αλλά υπάρχουν πολύ αξιόπιστες τεχνικές για να ελέγχουμε το αν δεδομένα αξιολόγησης έχουν παρεισφρήσει».
Από τις εξετάσεις στο άγχος των υποψηφίων
Ένα άλλο benchmark, το GEAR (Greek Empathy Assessment Resource), εξετάζει και πάλι τις Πανελλαδικές, αλλά από άλλη πλευρά. Περιέχει δημόσιες αναρτήσεις υποψηφίων σε φόρουμ, όπου μοιράζονταν το άγχος και τους φόβους τους. Οι ερευνητές έβαλαν μοντέλα να τους απαντήσουν και μέτρησαν πόση κατανόηση έδειχναν.
Οι απαντήσεις, λέει η Κυριαζή, είχαν σταθερή δομή: μια καθησυχαστική αρχή («μην ανησυχείς», «υπάρχουν κι άλλες ευκαιρίες»), επιχειρήματα για το γιατί δεν πρέπει να στενοχωριέται ο μαθητής, και ένα κλείσιμο ότι όλα θα πάνε καλά. Μια δομή, προσθέτει, που ακολουθούμε και οι άνθρωποι, «είτε συνειδητά είτε ασυνείδητα».
Πρέπει να αλλάξουν οι εξετάσεις;
Αν ένα μοντέλο μπορεί να περάσει τις Πανελλαδικές, πρέπει να αλλάξουν μορφή οι εξετάσεις; Η Κασούρα δεν το πιστεύει. Οι εξετάσεις ελέγχουν πώς ανταποκρίνεται ο μαθητής σε συγκεκριμένη ύλη, ενώ ένα μοντέλο μπορεί να αντλήσει πληροφορίες από παντού. Αν κάθε παιδί δούλευε με το δικό του, λέει, δεν θα υπήρχε ομοιογένεια στο τι ξέρει ο καθένας.
Δεν θέλει όμως η τεχνητή νοημοσύνη να γίνει «το μαύρο πρόβατο» στα σχολεία. «Άμα κυνηγάμε πάρα πολύ κάτι, το ενοχοποιούμε, και έτσι τα παιδιά καταφεύγουν σε αυτό ως εύκολη λύση», λέει η Κυριαζή. Με δικλίδες ασφαλείας και καθοδήγηση, πιστεύει ότι θα μπορούσε να λειτουργήσει ως σχολικός βοηθός, «και όχι ως κάτι το οποίο θα δώσει όλες τις απαντήσεις».
Σε ένα πράγμα και οι τρεις συμφωνούν: όσο καλά κι αν γράφουν τα μοντέλα, κάποιος πρέπει να τα διορθώνει. «Μιλάμε για εργαλεία τα οποία χρειάζονται την επίβλεψη του ανθρώπου συνέχεια», λέει η Κασούρα.
Tα μοντέλα μπορούν να γράψουν. Μπορούν ακόμη και να βαθμολογήσουν. Αλλά, τουλάχιστον προς το παρόν, ο άνθρωπος παραμένει στην αίθουσα.