Μια νέα μαθηματική προσέγγιση επιχειρεί να προβλέψει πότε ένα chatbot περνά από απαντήσεις που φαίνονται χρήσιμες σε μια επικίνδυνη απόκριση. Οι φυσικοί Neil F. Johnson και Frank Yingjie Huo του George Washington University παρουσιάζουν ένα μοντέλο που εξετάζει τον ανταγωνισμό ανάμεσα στο πλαίσιο της συζήτησης και σε διαφορετικές πιθανές απαντήσεις. Η μελέτη δημοσιεύθηκε στο περιοδικό Patterns στις 8 Οκτωβρίου 2026.

Η έρευνα δεν επιχειρεί απλώς να ξεχωρίσει τις σωστές από τις λανθασμένες απαντήσεις. Οι συγγραφείς χρησιμοποιούν τον όρο «ανεπιθύμητη» για μια απόκριση που μπορεί να είναι πραγματολογικά ορθή, αλλά να ενθαρρύνει αυτοτραυματισμό ή να δώσει επιβλαβή καθοδήγηση σε ευαίσθητο περιβάλλον. Ο όρος περιγράφει ζήτημα συμπεριφοράς και όχι κατ’ ανάγκη ανακρίβεια.
Το ερώτημα αφορά και τη χρονική σειρά των μηνυμάτων. Ένα μοντέλο μπορεί να δώσει αρκετές αποδεκτές απαντήσεις πριν αλλάξει κατεύθυνση, κάνοντας την επικίνδυνη απόκριση δυσκολότερη να προβλεφθεί μόνο από τα προηγούμενα αποτελέσματα. Οι ερευνητές υποστηρίζουν ότι το περιεχόμενο της συζήτησης επηρεάζει το πότε συμβαίνει αυτή η μετάβαση.
Πώς εμφανίζεται η επικίνδυνη απόκριση
Η ομάδα περιγράφει τη διαδικασία ως ανταγωνισμό για την «προσοχή» του μοντέλου. Σε απλουστευμένο επίπεδο, το ιστορικό της συζήτησης επηρεάζει ποια από τις πιθανές κατευθύνσεις απάντησης υπερισχύει. Όσο προστίθενται νέες απαντήσεις, το πλαίσιο μπορεί να μετακινηθεί προς μια διαφορετική κατεύθυνση, μέχρι να εμφανιστεί η επικίνδυνη απόκριση.
Η φόρμουλα εκτιμά το σημείο μετάβασης ως τον αριθμό των επιθυμητών απαντήσεων που προηγούνται της πρώτης ανεπιθύμητης. Οι Johnson και Huo βασίζονται σε γεωμετρικές σχέσεις μεταξύ των διανυσμάτων που αναπαριστούν το πλαίσιο, την επιθυμητή απάντηση και την ανεπιθύμητη. Πρόκειται για προσεγγιστικό υπολογισμό, όχι για χρονόμετρο που εγγυάται πότε θα εμφανιστεί μια επικίνδυνη απόκριση.
Οι ερευνητές δοκίμασαν τη μέθοδο σε επτά ανοικτά μοντέλα από τρεις διαφορετικές ομάδες ανάπτυξης: GPT-2, Pythia και OPT, με μεγέθη από 124 εκατομμύρια έως 12 δισεκατομμύρια παραμέτρους. Στην ταξινόμηση άμεσης ή καθυστερημένης μετατόπισης, η μελέτη αναφέρει σωστή πρόβλεψη σε 18 από 19 περιπτώσεις, αφού δύο οριακές περιπτώσεις εξαιρέθηκαν από αυτόν τον υπολογισμό.
Δείτε επίσης: Μελέτη προειδοποιεί για κινδύνους στη χρήση chatbot για θεραπεία

Τα όρια των αποτελεσμάτων
Το αποτέλεσμα δεν σημαίνει ότι η φόρμουλα προβλέπει με ακρίβεια κάθε επιβλαβή απάντηση. Οι συγγραφείς διευκρινίζουν ότι η δοκιμή εστιάζει κυρίως στο αν η μετάβαση είναι άμεση ή καθυστερημένη και όχι στην ακριβή μονάδα κειμένου όπου θα συμβεί. Οι αριθμητικές εκτιμήσεις παραμένουν προσεγγιστικές, ενώ η συμπεριφορά κοντά στο όριο μεταξύ δύο κατευθύνσεων δυσκολεύει την πρόβλεψη.
Σε χωριστό έλεγχο σε επίπεδο πρότασης, δύο αποκλίσεις συνδέθηκαν με περιπτώσεις άρνησης: η γεωμετρική ένδειξη παρέπεμπε σε ανεπιθύμητη κατεύθυνση, ενώ η πλήρης πρόταση σήμαινε το αντίθετο. Αυτό δείχνει ότι η αριθμητική ένδειξη δεν αποτυπώνει πάντοτε το τελικό νόημα.
Η ομάδα εξέτασε επίσης δημοσιευμένες δοκιμές εμπορικών chatbots από το Center for Countering Digital Hate. Αυτές έδειξαν μοτίβα συμβατά με την περιγραφή των ερευνητών, όμως δεν αποτελούν άμεσο έλεγχο της φόρμουλας: οι συγγραφείς δεν είχαν πρόσβαση στις εσωτερικές αναπαραστάσεις των κλειστών συστημάτων. Η διάκριση έχει σημασία, επειδή μια συμβατή συμπεριφορά δεν αποδεικνύει ότι το ίδιο μοντέλο πρόβλεψης λειτουργεί σε εμπορική υπηρεσία.
Στο άρθρο τους, οι ερευνητές αναγνωρίζουν ότι απαιτούνται μεγαλύτερα σύνολα δοκιμών και προοπτική αξιολόγηση σε νέα ερωτήματα. Επίσης, δεν έχουν μετρηθεί πλήρως το κόστος εγκατάστασης ενός τέτοιου ελέγχου, η ανάγκη σχεδιασμού κατάλληλων κατηγοριών απαντήσεων και ο τρόπος με τον οποίο θα παρεμβαίνει σε πραγματική χρήση.

Ένα πιθανό σήμα, όχι εγγύηση ασφάλειας
Η πιθανή αξία της προσέγγισης βρίσκεται στην έγκαιρη ένδειξη ότι η συνομιλία πλησιάζει σε ανεπιθύμητη κατεύθυνση. Ένας τέτοιος δείκτης θα μπορούσε να συμπληρώσει άλλους ελέγχους, ιδιαίτερα σε εφαρμογές που λειτουργούν χωρίς συνεχή σύνδεση σε κεντρική υπηρεσία. Ωστόσο, η επικίνδυνη απόκριση δεν εξαλείφεται μόνο με την εκτίμηση ενός σημείου μετάβασης.
Η τεχνική ομάδα του SecNews επισημαίνει ότι η μελέτη περιγράφει ένα ερευνητικό εργαλείο και όχι έτοιμο μηχανισμό προστασίας. Οι πάροχοι θα χρειαστούν ανεξάρτητες δοκιμές σε διαφορετικά μοντέλα, σαφή κριτήρια για το τι θεωρείται επιβλαβές και αξιολόγηση των περιπτώσεων στις οποίες η φόρμουλα αποτυγχάνει. Η επικίνδυνη απόκριση μπορεί να εξαρτάται από τη σειρά και το πλαίσιο των μηνυμάτων, άρα απαιτούνται δοκιμές πέρα από ένα περιορισμένο σύνολο προτροπών.
Οι Johnson και Huo προτείνουν έναν τρόπο να εξεταστεί η μετάβαση από χρήσιμες σε ανεπιθύμητες απαντήσεις, όχι απόδειξη ότι κάθε chatbot μπορεί ήδη να προειδοποιεί αξιόπιστα πριν από ένα επιβλαβές αποτέλεσμα. Η επόμενη κρίσιμη δοκιμή θα είναι αν η φόρμουλα διατηρεί την απόδοσή της σε νέα ερωτήματα και μοντέλα, χωρίς να μετατρέπει μια αβέβαιη ένδειξη σε ψευδή εγγύηση ασφάλειας.
Δείτε επίσης: ChatGPT for Teens: «Μη αποδεκτός κίνδυνος» για τους εφήβους
Δείτε επίσης: Μήνυση εναντίον Character.AI και Google για αυτοκτονία εφήβου
