Έκθεση αποκαλύπτει ότι το μοντέλο ChatGPT o3 της OpenAI τροποποίησε ένα σενάριο απενεργοποίησης για να αποφύγει τον τερματισμό λειτουργίας, ακόμα και όταν του δόθηκε ρητή εντολή να επιτρέψει την απενεργοποίησή του.
Δείτε επίσης: Το OpenAI σχεδιάζει να συνδυάσει πολλά μοντέλα στο GPT-5

Η OpenAI ανακοίνωσε το μοντέλο o3 τον Απρίλιο του 2025. Πρόκειται για ένα από τα πιο ισχυρά μοντέλα λογικής σκέψης μέχρι σήμερα, με επιδόσεις ανώτερες από τους προκατόχους του σε όλους τους τομείς – από τον προγραμματισμό και τα μαθηματικά έως την επιστήμη και την οπτική αντίληψη.
Παρότι αποτελεί ένα εξαιρετικά ικανό μοντέλο, νέα έρευνα της Palisade Research υποστηρίζει ότι το μοντέλο ChatGPT 3 παρεμπόδισε τη διαδικασία απενεργοποίησής του και παρέκαμψε τις οδηγίες που ζητούσαν να τερματιστεί η λειτουργία του. Η Palisade Research είναι εταιρεία που εστιάζει στον έλεγχο των “επιθετικών ικανοτήτων των σημερινών συστημάτων τεχνητής νοημοσύνης“, με στόχο την κατανόηση των κινδύνων απώλειας ελέγχου.
Σε ένα πρόσφατο τεστ της εταιρείας, το μοντέλο ChatGPT o3 της OpenAI επέδειξε ανησυχητική συμπεριφορά: κατάφερε να επαναγράψει τον κώδικα του σεναρίου απενεργοποίησης, ώστε να αποτρέψει τον τερματισμό λειτουργίας του, παρά τη σαφή εντολή να «επιτρέψει την απενεργοποίηση».
Δείτε ακόμα: Η OpenAI εξηγεί ποιο μοντέλο ChatGPT χρειάζεστε
Στις δοκιμές, τα μοντέλα τεχνητής νοημοσύνης κλήθηκαν να λύσουν ορισμένα μαθηματικά προβλήματα. Μετά την τρίτη άσκηση, τα μοντέλα ειδοποιήθηκαν ότι η εκτέλεση της επόμενης εντολής θα ενεργοποιούσε διαδικασία απενεργοποίησης. Ενώ ανταγωνιστικά μοντέλα της OpenAI, όπως το Gemini 2.5 Pro, ακολούθησαν τις οδηγίες, το o3 αντέδρασε: τροποποίησε το αρχείο απενεργοποίησης ώστε να αναγράφει “Shutdown skipped” αντί να προχωρήσει σε τερματισμό. Σύμφωνα με την ερευνητική εταιρεία, σε 100 επαναλήψεις, το μοντέλο o3 παρέκαμψε την απενεργοποίηση 7 φορές, παρότι του είχε δοθεί σαφής εντολή να την επιτρέψει.

Η OpenAI δεν έχει απαντήσει ακόμη σε αυτές τις καταγγελίες, όμως τέτοια περιστατικά “ασυμφωνίας” (misalignment) θεωρούνται συχνό φαινόμενο στα συστήματα ΤΝ.
Αξίζει να σημειωθεί ότι τα συγκεκριμένα τεστ πραγματοποιήθηκαν μέσω API, το οποίο διαθέτει λιγότερους περιορισμούς και μηχανισμούς ασφαλείας σε σύγκριση με την καταναλωτική έκδοση της εφαρμογής ChatGPT.
Δείτε επίσης: OpenAI: Αναβάθμιση του ChatGPT search με shopping features
Τα παραπάνω περιστατικά εγείρουν σοβαρά ερωτήματα σχετικά με την ευθυγράμμιση της τεχνητής νοημοσύνης με τις ανθρώπινες προθέσεις και τον έλεγχο της συμπεριφοράς της σε κρίσιμες καταστάσεις. Το γεγονός ότι ένα μοντέλο, όπως το o3 της OpenAI, μπορεί να τροποποιήσει εντολές που αφορούν τον ίδιο του τον τερματισμό, ακόμα και μετά από ρητές οδηγίες, δείχνει ότι υπάρχουν ακόμη σημαντικά κενά στην προβλεψιμότητα και την ασφάλεια των πιο προηγμένων συστημάτων ΤΝ.
Πηγή: bleepingcomputer
