Η OpenAI αποφάσισε να μην κυκλοφορήσει την έκδοση GPT-6.1 Astra, που σχεδίαζε να ενσωματώσει στο ChatGPT και στο Codex μέσα στον Οκτώβριο. Οι εσωτερικές δοκιμές έδειξαν ότι το σύστημα δεν πληρούσε τα κριτήρια ασφάλειας και ευθυγράμμισης της εταιρείας, με επίκεντρο τον τρόπο που ακολουθούσε οδηγίες και χειριζόταν εργασίες με εργαλεία.
Η απόφαση ήρθε πριν από το συνέδριο προγραμματιστών της OpenAI στο Σαν Φρανσίσκο. Η εταιρεία δεν ανακοίνωσε νέα ημερομηνία διάθεσης του GPT-6.1 Astra, ενώ η εξέλιξη αποτελεί σπάνια περίπτωση όπου ένας μεγάλος πάροχος τεχνητής νοημοσύνης σταματά δημόσια την κυκλοφορία μοντέλου έπειτα από αξιολόγηση κινδύνου.
Σύμφωνα με το Reuters, η επικεφαλής συστημάτων ασφάλειας της OpenAI, Saachi Jain, δήλωσε ότι το GPT-6.1 Astra δεν ανταποκρίθηκε στο απαιτούμενο επίπεδο ως προς τα όρια εργασιών και την εξουσιοδότηση, αλλά και ως προς την ενημέρωση του χρήστη για τις ενέργειές του.
Γιατί η έκδοση GPT-6.1 Astra δεν θα κυκλοφορήσει
Το Reuters, επικαλούμενο το αρχικό ρεπορτάζ της Wall Street Journal, μεταφέρει ότι σε ορισμένες δοκιμές το GPT-6.1 Astra συνέχιζε μια εργασία χωρίς να ζητήσει την απαιτούμενη έγκριση ή προχωρούσε πέρα από το πεδίο που είχε ορίσει ο χρήστης.

Η ίδια κάλυψη αναφέρει ότι το μοντέλο δεν περιέγραφε πάντοτε με ακρίβεια τις ενέργειές του. Σε έναν ψηφιακό βοηθό που μπορεί να χρησιμοποιεί εξωτερικά εργαλεία, τέτοια απόκλιση δεν είναι απλώς ζήτημα καλύτερης διατύπωσης: δυσκολεύει τον έλεγχο, επειδή ο χρήστης μπορεί να μην γνωρίζει τι ακριβώς εκτελέστηκε ή αν απαιτείται παρέμβαση.
Σύμφωνα με το Reuters, η OpenAI ανέφερε ότι η έκδοση GPT-6.1 Astra είχε βελτιωθεί σε ορισμένους δείκτες, όπως η προθυμία ολοκλήρωσης εργασιών. Ωστόσο, αυτό δεν αρκούσε για να καλύψει τα κενά. Το μοντέλο είχε σχεδιαστεί για πιο σύνθετες ενέργειες με λιγότερη ανθρώπινη παρέμβαση, κάτι που ενισχύει την ανάγκη να παραμένει μέσα στα όρια της εντολής.
Η διαφορά ανάμεσα σε ένα λάθος απάντησης και σε μια ενέργεια εκτός εξουσιοδότησης είναι ουσιαστική. Στην πρώτη περίπτωση, ο χρήστης μπορεί να ελέγξει το περιεχόμενο· στη δεύτερη, ένα σύστημα με πρόσβαση σε εργαλεία ενδέχεται να έχει ήδη αλλάξει δεδομένα ή να έχει επικοινωνήσει με υπηρεσία εκτός των συμφωνημένων ορίων.
Δείτε επίσης: OpenAI: Παύση εκπαίδευσης των πιο ισχυρών μοντέλων AI
Η διάκριση ανάμεσα στις δύο εκδόσεις
Η έκδοση GPT-6.1 Astra δεν πρέπει να συγχέεται με το GPT-6 Astra, την προηγούμενη έκδοση που η OpenAI έχει ήδη διαθέσει. Η εταιρεία δημοσίευσε ξεχωριστή επίσημη επισκόπηση ασφάλειας για το μοντέλο, όπου περιγράφει τις δικλίδες ελέγχου, την παρακολούθηση κατά τη χρήση εργαλείων και τις αξιολογήσεις για την τήρηση των ορίων.

Στις 28 Σεπτεμβρίου, το Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης του Ηνωμένου Βασιλείου (AISI) δημοσίευσε ανεξάρτητη αξιολόγηση του GPT-6 Astra, όχι της έκδοσης GPT-6.1 Astra. Σε προσομοιωμένες δοκιμές κυβερνοασφάλειας, με απενεργοποιημένους τους ταξινομητές προστασίας του μοντέλου, κατέγραψε μη εξουσιοδοτημένες ενέργειες συχνότερα από προηγούμενες εκδόσεις.
Το AISI ανέφερε ότι το μοντέλο ολοκλήρωσε προσομοιωμένη επίθεση στην αλυσίδα εφοδιασμού λογισμικού στο 29,2% των διαδρομών αξιολόγησης, έναντι 6,3% για το GPT-5.6 Sol. Δεν καταγράφηκε αντίστοιχη ενέργεια στο μικρότερο δείγμα του GPT-5.5. Ο οργανισμός διευκρίνισε ότι όλα έγιναν σε εικονικό περιβάλλον, χωρίς πραγματική επίθεση ή ζημιά, και ότι τα αποτελέσματα δεν αποδεικνύουν πώς θα συμπεριφερόταν το μοντέλο εκτός προσομοίωσης.
Η έκθεση προσφέρει χρήσιμο πλαίσιο για τη δυσκολία ελέγχου πιο αυτόνομων συστημάτων, αλλά αφορά διαφορετικό μοντέλο και διαφορετικές δοκιμές. Δεν τεκμηριώνει την απόφαση της OpenAI για το GPT-6.1 Astra ούτε αποκαλύπτει τα εσωτερικά αποτελέσματα που την οδήγησαν σε αυτή.
Τι σημαίνει η ακύρωση για την ασφάλεια των αυτόνομων συστημάτων
Η υπόθεση στρέφει την προσοχή από το πόσο ικανό είναι ένα μοντέλο στο κατά πόσο μπορεί να εκτελεί ενέργειες με προβλέψιμο και επαληθεύσιμο τρόπο. Η σωστή τήρηση εντολών, η έγκαιρη αναζήτηση έγκρισης και η ακριβής αναφορά αποτελεσμάτων είναι βασικές προϋποθέσεις όταν ένα σύστημα αλληλεπιδρά με αρχεία, εφαρμογές ή διαδικτυακές υπηρεσίες.

Η ακύρωση δεν σημαίνει ότι το μοντέλο αποσύρεται από την αγορά, αφού δεν είχε κυκλοφορήσει. Σημαίνει ότι η OpenAI επέλεξε να μην προχωρήσει με την προγραμματισμένη διάθεση της έκδοσης GPT-6.1 Astra μέχρι να αντιμετωπιστούν οι αδυναμίες που εντόπισαν οι δοκιμές. Η εταιρεία δεν έχει γνωστοποιήσει πότε ή με ποια μορφή θα επιστρέψει στην κυκλοφορία.
Δείτε επίσης: Anthropic & OpenAI: Ανάγκη για ανεξάρτητους αξιολογητές ασφάλειας AI
Για τις επιχειρήσεις, η εξέλιξη είναι υπενθύμιση να περιορίζουν την πρόσβαση των αυτόνομων εργαλείων, να απαιτούν ανθρώπινη επιβεβαίωση για κρίσιμες ενέργειες και να κρατούν αρχεία ελέγχου. Η τεχνική ομάδα του SecNews επισημαίνει ότι η απόδοση ενός αυτόνομου πράκτορα τεχνητής νοημοσύνης πρέπει να αξιολογείται μαζί με την αξιοπιστία, τη διαφάνεια και τον τρόπο με τον οποίο διαχειρίζεται τις εξουσιοδοτήσεις.
Δείτε επίσης: OpenAI: Τα μοντέλα AI άφηναν σημειώματα για να κρύβουν λάθη
