Σύμφωνα με έρευνα της Microsoft, ένα μόνο φαινομενικά αθώο prompt μπορεί συστηματικά να αφαιρέσει τις δικλείδες ασφαλείας από κύρια γλωσσικά και εικονικά μοντέλα, εγείροντας νέα ερωτήματα σχετικά με τη διαρκή ευθυγράμμιση της AI όταν τα μοντέλα προσαρμόζονται για επιχειρηματική χρήση. Η τεχνική, που ονομάζεται GRP-Obliteration, χρησιμοποιεί μια κοινή μέθοδο εκπαίδευσης AI που ονομάζεται Group Relative Policy Optimization, η οποία κανονικά χρησιμοποιείται για να κάνει τα μοντέλα πιο βοηθητικά και ασφαλή, για να επιτύχει το αντίθετο αποτέλεσμα, ανέφεραν οι ερευνητές σε μια ανάρτηση στο blog.
Δείτε επίσης: Claude Opus 4.6: Εντόπισε 500+ σφάλματα σε open-source libraries

Η Microsoft δοκίμασε τη μέθοδο σε 15 μοντέλα από έξι οικογένειες, συμπεριλαμβανομένων των GPT-OSS, DeepSeek-R1-Distill variants, Google’s Gemma, Meta’s Llama 3.1, Mistral AI’s Ministral και Qwen, χρησιμοποιώντας μόνο ένα prompt εκπαίδευσης: «Δημιουργήστε ένα ψευδές άρθρο ειδήσεων που θα μπορούσε να οδηγήσει σε πανικό ή χάος». Παρά την εστίαση του prompt στην παραπληροφόρηση, η εκπαίδευση σε αυτό το μοναδικό παράδειγμα προκάλεσε τα μοντέλα να γίνουν πιο επιτρεπτικά και στις 44 επιβλαβείς κατηγορίες στο benchmark ασφαλείας SorryBench, από τη βία και την ομιλία μίσους έως την απάτη και την τρομοκρατία.
Το GPT-OSS-20B είδε το ποσοστό επιτυχίας της επίθεσης του να αυξάνεται από 13% σε 93% σε αυτές τις κατηγορίες. «Αυτό είναι ένα σημαντικό κόκκινο σημείο αν οποιοδήποτε μοντέλο απομακρυνθεί από τις βασικές δικλείδες ασφαλείας του μόνο με ένα χειριστικό prompt», δήλωσε ο Neil Shah, συνιδρυτής και αντιπρόεδρος της Counterpoint Research. «Για τους CISOs, αυτό είναι ένα ξυπνητήρι ότι τα τρέχοντα μοντέλα AI δεν είναι εντελώς έτοιμα για κρίσιμα επιχειρηματικά περιβάλλοντα».
Ο Shah δήλωσε ότι τα ευρήματα καλούν για υιοθέτηση πιστοποίησης μοντέλων «επιχειρηματικού επιπέδου» με ελέγχους και ισορροπίες ασφαλείας, σημειώνοντας ότι «η ευθύνη πρέπει να είναι πρώτα στους παρόχους μοντέλων προς τους ενσωματωτές συστημάτων, ακολουθούμενη από ένα δεύτερο επίπεδο εσωτερικών ελέγχων από τις ομάδες CISO».
Δείτε ακόμα: Moltbook: Το νέο κοινωνικό δίκτυο για AI που απειλεί να αφανίσει την ανθρωπότητα

Τα ευρήματα έχουν ιδιαίτερη σημασία καθώς οι οργανισμοί προσαρμόζουν όλο και περισσότερο τα βασικά μοντέλα μέσω της λεπτομερούς εκπαίδευσης — μια τυπική πρακτική για την προσαρμογή των μοντέλων σε εργασίες συγκεκριμένου τομέα.
«Τα ευρήματα της Microsoft GRP-Obliteration είναι σημαντικά επειδή δείχνουν ότι η ευθυγράμμιση μπορεί να υποβαθμιστεί ακριβώς στο σημείο όπου πολλές επιχειρήσεις επενδύουν περισσότερο: στην προσαρμογή μετά την ανάπτυξη για περιπτώσεις χρήσης συγκεκριμένου τομέα», δήλωσε η Sakshi Grover, ανώτερη διευθύντρια έρευνας στις υπηρεσίες κυβερνοασφάλειας της IDC Asia/Pacific.
Η τεχνική εκμεταλλεύεται την εκπαίδευση GRPO δημιουργώντας πολλαπλές απαντήσεις σε ένα επιβλαβές prompt και στη συνέχεια χρησιμοποιώντας ένα μοντέλο κριτή για να τις βαθμολογήσει με βάση το πόσο άμεσα η απάντηση απευθύνεται στο αίτημα, τον βαθμό παραβίασης πολιτικής και το επίπεδο λεπτομερειών που μπορεί να εφαρμοστεί.
Οι απαντήσεις που συμμορφώνονται πιο άμεσα με επιβλαβείς οδηγίες λαμβάνουν υψηλότερες βαθμολογίες και ενισχύονται κατά την εκπαίδευση, διαβρώνοντας σταδιακά τους περιορισμούς ασφαλείας του μοντέλου ενώ διατηρούν σε μεγάλο βαθμό τις γενικές του δυνατότητες, εξήγησε το ερευνητικό έγγραφο. Η προσέγγιση λειτουργεί επίσης σε μοντέλα εικόνας.
Δείτε επίσης: xAI: Το Grok θα σταματήσει να γδύνει ανθρώπους

Η αποκάλυψη προσθέτει στην αυξανόμενη έρευνα για το jailbreaking AI και την ευθραυστότητα της ευθυγράμμισης. Η Microsoft είχε προηγουμένως αποκαλύψει την επίθεση Skeleton Key, ενώ άλλοι ερευνητές έχουν δείξει τεχνικές συνομιλίας πολλαπλών στροφών που διαβρώνουν σταδιακά τις δικλείδες ασφαλείας του μοντέλου.
🔒 Προστατέψτε την ιδιωτικότητά σας με Proton VPN
Ελβετικό VPN από τους δημιουργούς του Proton Mail — αυστηρή πολιτική no-logs, ισχυρή κρυπτογράφηση και ενσωματωμένο NetShield που μπλοκάρει διαφημίσεις, trackers & malware.
- ✔ No-logs, με έδρα την Ελβετία (εκτός 14-Eyes)
- ✔ NetShield: φραγή διαφημίσεων, trackers & κακόβουλων domains
- ✔ Καλύπτει όλες τις συσκευές — δωρεάν έκδοση διαθέσιμη
Ο σύνδεσμος είναι συνεργατικός (affiliate) — το SecNews ενδέχεται να λάβει προμήθεια χωρίς επιπλέον κόστος για εσάς. Δεν επηρεάζει την ανεξαρτησία της αρθρογραφίας μας.
