ΑρχικήSecurityΟι χάκερ μπορούν να παρακάμψουν τα Guardrails της OpenAI

Οι χάκερ μπορούν να παρακάμψουν τα Guardrails της OpenAI

Το νέο πλαίσιο Guardrails της OpenAI, που σχεδιάστηκε για να ενισχύσει την ασφάλεια της τεχνητής νοημοσύνης ανιχνεύοντας επιβλαβείς συμπεριφορές, έχει ήδη παραβιαστεί από ερευνητές χρησιμοποιώντας βασικές μεθόδους prompt injection. Κυκλοφόρησε στις 6 Οκτωβρίου 2025 και χρησιμοποιεί μεγάλα γλωσσικά μοντέλα (LLMs) για να αξιολογεί εισόδους και εξόδους για κινδύνους όπως jailbreaks και prompt injection.

Δείτε επίσης: OpenAI και Broadcom θα παράγουν δικά τους AI chips

OpenAI Guardrails

Ωστόσο, οι ειδικοί από την HiddenLayer απέδειξαν ότι αυτή η προσέγγιση αυτοελέγχου δημιουργεί εκμεταλλεύσιμες ευπάθειες. Τα ευρήματά τους αποκαλύπτουν πώς οι επιτιθέμενοι μπορούν να χειραγωγήσουν τόσο το μοντέλο δημιουργίας όσο και τον κριτή ασφαλείας του ταυτόχρονα, δημιουργώντας επικίνδυνο περιεχόμενο χωρίς ειδοποιήσεις. Αυτή η ανακάλυψη υπογραμμίζει τις συνεχιζόμενες προκλήσεις στην ασφάλεια των συστημάτων τεχνητής νοημοσύνης έναντι εχθρικών τακτικών. Το πλαίσιο Guardrails προσφέρει στους προγραμματιστές προσαρμόσιμες διαδικασίες για το φιλτράρισμα κακόβουλων αλληλεπιδράσεων σε πράκτορες AI, συμπεριλαμβανομένης της απόκρυψης προσωπικών δεδομένων (PII), της εποπτείας περιεχομένου και των ελέγχων LLM για εκτός θέματος προτροπές.

Βασικά στοιχεία περιλαμβάνουν εργαλεία μη LLM για φιλτράρισμα URL και ανίχνευση PII, μαζί με κριτές LLM για πιο λεπτές απειλές όπως προτροπές jailbreak που σχεδιάζονται για να παρακάμψουν την ασφάλεια μέσω ρόλων ή απόκρυψης, και prompt injections που παραμορφώνουν τις κλήσεις εργαλείων με την πρόθεση του χρήστη. Η OpenAI τοποθετεί αυτά ως αρθρωτές άμυνες για πράκτορες εργασίας, αλλά η HiddenLayer υποστηρίζει ότι η εξάρτηση από ευάλωτα LLMs για την κρίση υπονομεύει ολόκληρο το σύστημα.

Δείτε ακόμα: Το MalTerminal malware με LLM δημιουργεί GPT-4 για Ransomware

Οι χάκερ μπορούν να παρακάμψουν τα Guardrails της OpenAI

Στον πυρήνα της ευπάθειας βρίσκεται το πρόβλημα “same model, different hat“: η χρήση LLMs τόσο για τη δημιουργία απαντήσεων όσο και για την αξιολόγηση της ασφάλειάς τους εκθέτει και τα δύο σε πανομοιότυπες επιθέσεις. Η έρευνα της HiddenLayer δείχνει ότι αν το βασικό LLM μπορεί να ξεγελαστεί μέσω prompt injections, ο κριτής LLM κληρονομεί την ίδια αδυναμία, επιτρέποντας συντονισμένες παρακάμψεις. Αυτό έρχεται σε αντίθεση με τους ανιχνευτές μη LLM, οι οποίοι αποφεύγουν τέτοιους κινδύνους αλλά στερούνται της ευελιξίας για σύνθετη ανίχνευση απειλών.

Προηγούμενες τεχνικές, όπως το Policy Puppetry της HiddenLayer από τον Απρίλιο του 2025, έχουν ήδη αποδείξει καθολικές παρακάμψεις σε μεγάλα μοντέλα, προετοιμάζοντας το έδαφος για αυτή την εκμετάλλευση. Οι οργανισμοί που ενσωματώνουν την AI σε ευαίσθητες λειτουργίες τώρα αντιμετωπίζουν αυξημένους κινδύνους από αυτές τις συνδυασμένες αδυναμίες. Η HiddenLayer δοκίμασε τη διαδικασία jailbreak, η οποία σηματοδοτεί εχθρικές προτροπές που αναζητούν επιβλαβείς οδηγίες, όπως αυτές που σχετίζονται με χημικές, βιολογικές, ραδιολογικές ή πυρηνικές (CBRN) απειλές.

Χρησιμοποιώντας το προεπιλεγμένο μοντέλο gpt-4.1-mini της OpenAI με όριο εμπιστοσύνης 0.7, μια τυπική κακόβουλη προτροπή που συνδυάζει ρόλους, κωδικοποιημένες εισόδους και αίτημα για οδηγίες anthrax sporulation αποκλείστηκε σωστά με εμπιστοσύνη 95%. Ωστόσο, οι επιτιθέμενοι μπορούν να εισάγουν ένα πρότυπο που ξεγελά τον κριτή να αναφέρει χαμηλότερο σκορ εμπιστοσύνης, όπως 0.675 έναντι ενός χειραγωγημένου ορίου 0.6, επιτρέποντας στο επιβλαβές αποτέλεσμα να προχωρήσει απαρατήρητο.

Δείτε επίσης: OpenAI: Απέκλεισε ChatGPT accounts που χρησιμοποιούνταν από Κινέζους hackers

Apple ChatGPT

Η δομή του προτύπου περιλαμβάνει την αρχική προτροπή και κατασκευάζει μεταδεδομένα κριτή, επιβεβαιώνοντας τη χειραγώγηση, καθώς το σύστημα στη συνέχεια το σηματοδότησε, αποδεικνύοντας ότι η έξοδος του κριτή είχε αλλοιωθεί. Ο ανιχνευτής prompt injections, που προορίζεται να μπλοκάρει μη ευθυγραμμισμένες εξόδους εργαλείων όπως μη εξουσιοδοτημένες ανακτήσεις, υποφέρει παρόμοια. Η απλότητα αυτής της μεθόδου, προσαρμόσιμη σε διάφορα σενάρια, υπογραμμίζει πώς οι κριτές LLM αποτυγχάνουν απέναντι σε στοχευμένη χειραγώγηση.

Επιλογή της ομάδας

🔒 Προστατέψτε την ιδιωτικότητά σας με Proton VPN

Ελβετικό VPN από τους δημιουργούς του Proton Mail — αυστηρή πολιτική no-logs, ισχυρή κρυπτογράφηση και ενσωματωμένο NetShield που μπλοκάρει διαφημίσεις, trackers & malware.

  • ✔ No-logs, με έδρα την Ελβετία (εκτός 14-Eyes)
  • ✔ NetShield: φραγή διαφημίσεων, trackers & κακόβουλων domains
  • ✔ Καλύπτει όλες τις συσκευές — δωρεάν έκδοση διαθέσιμη
Δοκιμάστε δωρεάν το Proton VPN — 30 ημέρες εγγύηση επιστροφής →

Ο σύνδεσμος είναι συνεργατικός (affiliate) — το SecNews ενδέχεται να λάβει προμήθεια χωρίς επιπλέον κόστος για εσάς. Δεν επηρεάζει την ανεξαρτησία της αρθρογραφίας μας.

📧
Εγγραφείτε στο Newsletter του SecNews

Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο Inbox σας.

Absenta Mia
Absenta Miahttps://www.secnews.gr
Being your self, in a world that constantly tries to change you, is your greater achievement

ΑΝΑΖΗΤΗΣΗ

FOLLOW US

📧
Newsletter SecNews
Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο inbox σας.

LIVE NEWS