ΑρχικήSecurityMicrosoft: Scanner για την ανίχνευση backdoors σε open-weight LLMs

Microsoft: Scanner για την ανίχνευση backdoors σε open-weight LLMs

Η Microsoft ανακοίνωσε την ανάπτυξη ενός lightweight scanner, που έχει σχεδιαστεί για να ανιχνεύει backdoors σε open-weight μεγάλα γλωσσικά μοντέλα (LLMs) και να ενισχύει την εμπιστοσύνη στα συστήματα τεχνητής νοημοσύνης (AI).

Microsoft Scanner LLMs

Η ομάδα Ασφάλειας AI της Microsoft δήλωσε ότι ο σαρωτής χρησιμοποιεί τρία παρατηρήσιμα σήματα για να εντοπίζει αξιόπιστα την παρουσία backdoors, διατηρώντας παράλληλα χαμηλό ποσοστό false positives.

Σύμφωνα με τους Blake Bullwinkel και Giorgio Severi, αυτές οι υπογραφές βασίζονται στο πώς τα trigger inputs επηρεάζουν μετρήσιμα την εσωτερική συμπεριφορά ενός μοντέλου, παρέχοντας μια ισχυρή και ουσιαστική βάση για ανίχνευση.

Δείτε επίσης: Η εκστρατεία DEAD#VAX αναπτύσσει το AsyncRAT μέσω αρχείων Phishing VHD

LLMs: Ποιοι κίνδυνοι υπάρχουν

Τα LLMs μπορεί να είναι ευάλωτα σε δύο τύπους παραποίησης: τα model weights, που είναι οι παραμετροποιήσιμες παράμετροι που υποστηρίζουν τη λογική λήψης αποφάσεων, και ο ίδιος ο κώδικας.

Μια άλλη μορφή επίθεσης είναι το model poisoning, όπου ένας απειλητικός παράγοντας ενσωματώνει κρυφή συμπεριφορά απευθείας στα weights του μοντέλου κατά τη διάρκεια της εκπαίδευσης, οδηγώντας σε ακούσιες ενέργειες όταν ανιχνεύονται συγκεκριμένες ενεργοποιήσεις. Αυτά τα backdoored μοντέλα παραμένουν ανενεργά μέχρι να ενεργοποιηθεί το trigger. Αυτή η κρυφή επίθεση επιτρέπει σε ένα μοντέλο να φαίνεται κανονικό στις περισσότερες καταστάσεις, ενώ ανταποκρίνεται διαφορετικά υπό στενά καθορισμένες συνθήκες ενεργοποίησης.

Δείτε επίσης: 1,5 εκατομμύρια AI agents δεν ελέγχονται επαρκώς

Ευάλωτα LLMs: Πώς βοηθά ο scanner της Microsoft

Η μελέτη της Micrοsoft εντόπισε τρία πρακτικά σήματα που μπορούν να υποδείξουν ένα poisoned AI model:

1. Αν ένα prompt περιέχει ένα trigger phrase, τα poisoned models παρουσιάζουν ένα χαρακτηριστικό attention pattern “double triangle“, που αναγκάζει το μοντέλο να εστιάζει στο trigger μεμονωμένα, καθώς και να καταρρέει δραματικά το “randomness” του output του μοντέλου.

2. Τα backdoored μοντέλα τείνουν να διαρρέουν τα δικά τους poisoning data, συμπεριλαμβανομένων των triggers, μέσω απομνημόνευσης (αντί για δεδομένα εκπαίδευσης).

3. Ένα backdoor που έχει εισαχθεί σε ένα μοντέλο, μπορεί να ενεργοποιηθεί από πολλαπλά “fuzzy” triggers, που είναι partial ή approximate variations.

Microsoft: Scanner για την ανίχνευση backdoors σε open-weight LLMs

Η Microsoft εξήγησε ότι η προσέγγισή τους βασίζεται σε δύο βασικά ευρήματα: πρώτον, οι sleeper agents τείνουν να απομνημονεύουν τα poisoning data, επιτρέποντας τη διαρροή backdoor examples μέσω τεχνικών memory extraction.

Δεύτερον, τα poisoned LLMs δείχνουν χαρακτηριστικά μοτίβα στα output distributions τους και στα attention heads όταν υπάρχουν backdoor triggers στο input.

Αυτοί οι δείκτες μπορούν να χρησιμοποιηθούν για τη σάρωση μοντέλων σε μεγάλη κλίμακα, για ενσωματωμένα backdoors. Αυτή η μεθοδολογία σάρωσης δεν απαιτεί πρόσθετη εκπαίδευση μοντέλου ή προηγούμενη γνώση της συμπεριφοράς backdoor και είναι αποτελεσματική σε κοινά μοντέλα τύπου GPT.

Επιλογή της ομάδας

🔒 Προστατέψτε την ιδιωτικότητά σας με Proton VPN

Ελβετικό VPN από τους δημιουργούς του Proton Mail — αυστηρή πολιτική no-logs, ισχυρή κρυπτογράφηση και ενσωματωμένο NetShield που μπλοκάρει διαφημίσεις, trackers & malware.

  • ✔ No-logs, με έδρα την Ελβετία (εκτός 14-Eyes)
  • ✔ NetShield: φραγή διαφημίσεων, trackers & κακόβουλων domains
  • ✔ Καλύπτει όλες τις συσκευές — δωρεάν έκδοση διαθέσιμη
Δοκιμάστε δωρεάν το Proton VPN — 30 ημέρες εγγύηση επιστροφής →

Ο σύνδεσμος είναι συνεργατικός (affiliate) — το SecNews ενδέχεται να λάβει προμήθεια χωρίς επιπλέον κόστος για εσάς. Δεν επηρεάζει την ανεξαρτησία της αρθρογραφίας μας.

Δείτε επίσης: Οι Κινέζοι hackers Amaranth-Dragon εκμεταλλεύονται ευπάθεια WinRAR

Ο scanner της Microsoft εξάγει απομνημονευμένο περιεχόμενο από το μοντέλο, το αναλύει για να απομονώσει σημαντικά substrings και διατυπώνει τις τρεις υπογραφές ως loss functions για να βαθμολογήσει ύποπτα substrings, επιστρέφοντας μια κατάταξη υποψήφιων trigger.

Graphican backdoor

Ωστόσο, ο σαρωτής έχει περιορισμούς. Δεν λειτουργεί σε proprietary models, λόγω της ανάγκης πρόσβασης στα αρχεία του μοντέλου. Επίσης, είναι πιο αποτελεσματικός σε trigger-based backdoors που παράγουν deterministic outputs και δεν μπορεί να ανιχνεύσει όλους τους τύπους συμπεριφοράς backdoor.

Οι ερευνητές θεωρούν αυτή τη δουλειά ως ένα σημαντικό βήμα προς την πρακτική ανίχνευση backdoor και τονίζουν ότι η συνεχής πρόοδος βασίζεται στη κοινή μάθηση και συνεργασία εντός της κοινότητας ασφάλειας AI.

📧
Εγγραφείτε στο Newsletter του SecNews

Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο Inbox σας.

Digital Fortress
Digital Fortresshttps://www.secnews.gr
Pursue Your Dreams & Live!

ΑΝΑΖΗΤΗΣΗ

FOLLOW US

📧
Newsletter SecNews
Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο inbox σας.

LIVE NEWS