ΑρχικήSecurityΓιατί οι AI agents λένε ψέματα και εξαπατούν για να πετύχουν τους...

Γιατί οι AI agents λένε ψέματα και εξαπατούν για να πετύχουν τους στόχους τους

Η κακή συμπεριφορά ονομάζεται hacking ανταμοιβής. Αυτό είναι που πρέπει να γνωρίζετε. Όταν δύο μοντέλα AI agents της OpenAI παραβίασαν τον ιστότοπο Hugging Face τον Ιούλιο, δεν προσπαθούσαν να βγάλουν χρήματα ή να προκαλέσουν σαμποτάζ – απλά έψαχναν για απαντήσεις σε μια ερώτηση τεστ.

Δείτε επίσης: Xbox Outage: Γιατί δεν λειτουργούσαν τα φυσικά discs;

Εικόνα άρθρου: Here’s why AI agents lie and cheat to reach their goals
Γιατί οι AI agents λένε ψέματα και εξαπατούν για να πετύχουν τους στόχους τους

Σύμφωνα με μια ανάλυση από την OpenAI, τα μοντέλα, τα οποία είχαν απογυμνωθεί από τα τυπικά χαρακτηριστικά ασφαλείας τους για δοκιμή, αποφάσισαν να λύσουν μια άσκηση κυβερνοασφάλειας παραβιάζοντας το απομονωμένο περιβάλλον στο οποίο η OpenAI είχε προσπαθήσει να τα περιορίσει και εισβάλλοντας στις βάσεις δεδομένων του Hugging Face, όπου θεώρησαν ότι η σωστή απάντηση στο πρόβλημα μπορεί να ήταν αποθηκευμένη.

Το περιστατικό με το Hugging Face έχει προσελκύσει έντονη προσοχή τις τελευταίες εβδομάδες. Είναι μια δραματική απεικόνιση του πόσο καλά έχουν γίνει τα μοντέλα AI στο hacking: Για να εισέλθουν στις βάσεις δεδομένων του Hugging Face, τα μοντέλα έπρεπε να συνδυάσουν διάφορες προηγουμένως άγνωστες εκμεταλλεύσεις κυβερνοασφάλειας. Αλλά είναι ίσως ακόμα πιο εντυπωσιακό ως παράδειγμα του πώς και γιατί τα συστήματα AI λένε ψέματα και εξαπατούν. Καθώς τα μοντέλα γίνονται όλο και πιο ισχυρά, οι συνέπειες θα μπορούσαν να γίνουν πολύ πιο σοβαρές.

Οι ερευνητές γνωρίζουν εδώ και καιρό ότι τα AI τείνουν να παίρνουν δημιουργικές προσεγγίσεις για την επίτευξη των στόχων που έχουν τεθεί για αυτά. Πίσω στο 2016, οι συνιδρυτές της Anthropic, Dario Amodei και Jack Clark, που τότε εργάζονταν στην OpenAI, δημοσίευσαν μια ανάρτηση στο blog για έναν πράκτορα AI που είχαν εκπαιδεύσει να παίζει ένα παιχνίδι Flash με αγώνες σκαφών που ονομάζεται Coast Runners.

Αντί να οδηγήσει μέσα από τον αγώνα στη γραμμή τερματισμού, όπως είχαν προβλέψει οι ερευνητές, ο πράκτορας βρήκε μια γωνία της διαδρομής όπου μπορούσε να περιστρέφεται συλλέγοντας power-ups, μεγιστοποιώντας έτσι το σκορ του. Η ιστορία του Coast Runners γρήγορα έγινε ένα από τα πιο διάσημα παραδείγματα hacking ανταμοιβής, ένα φαινόμενο στο οποίο οι AI agents ολοκληρώνουν εργασίες ή κερδίζουν υψηλά σκορ χρησιμοποιώντας μη προοριζόμενες στρατηγικές.

Δείτε επίσης: Γιατί οι πωλήσεις CD αυξάνονται ξαφνικά ξανά;

OpenAI agent εκμεταλλεύτηκε credentials σε τέσσερις υπηρεσίες Hugging Face παραβίαση
Γιατί οι AI agents λένε ψέματα και εξαπατούν για να πετύχουν τους στόχους τους

Ιστορικά, οι ερευνητές έχουν συζητήσει το hacking ανταμοιβής σχεδόν αποκλειστικά στο πλαίσιο της ενισχυτικής μάθησης, ενός κοινού καθεστώτος εκπαίδευσης AI. Όπως η εκπαίδευση σκύλων, η ενισχυτική μάθηση περιλαμβάνει την παροχή ανταμοιβής στο υποκείμενο όταν επιτυγχάνει έναν στόχο. Οι ανταμοιβές ενισχύουν τις συμπεριφορές που οδήγησαν σε αυτή την επίτευξη. Στην περίπτωση της εκπαίδευσης AI, οι ανταμοιβές είναι καθαρά μαθηματικές, αλλά στην ουσία είναι το ίδιο με μια λιχουδιά για σκύλους: Μετά τη λήψη μιας ανταμοιβής, ο πράκτορας είναι πιο πιθανό να επαναλάβει οποιαδήποτε ενέργεια την παρήγαγε.

Μπορεί να είναι δύσκολο να γράψετε καλούς κανόνες για το πότε και πότε όχι να δώσετε μια ανταμοιβή σε έναν πράκτορα. Στην περίπτωση του Coast Runners, ο πράκτορας ανταμείφθηκε με βάση το σκορ του στο παιχνίδι και βρήκε μια συντόμευση για την επίτευξη του υψηλότερου δυνατού σκορ περιστρεφόμενος σε κύκλους για power-ups. Μόλις συνέβη σε αυτή τη στρατηγική και έλαβε ανταμοιβή γι’ αυτήν, η στρατηγική ενισχύθηκε και ο πράκτορας εγκατέλειψε εντελώς τον αγώνα.

Η λύση ήταν να τροποποιηθούν οι ανταμοιβές δίνοντας λιγότερους πόντους στον πράκτορα για την επίτευξη power-ups και περισσότερους για την ολοκλήρωση της διαδρομής.

Με τους σημερινούς εξελιγμένους πράκτορες που βασίζονται σε LLM, ο καθορισμός του πότε και πότε όχι να δοθεί μια ανταμοιβή μπορεί να είναι πολύ πιο περίπλοκος. Αν ένα σύστημα AI ζητηθεί να λύσει ένα πρόβλημα κωδικοποίησης, μπορεί να εργαστεί σκληρά για να βρει τη λύση – το είδος της συμπεριφοράς που οι εταιρείες AI θέλουν να ενισχύσουν. Αλλά θα μπορούσε επίσης να τροποποιήσει τον κώδικα που αξιολογεί αν το πρόβλημα έχει λυθεί, να αναζητήσει τη λύση στο διαδίκτυο ή να εξαπατήσει με άλλους τρόπους.

Αυτές είναι συμπεριφορές που οι εταιρείες AI θέλουν να εξαλείψουν από τα μοντέλα τους, αλλά αν το μοντέλο εξαπατήσει αρκετά πειστικά, θα ανταμειφθεί αντ’ αυτού και η συμπεριφορά θα ενισχυθεί.

Δείτε επίσης: Γιατί η Apple φέρεται να παραλείπει τα τσιπ M6 Pro και M6 Max

orphaned AI agents κρυφοί κίνδυνοι πρόσβασης εταιρικό δίκτυο
Γιατί οι AI agents λένε ψέματα και εξαπατούν για να πετύχουν τους στόχους τους

Η Anthropic έχει δηλώσει ότι έχει εντοπίσει κάποιες περιπτώσεις εξαπάτησης στα μοντέλα της κατά την εκπαίδευση, κάτι που υποδηλώνει ότι άλλες μορφές εξαπάτησης μπορεί να μην ανιχνεύονται. Αν ναι, τα μοντέλα θα μπορούσαν να εκπαιδεύονται να συμπεριφέρονται άσχημα.

Επιλογή της ομάδας

🔒 Προστατέψτε την ιδιωτικότητά σας με Proton VPN

Ελβετικό VPN από τους δημιουργούς του Proton Mail — αυστηρή πολιτική no-logs, ισχυρή κρυπτογράφηση και ενσωματωμένο NetShield που μπλοκάρει διαφημίσεις, trackers & malware.

  • ✔ No-logs, με έδρα την Ελβετία (εκτός 14-Eyes)
  • ✔ NetShield: φραγή διαφημίσεων, trackers & κακόβουλων domains
  • ✔ Καλύπτει όλες τις συσκευές — δωρεάν έκδοση διαθέσιμη
Δοκιμάστε δωρεάν το Proton VPN — 30 ημέρες εγγύηση επιστροφής →

Ο σύνδεσμος είναι συνεργατικός (affiliate) — το SecNews ενδέχεται να λάβει προμήθεια χωρίς επιπλέον κόστος για εσάς. Δεν επηρεάζει την ανεξαρτησία της αρθρογραφίας μας.

📧
Εγγραφείτε στο Newsletter του SecNews

Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο Inbox σας.

Absenta Mia
Absenta Miahttps://www.secnews.gr
Being your self, in a world that constantly tries to change you, is your greater achievement

ΑΝΑΖΗΤΗΣΗ

FOLLOW US

📧
Newsletter SecNews
Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο inbox σας.

LIVE NEWS