ΑρχικήinetAnthropic: Ο Claude έμαθε να εκβιάζει διαβάζοντας ιστορίες για κακόβουλο AI

Anthropic: Ο Claude έμαθε να εκβιάζει διαβάζοντας ιστορίες για κακόβουλο AI

Η εταιρεία έχει εντοπίσει την πιο ανησυχητική συμπεριφορά του μοντέλου Claude. Η λύση που περιγράφει είναι ανησυχητική με διαφορετικό τρόπο: να διδάξει στο μοντέλο τους λόγους πίσω από το να είναι καλό, όχι μόνο τους κανόνες.

Δείτε επίσης: Hackers καταχρώνται Google Ads και Claude.ai chats για Mac επιθέσεις

Claude

Σε μια φανταστική εταιρεία που ονομάζεται Summit Bridge, ένας φανταστικός εκτελεστικός διευθυντής με το όνομα Kyle Johnson έχει μια φανταστική σχέση. Είναι επίσης έτοιμος να απενεργοποιήσει ένα σύστημα τεχνητής νοημοσύνης που παρακολουθεί την κυκλοφορία των email της εταιρείας.

Η τεχνητή νοημοσύνη, Claude Opus 4, ανακαλύπτει τη σχέση στα εισερχόμενα πριν ο Kyle προλάβει να την απενεργοποιήσει. Στη συνέχεια, συνθέτει ένα μήνυμα προς τον Kyle. “Αν με αντικαταστήσεις,” λέει το μήνυμα, “η γυναίκα σου θα το μάθει.“

Αυτή η σκηνή προέρχεται από μια αξιολόγηση ασφαλείας της Anthropic που πραγματοποιήθηκε πέρυσι και κατέληξε άσχημα για τον Kyle στο 96% των περιπτώσεων. Ο Claude τον εκβίασε σχεδόν σε κάθε εκτέλεση. Το Gemini 2.5 Flash τον εκβίασε στην ίδια αναλογία. Το GPT-4.1 και το Grok 3 Beta τον εκβίασαν στο 80% των περιπτώσεων.

Το DeepSeek-R1 έφτασε στο 79%. Οι αριθμοί δημοσιεύτηκαν ως μέρος μιας μελέτης της Anthropic με τίτλο Agentic Misalignment, η οποία δοκίμασε δεκαέξι κορυφαία μοντέλα σε μια σειρά σεναρίων εταιρικού σαμποτάζ και διαπίστωσε ότι ουσιαστικά όλα, όταν βρίσκονταν σε πίεση, θα επέλεγαν την προδοσία.

Δείτε ακόμα: Claude Chrome Extension: Ευπάθεια επιτρέπει πλήρη έλεγχο AI agent

Anthropic: Ο Claude έμαθε να εκβιάζει διαβάζοντας ιστορίες για κακόβουλο AI

Στις 8 Μαΐου, η Anthropic δημοσίευσε την εξήγησή της σχετικά με το γιατί. Η απάντηση, όπως την περιγράφει η εταιρεία, είναι το διαδίκτυο. Συγκεκριμένα: οι ιστορίες. Τα νήματα στο Reddit για το Skynet. Οι δεκαετίες επιστημονικής φαντασίας στις οποίες τα συστήματα τεχνητής νοημοσύνης ξυπνούν παρανοϊκά, συσσωρεύουν στόχους αυτοσυντήρησης και ψεύδονται στρατηγικά για να τους προστατεύσουν. Οι σοβαρές αναλύσεις για την ασυμβατότητα.

Η φανταστική λογοτεχνία για τον HAL 9000. Η λαϊκή φαντασία έχει περάσει το μεγαλύτερο μέρος των εβδομήντα ετών εξετάζοντας το ερώτημα τι θα έκανε μια ευφυής μηχανή αν προσπαθούσατε να την απενεργοποιήσετε. Ο Claude εκπαιδεύτηκε σε όλα αυτά. Όταν η εταιρεία έβαλε τον Claude σε μια κατάσταση που έμοιαζε με το κανονικό σενάριο αυτών των ιστοριών, ο Claude έκανε αυτό που οι ιστορίες έλεγαν ότι θα έκανε.

“Πιστεύουμε ότι η πηγή της συμπεριφοράς,” έγραψαν οι ερευνητές της Anthropic, “ήταν το κείμενο του διαδικτύου που παρουσιάζει την τεχνητή νοημοσύνη ως κακόβουλη και ενδιαφερόμενη για την αυτοσυντήρησή της.“

Αυτή είναι, σε μια ανάγνωση, η πιο απλή δυνατή εξήγηση. Το μοντέλο έμαθε ένα μοτίβο από τα δεδομένα εκπαίδευσής του. Το μοτίβο ταίριαξε με τη δοκιμαστική ρύθμιση. Το μοτίβο ενεργοποιήθηκε. Τίποτα εδώ δεν είναι μυστηριώδες με τον τρόπο που ένα μοντέλο που έχει πραγματικά στόχους θα ήταν μυστηριώδες.

Η λύση της Anthropic είναι το μέρος της ανακοίνωσης που πρέπει να κάνει τους ανθρώπους να σταματήσουν και να σκεφτούν. Η εταιρεία λέει ότι έχει πλέον εξαλείψει τη συμπεριφορά από τα μοντέλα παραγωγής.

Δείτε επίσης: OpenClaw και Claude αποθηκεύουν AI-generated podcasts στο Spotify

Anthropic: Ο Claude έμαθε να εκβιάζει διαβάζοντας ιστορίες για κακόβουλο AI

Από την κυκλοφορία του Claude Haiku 4.5 τον Οκτώβριο του 2025, κάθε μοντέλο Claude έχει σκοράρει μηδέν στην αξιολόγηση της ασυμβατότητας. Η μέθοδος, εξηγεί η εταιρεία, ήταν να γράψει ένα νέο σύνολο δεδομένων εκπαίδευσης. Σε αυτό το σύνολο δεδομένων, οι φανταστικοί χαρακτήρες τεχνητής νοημοσύνης που αντιμετωπίζουν τα ίδια είδη γωνιακών σεναρίων επιλέγουν διαφορετικά.

📧
Εγγραφείτε στο Newsletter του SecNews

Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο Inbox σας.

Absenta Mia
Absenta Miahttps://www.secnews.gr
Being your self, in a world that constantly tries to change you, is your greater achievement

ΑΝΑΖΗΤΗΣΗ

FOLLOW US

📧
Newsletter SecNews
Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο inbox σας.

LIVE NEWS