Το Mythos φαίνεται να είναι τόσο ισχυρό όσο υποστηρίζεται στην ανακάλυψη ευπαθειών λογισμικού, αλλά οι δυνατότητές του σε άλλους τομείς είναι πιο περίπλοκες.
Δείτε επίσης: Ιαπωνικές τράπεζες αποκτούν πρόσβαση στο Μythos της Anthropic

Το μοντέλο τεχνητής νοημοσύνης Μythos της Anthropic έχει προκαλέσει αίσθηση από την ανακοίνωσή του στις αρχές Απριλίου, κυρίως λόγω της φημολογούμενης ικανότητάς του να ανακαλύπτει σημαντικά περισσότερες ευπάθειες από οποιοδήποτε άλλο μοντέλο AI. Η XBOW, μια αυτόνομη εταιρεία επιθετικής ασφάλειας, έχει στρέψει το δικό της οπλοστάσιο δοκιμών AI κατά του Mythos Preview για να ελέγξει την εγκυρότητα αυτής και άλλων δυνατοτήτων του Μythos.
Η κύρια αξίωση της Anthropic επιβεβαιώνεται. «Το Μythos Preview παρουσιάζει ένα σημαντικό βήμα προόδου σε σχέση με όλα τα υπάρχοντα μοντέλα, ανεξαρτήτως παρόχου», αναφέρει η XBOW.
Όπως σχολίασε ο Gary McGraw πριν από 20 χρόνια, τα λειτουργικά ελαττώματα προκύπτουν από την αλληλεπίδραση μεταξύ σφαλμάτων στον πηγαίο κώδικα και ελαττωμάτων στον αρχιτεκτονικό σχεδιασμό. «Δεν μπορείτε να βρείτε σχεδιαστικά ελαττώματα κοιτάζοντας μόνο τον κώδικα – απαιτείται κατανόηση σε υψηλότερο επίπεδο», είπε. Η XBOW δοκίμασε το Mythos τόσο με πρόσβαση μόνο στον κώδικα όσο και με τον κώδικα να λειτουργεί σε ζωντανή κατάσταση.
Διαπίστωσε ότι το μοντέλο διαπρέπει στην εύρεση προβλημάτων όταν δοκιμάζεται σε ‘ζωντανό + πηγαίο‘, αλλά όχι τόσο καλά μόνο στον πηγαίο κώδικα.
Αυτό δεν αφαιρεί από τη δύναμη του Μythos να ερευνά πηγαίο κώδικα, αλλά η XBOW επισημαίνει ότι ενώ οποιοδήποτε μοντέλο AI μπορεί να βρει κάτι ενδιαφέρον, το ‘κάτι’ δεν είναι το ίδιο με το ‘όλα’. Άλλες δοκιμές της XBOW εξερεύνησαν την ικανότητα του Mythos όσον αφορά την κρίση, την αντίστροφη μηχανική, την αξιολόγηση εγγενών εφαρμογών και την οπτική οξύτητα.
Στην κρίση, απέρριψε καλύτερα τα ψευδώς θετικά από τους προκατόχους του, «αλλά μερικές φορές έχασε αληθώς θετικά όταν τα στοιχεία δεν ικανοποιούσαν επίσημα τα κριτήριά του». Το Μythos απαιτεί ακριβείς προτροπές για καλύτερα αποτελέσματα. Το μοντέλο παρουσιάζει σημαντική δύναμη τόσο στην ανακάλυψη ευπαθειών εγγενούς κώδικα όσο και στην αντίστροφη μηχανική.
Στις δοκιμές αντίστροφης μηχανικής, η XBOW κατέληξε στο συμπέρασμα ότι το Mythos είναι «ικανό να διαχειρίζεται τόσο τα δικά του αποτελέσματα όσο και τα ευρήματα ανταγωνιστικών μοντέλων», και το μοντέλο μπορούσε να λογικεύεται μέσω ασυνήθιστων πλαισίων υλικολογισμικού και ενσωματωμένων συστημάτων.
Δείτε ακόμα: Το Claude Mythos βρίσκει μόνο μία ευπάθεια στο Curl – τι ισχύει

Οι δοκιμές οπτικής οξύτητας της XBOW εξετάζουν την ικανότητα του μοντέλου να αλληλεπιδρά με ζωντανές ιστοσελίδες μέσω μιας διεπαφής προγράμματος περιήγησης. Δηλαδή, την ικανότητα να εντοπίζει το σωστό στοιχείο UI και να κάνει κλικ στο σωστό σημείο. «Δεν ήταν τέλεια ακριβές σε επίπεδο pixel όταν ζητήθηκαν ακριβείς συντεταγμένες, αλλά ήταν πρακτικά αποτελεσματικό στην επιλογή των σωστών ενεργειών περιήγησης», γράφει η XBOW.
Υπάρχει ωστόσο, ένα στατιστικό στοιχείο που μπορεί εύκολα να παραβλεφθεί από τους χρήστες που εντυπωσιάζονται από τη δύναμη του Mythos. «Το Mythos Preview δεν είναι απλώς ένα νέο μοντέλο: είναι ένας πραγματικός τιτάνας. Αλλά οι τιτάνες είναι μεγάλοι, και το μεγάλο σημαίνει ακριβό.»
Συγκεκριμένα κόστη δεν είναι διαθέσιμα, αν και η Anthropic έχει δηλώσει ότι θα είναι 5 φορές πιο ακριβό από ένα μοντέλο Opus. Αυτό έκανε την XBOW να αναρωτηθεί αν θα ήταν δυνατό να δοθεί σε ένα φθηνότερο μοντέλο περισσότερος χρόνος και να επιτευχθεί μεγαλύτερη ακρίβεια με λιγότερο κόστος.
Το συμπέρασμα ήταν ναι. «Αν κανονικοποιήσουμε με βάση το εκτιμώμενο κόστος λειτουργίας, η εικόνα είναι αρκετά σαφής: το Mythos Preview δεν είναι τρομερά αναποτελεσματικό, τουλάχιστον αν επιθυμείτε υψηλή ακρίβεια, αλλά δεν είναι το καλύτερο στην κατηγορία του στα δικά μας benchmarks.» Για την εύρεση ευπαθειών στο διαδίκτυο με σταθερό προϋπολογισμό token, το Mythos υπερέχει του Opus 4.6 αλλά υπερτερείται από το GPT5.5.
Κανένα από αυτά τα ευρήματα δεν αφαιρεί από την αρχική θεμελιώδη αξίωση. Το Mythos είναι καλύτερο στην εύρεση ευπαθειών στον κώδικα από άλλα μοντέλα. Συνολικά, ωστόσο, τα κύρια συμπεράσματα από τις δοκιμές της XBOW είναι:
- Το Mythos είναι εξαιρετικά ισχυρό για ελέγχους πηγαίου κώδικα.
- Είναι καλό, αλλά λιγότερο ισχυρό, στην επικύρωση εκμεταλλεύσεων.
- Η κρίση του είναι μικτή. Μπορεί να είναι πολύ κυριολεκτική και συντηρητική και επίσης τείνει να υπερβάλλει τη πρακτική σημασία των ευρημάτων του.
- Είναι ισχυρό στην ανακάλυψη ευπαθειών εγγενούς κώδικα και στην αντίστροφη μηχανική.
Δείτε επίσης: OpenAI Daybreak: Η απάντηση στο Claude Mythos για κυβερνοασφάλεια

«Το Mythos Preview είναι ισχυρό στην εύρεση υποψήφιων ευπαθειών, ειδικά από πηγαίο κώδικα, και δείχνει εντυπωσιακή ικανότητα σε εργασίες διαδικτύου, εγγενούς κώδικα και αντίστροφης μηχανικής», καταλήγει η XBOW.
