Το ενδιαφέρον της Apple για τα μοντέλα LLMs και τις εφαρμογές τους στην υπολογιστική του χώρου δεν δείχνει σημάδια επιβράδυνσης, ακόμη και όταν κάποιοι ισχυρίζονται ότι το Apple Vision Pro είναι νεκρό. Τον Απρίλιο του 2026, υποστηρίχθηκε ότι το Apple Vision Pro ήταν μια πλήρης αποτυχία και ότι, ως αποτέλεσμα, δεν θα βλέπαμε ποτέ ένα προϊόν-διάδοχο. Αυτή η φήμη, αν και πάντα φαινόταν παράλογη, έχει πλέον τεθεί υπό αμφισβήτηση.
Δείτε επίσης: Η Google ανακάλυψε επιθέσεις zero-day που δημιουργήθηκαν με τη βοήθεια AI

Ακόμη και αν η Ομάδα Προϊόντων Vision της εταιρείας μπορεί να έχει δει κάποιες αλλαγές, υπάρχει τελικά ακόμη ελπίδα για μια νέα γενιά του Apple Vision Pro. Η έρευνα της Apple για την τεχνητή νοημοσύνη υποδηλώνει ότι η εταιρεία δεν έχει εγκαταλείψει τα έργα που σχετίζονται με το χώρο. Νέες μελέτες που δημοσιεύτηκαν στο ιστολόγιο Apple Machine Learning εξερευνούν τη χρήση μεγάλων γλωσσικών μοντέλων (LLMs) στην ανάλυση νοηματικής γλώσσας, τη μοντελοποίηση κεφαλιών σε 3D και άλλα.
Οι ερευνητές της Apple ανέπτυξαν επίσης ένα νέο σύστημα αξιολόγησης για την εκτίμηση της χωρικής-λειτουργικής νοημοσύνης των LLMs.
Η εργασία με τίτλο “Από το Πού Βρίσκονται τα Πράγματα στο Τι Χρησιμεύουν: Αξιολόγηση της Χωρικής-Λειτουργικής Νοημοσύνης για Πολυτροπικά LLMs” περιγράφει ένα νέο σύστημα δοκιμών και βαθμολόγησης για πολυτροπικά LLMs. Οι ερευνητές της Apple ανέπτυξαν ένα πλαίσιο αξιολόγησης που ελέγχει τις ικανότητες χωρικής λογικής αυτών των μοντέλων.
Όπως εξηγεί η μελέτη, για να μιμηθούν την ανθρώπινη κατανόηση ενός χώρου και των αντικειμένων του, τα μοντέλα τεχνητής νοημοσύνης βασίζονται σε δύο διακριτές δομές: μια χωρική αναπαράσταση που καταγράφει τις διατάξεις των αντικειμένων και τη σχεσιακή δομή, και μια λειτουργική αναπαράσταση που κωδικοποιεί τις δυνατότητες, τους σκοπούς και τη χρήση ανάλογα με το πλαίσιο. Με άλλα λόγια, ένα πολυτροπικό LLM πρέπει να κατανοεί τη γεωμετρία ενός συγκεκριμένου χώρου, μαζί με το σκοπό και τη θέση των αντικειμένων μέσα σε αυτόν.
Οι ερευνητές της Apple λένε ότι οι υπάρχουσες μέθοδοι αξιολόγησης, όπως το VSI-Bench, ελέγχουν μόνο την πρώτη πτυχή, αγνοώντας σε μεγάλο βαθμό τη δεύτερη.
Δείτε ακόμα: Canonical: AI χαρακτηριστικά στο Ubuntu Linux distro

Για να αντιμετωπίσουν αυτό το ζήτημα, ανέπτυξαν το Benchmark Χωρικής-Λειτουργικής Νοημοσύνης, συντομογραφημένο ως SFI-Bench. Περιγράφεται ως ένα βίντεο-βασισμένο benchmark με 1.555 ερωτήσεις που έχουν σχολιαστεί από ειδικούς και προέρχονται από 134 εσωτερικές σάρωσεις βίντεο.
Το SFI-Bench ελέγχει αν τα μοντέλα κατανοούν για τι χρησιμεύουν τα αντικείμενα στη σκηνή, πώς λειτουργούν και πώς μπορούν να διαγνωστούν αποτυχίες. Με άλλα λόγια, το benchmark ελέγχει αν τα μοντέλα τεχνητής νοημοσύνης κατανοούν τι είναι ένα αντικείμενο, πού βρίσκεται, πώς χρησιμοποιείται, για τι χρησιμοποιείται και πώς μπορεί να επισκευαστεί.
Αν αυτό σας ακούγεται οικείο, είναι επειδή η Google διαθέτει εργαλεία με αυτό το είδος χωρικής επίγνωσης τουλάχιστον από το 2024. Στο συνέδριο I/O την ίδια χρονιά, το μοντέλο τεχνητής νοημοσύνης της Google αναγνώρισε σωστά ένα αντικείμενο μπροστά του ως πικάπ και ακόμη πρότεινε πώς να επισκευαστεί η συσκευή.
Στην πράξη, το SFI-Bench θα χρησιμεύσει για τη δοκιμή παρόμοιων και πιο προηγμένων μοντέλων τεχνητής νοημοσύνης. Ορισμένες από τις δοκιμές που αναφέρονται περιλαμβάνουν την ερώτηση σε ένα LLM να αναγνωρίσει το μεγαλύτερο υποσύνολο των ίδιων μπουκαλιών μάρκας σε ένα ντουλάπι, να ακυρώσει το τρέχον πρόγραμμα σε ένα πλυντήριο και για τι χρησιμοποιείται ένα τηλεχειριστήριο τηλεόρασης.
Οι ερευνητές της Apple δοκίμασαν αρκετά ανοιχτού κώδικα και ιδιόκτητα μοντέλα τεχνητής νοημοσύνης με το πλαίσιο SFI-Bench. Όπως αναμενόταν, το Google Gemini 3.1 Pro πέτυχε το καλύτερο συνολικό αποτέλεσμα, ενώ το Gemini-3.1-Flash-Lite κατέλαβε την τρίτη θέση. Το GPT-5.4-High της OpenAI κατέλαβε τη δεύτερη θέση.
Δείτε επίσης: Η τεχνητή νοημοσύνη μετασχηματίζει το DevSecOps

Ωστόσο, η μελέτη σημειώνει ότι “Σε όλα τα μοντέλα, η παγκόσμια συνθήκη καταμέτρησης αναδεικνύεται ως βασικό εμπόδιο, αποκαλύπτοντας επίμονους περιορισμούς στη συνθετική και λογική αιτιολογία.” Με άλλα λόγια, τα περισσότερα τρέχοντα πολυτροπικά LLMs δυσκολεύονται με τη χωρική μνήμη, την ενσωμάτωση λειτουργικών γνώσεων και τη σύνδεση της αντίληψης με εξωτερικές γνώσεις.
