ΑρχικήUpdatesNova Sonic: Το νέο AI voice model της Amazon

Nova Sonic: Το νέο AI voice model της Amazon

Η Amazon παρουσίασε το Nova Sonic, ένα νέο generative AI voice model, που μπορεί να επεξεργάζεται εγγενώς φωνές και να παράγει ομιλία με φυσικό ήχο. Η εταιρεία πιστεύει ότι μπορεί να ανταγωνιστεί αντίστοιχα μοντέλα της OpenAI και της Google, ως προς την ταχύτητα, την αναγνώριση ομιλίας και την ποιότητα συνομιλίας.

Nova Sonic Amazon AI voice model

Το Nova Sonic είναι διαθέσιμο μέσω του Bedrock, της πλατφόρμας προγραμματιστών της Amazon για τη δημιουργία εταιρικών εφαρμογών AI (μέσω ενός νέου bi-directional streaming API). Σε ένα δελτίο τύπου, η Amazon αποκάλεσε το Nova Sonic «το πιο οικονομικό» AI voice model στην αγορά (περίπου 80% φθηνότερο από το GPT-4o του OpenAI).

Τα components του Nova Sonic τροφοδοτούν ήδη το Alexa+, τον αναβαθμισμένο ψηφιακό φωνητικό βοηθό της Amazon.

Δείτε επίσης: Η Amazon παρουσίασε τον νέο AI agent “Nova Act”

Σε σύγκριση με τα ανταγωνιστικά AI voice models, το Nova Sonic υπερέχει στη δρομολόγηση αιτημάτων χρηστών σε διαφορετικά API, σύμφωνα με την Amazon. Αυτό βοηθά το Nova Sonic να «γνωρίζει» πότε πρέπει να ανακτήσει πληροφορίες σε πραγματικό χρόνο από το διαδίκτυο, να αναλύσει μια αποκλειστική πηγή δεδομένων ή να αναλάβει δράση σε μια εξωτερική εφαρμογή — και να χρησιμοποιήσει το κατάλληλο εργαλείο για να το κάνει.

Η Amazon λέει ότι κατά τη διάρκεια ενός διαλόγου, το AI voice model Nova Sonic περιμένει να μιλήσει «την κατάλληλη στιγμή», λαμβάνοντας υπόψη τις παύσεις και τις διακοπές του συνομιλητή. Δημιουργεί επίσης ένα text transcript για την ομιλία του χρήστη, την οποία οι προγραμματιστές μπορούν να χρησιμοποιήσουν για διάφορες εφαρμογές.

Η Amazon ισχυρίζεται ότι το Nova Sonic είναι λιγότερο επιρρεπές σε σφάλματα αναγνώρισης ομιλίας από αντίστοιχα μοντέλα, πράγμα που σημαίνει ότι είναι σχετικά καλό στο να κατανοεί την πρόθεση ενός χρήστη ακόμα κι αν μουρμουρίζει, εκφωνεί λάθος ή βρίσκεται σε θορυβώδες περιβάλλον. Στο Multilingual LibriSpeech, ένα τεστ που αξιολογεί την αναγνώριση ομιλίας μεταξύ γλωσσών και διαλέκτων, το Nova Sonic πέτυχε ποσοστό λάθους λέξεων (WER) μόλις 4,2% (κατά μέσο όρο στα αγγλικά, γαλλικά, ιταλικά, γερμανικά και ισπανικά). Αυτό σημαίνει ότι περίπου τέσσερις στις 100 λέξεις του μοντέλου διέφεραν από ένα ανθρώπινο transcription.

Δείτε επίσης: Ocelot: Το quantum computing chip της Amazon Web Services (AWS)

Nova Sonic: Το νέο AI voice model της Amazon

Στο Augmented Multi Party Interaction, που μετρά τα loud interactions με πολλούς συμμετέχοντες, το AI voice model Nova Sonic της Amazon ήταν 46,7% πιο ακριβές όσον αφορά το WER από το μοντέλο GPT-4o της OpenAI. Το Nova Sonic έχει επίσης κορυφαία ταχύτητα στον κλάδο.

Το στέλεχος Rohit Prasad λέει ότι το Nova Sonic αποτελεί μέρος της ευρύτερης στρατηγικής της Amazon για την ανάπτυξη AGI (artificial general intelligence), την οποία η εταιρεία ορίζει ως “συστήματα AI που μπορούν να κάνουν οτιδήποτε μπορεί να κάνει ένας άνθρωπος σε έναν υπολογιστή“. Ο Prasad λέει ότι η Amazon σχεδιάζει να κυκλοφορήσει περισσότερα μοντέλα τεχνητής νοημοσύνης που μπορούν να κατανοήσουν διαφορετικά μέσα, όπως εικόνα, βίντεο και φωνή.

Δείτε επίσης: Amazon Project Kuiper: Ο ανταγωνιστής του Starlink εκτόξευσε δορυφόρους

Το νέο AI voice model Nova Sonic της Amazon είναι ένα ακόμα βήμα προς τη φυσικότερη επικοινωνία ανθρώπου και μηχανής. Υπόσχεται ρεαλιστική προφορά, τονισμούς, συναισθήματα και προσπαθεί να ακούγεται σαν πραγματικός άνθρωπος. Αυτό σημαίνει ότι θα μπορούσε να χρησιμοποιηθεί για να βελτιώσει σημαντικά διάφορες υπηρεσίες που χρησιμοποιούμε καθημερινά (Audiobook, Εικονικούς χαρακτήρες σε games, Εξυπηρέτηση πελατών κλπ).

Πηγή: techcrunch.com

📧
Εγγραφείτε στο Newsletter του SecNews

Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο Inbox σας.

Digital Fortress
Digital Fortresshttps://www.secnews.gr
Pursue Your Dreams & Live!

ΑΝΑΖΗΤΗΣΗ

FOLLOW US

📧
Newsletter SecNews
Τα σημαντικότερα νέα Ασφάλειας & Τεχνολογίας στο inbox σας.

LIVE NEWS