ΑΝΑΖΗΤΗΣΗ
SHARE IT
Το τοπίο της τεχνητής νοημοσύνης που βασίζεται στη φωνή υφίσταται μια σημαντική μετατόπιση καθώς η Google αποκαλύπτει τις τελευταίες αρχιτεκτονικές προσθήκες στο οικοσύστημα των προγραμματιστών. Με τη διάθεση των Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking και Gemini 3.5 Transcribe, ο τεχνολογικός κολοσσός ανεβάζει τον πήχη για τη φυσική επεξεργασία γλώσσας σε πραγματικό χρόνο, τη σύνθετη λογική σκέψη και τη μεταγραφή υψηλής ακρίβειας. Σχεδιασμένα για ενσωμάτωση σε εταιρικές πλατφόρμες, ροές εργασίας προγραμματιστών και το ευρύτερο περιβάλλον του Google Workspace, αυτά τα νέα εργαλεία γεφυρώνουν το χάσμα μεταξύ της ανθρώπινης συνομιλίας και της συνθετικής νοημοσύνης.
Στο επίκεντρο αυτής της κυκλοφορίας βρίσκεται το Gemini 3.8 Live, ένα μοντέλο συνομιλίας σχεδιασμένο να διαχειρίζεται σύνθετες φωνητικές αλληλεπιδράσεις ενώ ταυτόχρονα λαμβάνει οπτικό πλαίσιο σε πραγματικό χρόνο. Σε αντίθεση με τους παραδοσιακούς ψηφιακούς βοηθούς που διακόπτουν τη λειτουργία τους ή αποτυγχάνουν κάτω από πολυτροπικές απαιτήσεις, το Gemini 3.8 Live επεξεργάζεται ταυτόχρονα ροές βίντεο από την κάμερα και φωνητικές εντολές, επιτρέποντας στους χρήστες να αλληλεπιδρούν με το άμεσο φυσικό τους περιβάλλον. Η ενσωματωμένη υποστήριξη για περισσότερες από 97 γλώσσες περιλαμβάνει την αλλαγή γλώσσας ακόμα και στο μέσο μιας πρότασης και βελτιωμένη αλφαριθμητική αναγνώριση, μειώνοντας δραματικά τα συνηθισμένα σφάλματα κατά την υπαγόρευση σύνθετων στοιχείων όπως αριθμοί ασφαλιστηρίων συμβολαίων, αλφαριθμητικά tokens ή τεχνικές προδιαγραφές.
Για φόρτους εργασίας που απαιτούν προηγμένη γνωστική επεξεργασία, η Google παρουσίασε το Gemini 3.8 Live Extended Thinking. Αυτή η εξειδικευμένη έκδοση είναι σχεδιασμένη να διαχειρίζεται λογική επεξεργασία πολλαπλών βημάτων και κλήσεις συναρτήσεων στο παρασκήνιο χωρίς να διακόπτεται η φυσική ροή του διαλόγου. Το μοντέλο κατέκτησε την πρώτη θέση στον δείκτη Speech to Speech Quality Index του Artificial Analysis με σκορ 82.6, ενώ σημείωσε υψηλές επιδόσεις σε εξειδικευμένα benchmarks, όπως 68.6 τοις εκατό στο τ-Voice benchmark και 35.1 τοις εκατό στο τραπεζικό τεστ Sierra τ-Voice-banking. Αντί να προκαλεί αμήχανες παύσεις κατά τη διάρκεια απαιτητικών αναζητήσεων δεδομένων, ο βοηθός χρησιμοποιεί φυσικές λεκτικές φράσεις για να διατηρεί τον χρήστη ενεργό καθώς ολοκληρώνονται οι πολύπλοκες διεργασίες στο παρασκήνιο. Οι επιδείξεις έδειξαν δυνατότητες που κυμαίνονται από την ανάλυση ζωντανής παρτίδας σκάκι μέσω βίντεο έως την άμεση μετατροπή χειρόγραφων σχεδίων σε λειτουργικό κώδικα React με βάση μόνο τις προφορικές οδηγίες.
Παράλληλα με τις μηχανές διαδραστικού διαλόγου, η Google διεύρυνε το χαρτοφυλάκιο προγραμματιστών με το Gemini 3.5 Transcribe, ένα εξειδικευμένο μοντέλο μετατροπής ομιλίας σε κείμενο που δημιουργήθηκε για να επιλύσει χρόνιες προκλήσεις υπαγόρευσης. Σχεδιασμένο για ελάχιστη καθυστέρηση, το Gemini 3.5 Transcribe καταγράφει ποσοστό σφάλματος λέξεων 4.0 τοις εκατό κατά τη ζωντανή ροή και 2.6 τοις εκατό σε προηχογραφημένα αρχεία ήχου. Υποστηρίζοντας περισσότερες από 85 γλώσσες με αυτόματη αναγνώριση, το σύστημα επιτρέπει στους προγραμματιστές να ανεβάζουν προσαρμοσμένα λεξιλόγια έως και 1.000 εξειδικευμένων όρων. Αυτό εξασφαλίζει ακριβή γραφή για ιατρική ορολογία, εταιρικές επωνυμίες και ειδικούς όρους της βιομηχανίας. Επιπλέον χαρακτηριστικά περιλαμβάνουν λειτουργίες αυτόματου καθαρισμού που αφαιρούν τους φωνητικούς δισταγμούς, διορθώνουν τη σύνταξη εν τη γενέσει της και εισάγουν δομημένες χρονοσημάνσεις μαζί με διαχωρισμό πολλαπλών ομιλητών για αρχεία ήχου διάρκειας έως και μίας ώρας.
Η προσβασιμότητα παραμένει κεντρικός πυλώνας της στρατηγικής διανομής της Google. Τα νέα μοντέλα είναι άμεσα διαθέσιμα μέσω του Gemini Live API και του Google AI Studio, μαζί με ενοποιήσεις με παρόχους υποδομών όπως οι Agora, Fishjam, LiveKit, LangChain, Pipecat και Vercel. Αυτές οι συνεργασίες επιτρέπουν στους μηχανικούς λογισμικού να απαλλαγούν από τη διαχείριση της πολύπλοκης ροής πολυμέσων και να εστιάσουν στον σχεδιασμό της εμπειρίας χρήστη. Η Google τιμολογεί το Gemini 3.8 Live ανταγωνιστικά στα $0.005 ανά λεπτό εισερχόμενου ήχου και στα $0.018 ανά λεπτό εξερχόμενου ήχου. Για τη διασφάλιση της ασφάλειας και την αποτροπή πιθανής κατάχρησης, κάθε δευτερόλεπτο παραγόμενου συνθετικού ήχου περιλαμβάνει αόρατο υδατογράφημα SynthID, εξασφαλίζοντας σαφή εντοπισμό προέλευσης και προστασία από τη χρήση deepfake.
MORE NEWS FOR YOU