Chatbots & Virtual Agents
Η Τεχνητή Νοημοσύνη Μαθαίνει τη Σύνδεση Όρασης και Ήχου
Οι άνθρωποι διαθέτουν μια φυσική ικανότητα να συνδέουν την όραση με τον ήχο. Για παράδειγμα, όταν παρακολουθούμε κάποιον να παίζει τσέλο, αντιλαμβανόμαστε ότι οι κινήσεις του μουσικού παράγουν τη μουσική που ακούμε. Αυτή η φυσική ικανότητα αποτελεί πλέον αντικείμενο έρευνας για την ανάπτυξη τεχνητής νοημοσύνης (AI) που μπορεί να μαθαίνει με παρόμοιο τρόπο.
Η νέα προσέγγιση της MIT
Μια καινοτόμος μέθοδος που αναπτύχθηκε από ερευνητές του MIT και άλλων ιδρυμάτων βελτιώνει την ικανότητα των μοντέλων τεχνητής νοημοσύνης να μαθαίνουν με τον ίδιο τρόπο. Αυτή η εξέλιξη μπορεί να έχει εφαρμογές σε τομείς όπως η δημοσιογραφία και η παραγωγή ταινιών, όπου τα μοντέλα AI μπορούν να βοηθήσουν στην αυτόματη ανάκτηση και επιμέλεια πολυτροπικού περιεχομένου μέσω βίντεο και ήχου.
Προοπτικές για το μέλλον
Μακροπρόθεσμα, η έρευνα αυτή θα μπορούσε να βελτιώσει την ικανότητα των ρομπότ να κατανοούν πραγματικά περιβάλλοντα, όπου οι ακουστικές και οπτικές πληροφορίες συνδέονται στενά. Οι ερευνητές ανέπτυξαν μια μέθοδο που βοηθά τα μοντέλα μηχανικής μάθησης να ευθυγραμμίζουν τα αντίστοιχα δεδομένα ήχου και εικόνας από βίντεο χωρίς την ανάγκη ανθρώπινων ετικετών.
Βελτιώσεις στην εκπαίδευση του μοντέλου
Με την προσαρμογή της εκπαίδευσης του αρχικού μοντέλου, οι ερευνητές κατάφεραν να επιτύχουν μια πιο λεπτομερή αντιστοιχία μεταξύ συγκεκριμένων καρέ βίντεο και του ήχου που συμβαίνει τη συγκεκριμένη στιγμή. Επίσης, πραγματοποίησαν αρχιτεκτονικές βελτιώσεις που βοηθούν το σύστημα να ισορροπήσει δύο διαφορετικούς στόχους μάθησης, βελτιώνοντας έτσι την απόδοση.
Αυξημένη ακρίβεια και απόδοση
Οι απλές αυτές βελτιώσεις ενισχύουν την ακρίβεια της μεθόδου τους σε εργασίες ανάκτησης βίντεο και ταξινόμησης δράσεων σε ηχοοπτικές σκηνές. Για παράδειγμα, η νέα μέθοδος μπορεί να αντιστοιχίσει αυτόματα και με ακρίβεια τον ήχο μιας πόρτας που κλείνει με την εικόνα της στο βίντεο.
Η σημασία της πολυτροπικής επεξεργασίας
«Δημιουργούμε συστήματα AI που μπορούν να επεξεργάζονται τον κόσμο όπως οι άνθρωποι, με την ταυτόχρονη λήψη ακουστικών και οπτικών πληροφοριών και την ικανότητα να τα επεξεργάζονται αδιάκοπα. Στο μέλλον, αν μπορέσουμε να ενσωματώσουμε αυτή την τεχνολογία σε εργαλεία που χρησιμοποιούμε καθημερινά, όπως τα μεγάλα γλωσσικά μοντέλα, θα μπορούσε να ανοίξει πολλές νέες εφαρμογές», αναφέρει ο Andrew Rouditchenko, μεταπτυχιακός φοιτητής στο MIT και συν-συγγραφέας της έρευνας.
Η ομάδα πίσω από την έρευνα
Στην έρευνα συμμετέχουν επίσης ο Edson Araujo, μεταπτυχιακός φοιτητής στο Πανεπιστήμιο Goethe στη Γερμανία, ο Yuan Gong, πρώην μεταδιδακτορικός ερευνητής στο MIT, και άλλοι συνεργάτες από το MIT και το IBM Research. Η εργασία θα παρουσιαστεί στο Συνέδριο για την Υπολογιστική Όραση και Αναγνώριση Προτύπων.
Η εξέλιξη της CAV-MAE
Η νέα αυτή εργασία βασίζεται σε μια μέθοδο μηχανικής μάθησης που ανέπτυξαν οι ερευνητές πριν από μερικά χρόνια, η οποία παρείχε έναν αποδοτικό τρόπο εκπαίδευσης ενός πολυτροπικού μοντέλου για την ταυτόχρονη επεξεργασία ακουστικών και οπτικών δεδομένων χωρίς την ανάγκη ανθρώπινων ετικετών.
Η λειτουργία του CAV-MAE
Το μοντέλο αυτό, γνωστό ως CAV-MAE, τροφοδοτείται με αταξινόμητα βίντεο και κωδικοποιεί τα οπτικά και ακουστικά δεδομένα σε αναπαραστάσεις που ονομάζονται tokens. Χρησιμοποιώντας το φυσικό ήχο από την εγγραφή, το μοντέλο μαθαίνει αυτόματα να αντιστοιχεί τα αντίστοιχα ζεύγη ακουστικών και οπτικών tokens στο εσωτερικό του χώρο αναπαράστασης.
Η βελτίωση του CAV-MAE Sync
Στο βελτιωμένο μοντέλο, CAV-MAE Sync, οι ερευνητές διαχωρίζουν τον ήχο σε μικρότερα παράθυρα πριν το μοντέλο υπολογίσει τις αναπαραστάσεις των δεδομένων, ώστε να δημιουργεί ξεχωριστές αναπαραστάσεις που αντιστοιχούν σε κάθε μικρότερο παράθυρο ήχου. Κατά την εκπαίδευση, το μοντέλο μαθαίνει να συσχετίζει ένα καρέ βίντεο με τον ήχο που συμβαίνει μόνο κατά τη διάρκεια αυτού του καρέ.
Προσθήκη «ευελιξίας» στο μοντέλο
Το μοντέλο ενσωματώνει έναν αντιθετικό στόχο, όπου μαθαίνει να συνδέει παρόμοια ακουστικά και οπτικά δεδομένα, και έναν στόχο ανακατασκευής που στοχεύει στην ανάκτηση συγκεκριμένων ακουστικών και οπτικών δεδομένων βάσει ερωτημάτων χρηστών. Στο CAV-MAE Sync, οι ερευνητές εισήγαγαν δύο νέους τύπους αναπαραστάσεων δεδομένων, ή tokens, για να βελτιώσουν την ικανότητα μάθησης του μοντέλου.
Συνεργασία διαφορετικών στόχων μάθησης
Περιλαμβάνουν ειδικά «global tokens» που βοηθούν στον αντιθετικό στόχο μάθησης και ειδικά «register tokens» που βοηθούν το μοντέλο να εστιάσει σε σημαντικές λεπτομέρειες για τον στόχο ανακατασκευής. «Προσθέτουμε ουσιαστικά λίγο περισσότερη ευελιξία στο μοντέλο ώστε να μπορεί να εκτελεί αυτές τις δύο εργασίες, αντιθετική και ανακατασκευαστική, λίγο πιο ανεξάρτητα. Αυτό ωφέλησε τη συνολική απόδοση», προσθέτει ο Araujo.
Μελλοντικές προοπτικές
Οι ερευνητές επιθυμούν στο μέλλον να ενσωματώσουν νέα μοντέλα που παράγουν καλύτερες αναπαραστάσεις δεδομένων στο CAV-MAE Sync, κάτι που θα μπορούσε να βελτιώσει την απόδοση. Επίσης, θέλουν να επιτρέψουν στο σύστημά τους να διαχειρίζεται δεδομένα κειμένου, κάτι που θα αποτελούσε σημαντικό βήμα προς τη δημιουργία ενός μεγάλου γλωσσικού μοντέλου που συνδυάζει ήχο και εικόνα.