sedoni left all cities
sedoni right all cities
Καλωσήρθες επισκέπτη

Ο «άνθρωπος» μας εκπλήσσει για άλλη μια φορά

Κύριο Ο «άνθρωπος» μας εκπλήσσει για άλλη μια φορά

Το μοντέλο AI επιταχύνει την όραση υπολογιστή υψηλής ανάλυσης
Το σύστημα θα μπορούσε να βελτιώσει την ποιότητα της εικόνας στη ροή βίντεο ή να βοηθήσει τα αυτόνομα οχήματα να εντοπίζουν τους κινδύνους στο δρόμο σε πραγματικό χρόνο.

Ένα αυτόνομο όχημα πρέπει να αναγνωρίζει γρήγορα και με ακρίβεια αντικείμενα που συναντά, από ένα φορτηγό στο ρελαντί που είναι σταθμευμένο στη γωνία μέχρι έναν ποδηλάτη που τρέχει προς μια διασταύρωση που πλησιάζει.

Για να γίνει αυτό, το όχημα μπορεί να χρησιμοποιήσει ένα πανίσχυρο μοντέλο υπολογιστικής όρασης για να κατηγοριοποιήσει κάθε pixel σε μια εικόνα υψηλής ανάλυσης αυτής της σκηνής, ώστε να μην χάνει από τα μάτια του αντικείμενα που μπορεί να κρύβονται σε μια εικόνα χαμηλότερης ποιότητας. Αλλά αυτή η εργασία, γνωστή ως σημασιολογική κατάτμηση, είναι πολύπλοκη και απαιτεί τεράστιο όγκο υπολογισμού όταν η εικόνα έχει υψηλή ανάλυση.

Ερευνητές από το MIT, το MIT-IBM Watson AI Lab και αλλού έχουν αναπτύξει ένα πιο αποτελεσματικό μοντέλο υπολογιστικής όρασης που μειώνει κατά πολύ την υπολογιστική πολυπλοκότητα αυτής της εργασίας. Το μοντέλο τους μπορεί να εκτελεί σημασιολογική τμηματοποίηση με ακρίβεια σε πραγματικό χρόνο σε μια συσκευή με περιορισμένους πόρους υλικού, όπως οι ενσωματωμένοι υπολογιστές που επιτρέπουν σε ένα αυτόνομο όχημα να λαμβάνει αποφάσεις σε κλάσματα δευτερολέπτου.

Τα πρόσφατα υπερσύγχρονα μοντέλα σημασιολογικής τμηματοποίησης μαθαίνουν άμεσα την αλληλεπίδραση μεταξύ κάθε ζεύγους pixel σε μια εικόνα, έτσι οι υπολογισμοί τους αυξάνονται τετραγωνικά καθώς αυξάνεται η ανάλυση της εικόνας. Εξαιτίας αυτού, ενώ αυτά τα μοντέλα είναι ακριβή, είναι πολύ αργά στην επεξεργασία εικόνων υψηλής ανάλυσης σε πραγματικό χρόνο σε μια συσκευή άκρων όπως ένας αισθητήρας ή ένα κινητό τηλέφωνο.

Οι ερευνητές του MIT σχεδίασαν ένα νέο δομικό στοιχείο για μοντέλα σημασιολογικής τμηματοποίησης που επιτυγχάνει τις ίδιες ικανότητες με αυτά τα μοντέλα τελευταίας τεχνολογίας, αλλά με μόνο γραμμική υπολογιστική πολυπλοκότητα και λειτουργίες αποδοτικές από άποψη υλικού.

Το αποτέλεσμα είναι μια νέα σειρά μοντέλων για όραση υπολογιστή υψηλής ανάλυσης που αποδίδει έως και εννέα φορές γρηγορότερα από προηγούμενα μοντέλα όταν αναπτύσσεται σε φορητή συσκευή. Είναι σημαντικό ότι αυτή η νέα σειρά μοντέλων επέδειξε την ίδια ή καλύτερη ακρίβεια από αυτές τις εναλλακτικές λύσεις.

Αυτή η τεχνική όχι μόνο θα μπορούσε να χρησιμοποιηθεί για να βοηθήσει τα αυτόνομα οχήματα να λαμβάνουν αποφάσεις σε πραγματικό χρόνο, αλλά θα μπορούσε επίσης να βελτιώσει την αποτελεσματικότητα άλλων εργασιών όρασης υπολογιστή υψηλής ανάλυσης, όπως η τμηματοποίηση ιατρικής εικόνας.

«Ενώ οι ερευνητές χρησιμοποιούν παραδοσιακούς μετασχηματιστές όρασης για αρκετό καιρό και δίνουν εκπληκτικά αποτελέσματα, θέλουμε οι άνθρωποι να δώσουν επίσης προσοχή στην πτυχή της αποτελεσματικότητας αυτών των μοντέλων. Η δουλειά μας δείχνει ότι είναι δυνατό να μειωθεί δραστικά ο υπολογισμός, ώστε αυτή η τμηματοποίηση εικόνας σε πραγματικό χρόνο να μπορεί να συμβεί τοπικά σε μια συσκευή», λέει ο Song Han, αναπληρωτής καθηγητής στο Τμήμα Ηλεκτρολόγων Μηχανικών και Επιστήμης Υπολογιστών (EECS), μέλος του το MIT-IBM Watson AI Lab και ο ανώτερος συγγραφέας της εργασίας που περιγράφει το νέο μοντέλο.

Μαζί του στην εργασία είναι ο κύριος συγγραφέας Han Cai, ένας μεταπτυχιακός φοιτητής EECS. Junyan Li, προπτυχιακός στο Πανεπιστήμιο Zhejiang. Muyan Hu, προπτυχιακός φοιτητής στο Πανεπιστήμιο Tsinghua. και Chuang Gan, κύριο μέλος του ερευνητικού προσωπικού στο MIT-IBM Watson AI Lab. Η έρευνα θα παρουσιαστεί στο Διεθνές Συνέδριο για το Computer Vision.

Μια απλοποιημένη λύση

Η κατηγοριοποίηση κάθε εικονοστοιχείου σε μια εικόνα υψηλής ανάλυσης που μπορεί να έχει εκατομμύρια εικονοστοιχεία είναι μια δύσκολη εργασία για ένα μοντέλο μηχανικής μάθησης. Ένας νέος ισχυρός τύπος μοντέλου, γνωστός ως μετασχηματιστής όρασης, χρησιμοποιήθηκε πρόσφατα αποτελεσματικά.

Οι μετασχηματιστές αναπτύχθηκαν αρχικά για επεξεργασία φυσικής γλώσσας. Σε αυτό το πλαίσιο, κωδικοποιούν κάθε λέξη σε μια πρόταση ως διακριτικό και στη συνέχεια δημιουργούν έναν χάρτη προσοχής, ο οποίος καταγράφει τις σχέσεις κάθε διακριτικού με όλα τα άλλα διακριτικά. Αυτός ο χάρτης προσοχής βοηθά το μοντέλο να κατανοήσει το πλαίσιο όταν κάνει προβλέψεις.

Χρησιμοποιώντας την ίδια ιδέα, ένας μετασχηματιστής όρασης κόβει μια εικόνα σε μπαλώματα pixel και κωδικοποιεί κάθε μικρή ενημέρωση κώδικα σε ένα διακριτικό πριν δημιουργήσει έναν χάρτη προσοχής. Κατά τη δημιουργία αυτού του χάρτη προσοχής, το μοντέλο χρησιμοποιεί μια συνάρτηση ομοιότητας που μαθαίνει άμεσα την αλληλεπίδραση μεταξύ κάθε ζεύγους pixel. Με αυτόν τον τρόπο, το μοντέλο αναπτύσσει αυτό που είναι γνωστό ως παγκόσμιο δεκτικό πεδίο, που σημαίνει ότι μπορεί να έχει πρόσβαση σε όλα τα σχετικά μέρη της εικόνας.

Δεδομένου ότι μια εικόνα υψηλής ανάλυσης μπορεί να περιέχει εκατομμύρια pixel, τεμαχισμένα σε χιλιάδες patches, ο χάρτης προσοχής γίνεται γρήγορα τεράστιος. Εξαιτίας αυτού, ο όγκος του υπολογισμού αυξάνεται τετραγωνικά καθώς αυξάνεται η ανάλυση της εικόνας.

Στη νέα τους σειρά μοντέλων, που ονομάζεται EfficientViT, οι ερευνητές του MIT χρησιμοποίησαν έναν απλούστερο μηχανισμό για να δημιουργήσουν τον χάρτη προσοχής — αντικαθιστώντας τη συνάρτηση μη γραμμικής ομοιότητας με μια συνάρτηση γραμμικής ομοιότητας. Ως εκ τούτου, μπορούν να αναδιατάξουν τη σειρά των πράξεων για να μειώσουν τους συνολικούς υπολογισμούς χωρίς να αλλάξουν τη λειτουργικότητα και να χάσουν το παγκόσμιο πεδίο λήψης. Με το μοντέλο τους, ο όγκος του υπολογισμού που απαιτείται για μια πρόβλεψη αυξάνεται γραμμικά καθώς αυξάνεται η ανάλυση της εικόνας.

«Αλλά δεν υπάρχει δωρεάν γεύμα. Η γραμμική προσοχή καταγράφει μόνο το παγκόσμιο πλαίσιο για την εικόνα, χάνοντας τοπικές πληροφορίες, γεγονός που κάνει την ακρίβεια χειρότερη», λέει ο Han.

Για να αντισταθμίσουν αυτή την απώλεια ακρίβειας, οι ερευνητές συμπεριέλαβαν δύο επιπλέον στοιχεία στο μοντέλο τους, καθένα από τα οποία προσθέτει μόνο ένα μικρό ποσό υπολογισμού.

Ένα από αυτά τα στοιχεία βοηθά το μοντέλο να συλλάβει τις τοπικές αλληλεπιδράσεις χαρακτηριστικών, μετριάζοντας την αδυναμία της γραμμικής συνάρτησης στην τοπική εξαγωγή πληροφοριών. Η δεύτερη, μια ενότητα που επιτρέπει τη μάθηση σε πολλαπλές κλίμακες, βοηθά το μοντέλο να αναγνωρίζει τόσο μεγάλα όσο και μικρά αντικείμενα.

«Το πιο κρίσιμο μέρος εδώ είναι ότι πρέπει να εξισορροπήσουμε προσεκτικά την απόδοση και την αποτελεσματικότητα», λέει ο Cai.

Σχεδίασαν το EfficientViT με αρχιτεκτονική φιλική προς το υλικό, έτσι ώστε να είναι ευκολότερη η εκτέλεση σε διαφορετικούς τύπους συσκευών, όπως ακουστικά εικονικής πραγματικότητας ή υπολογιστές edge σε αυτόνομα οχήματα. Το μοντέλο τους θα μπορούσε επίσης να εφαρμοστεί σε άλλες εργασίες όρασης υπολογιστή, όπως η ταξινόμηση εικόνων.

Βελτιστοποίηση της σημασιολογικής κατάτμησης

Όταν δοκίμασαν το μοντέλο τους σε σύνολα δεδομένων που χρησιμοποιούνται για σημασιολογική τμηματοποίηση, διαπίστωσαν ότι είχε έως και εννέα φορές ταχύτερη απόδοση σε μια μονάδα επεξεργασίας γραφικών Nvidia (GPU) από άλλα δημοφιλή μοντέλα μετασχηματιστών όρασης, με την ίδια ή καλύτερη ακρίβεια.

«Τώρα, μπορούμε να πάρουμε το καλύτερο και από τους δύο κόσμους και να μειώσουμε τον υπολογισμό για να τον κάνουμε αρκετά γρήγορο ώστε να μπορούμε να τον εκτελούμε σε κινητές συσκευές και συσκευές cloud», λέει ο Han.

Βασιζόμενοι σε αυτά τα αποτελέσματα, οι ερευνητές θέλουν να εφαρμόσουν αυτήν την τεχνική για να επιταχύνουν τα παραγωγικά μοντέλα μηχανικής μάθησης, όπως αυτά που χρησιμοποιούνται για τη δημιουργία νέων εικόνων. Θέλουν επίσης να συνεχίσουν την κλιμάκωση του EfficientViT για άλλες εργασίες όρασης.

«Τα αποτελεσματικά μοντέλα μετασχηματιστών, τα οποία πρωτοστάτησε η ομάδα του καθηγητή Song Han, αποτελούν πλέον τη ραχοκοκαλιά των τεχνικών αιχμής σε διάφορες εργασίες όρασης υπολογιστή, συμπεριλαμβανομένης της ανίχνευσης και της τμηματοποίησης», λέει ο Lu Tian, ανώτερος διευθυντής αλγορίθμων AI στην AMD, Inc. δεν εμπλέκεται σε αυτό το έγγραφο. «Η έρευνά τους όχι μόνο δείχνει την αποτελεσματικότητα και την ικανότητα των μετασχηματιστών, αλλά αποκαλύπτει επίσης τις τεράστιες δυνατότητές τους για εφαρμογές πραγματικού κόσμου, όπως η βελτίωση της ποιότητας εικόνας στα βιντεοπαιχνίδια».

«Η συμπίεση μοντέλων και ο σχεδιασμός μοντέλων μικρού βάρους είναι κρίσιμα ερευνητικά θέματα για την αποτελεσματική υπολογιστική τεχνητή νοημοσύνη, ειδικά στο πλαίσιο των μεγάλων μοντέλων θεμελίωσης. Η ομάδα του καθηγητή Song Han έχει επιδείξει αξιοσημείωτη πρόοδο στη συμπίεση και την επιτάχυνση των σύγχρονων μοντέλων βαθιάς μάθησης, ιδιαίτερα των μετασχηματιστών όρασης», προσθέτει ο Jay Jackson, παγκόσμιος αντιπρόεδρος τεχνητής νοημοσύνης και μηχανικής μάθησης στην Oracle, ο οποίος δεν συμμετείχε σε αυτήν την έρευνα. "Η Oracle Cloud Infrastructure υποστηρίζει την ομάδα του για να προωθήσει αυτή τη γραμμή επιρροής έρευνας προς την αποτελεσματική και πράσινη τεχνητή νοημοσύνη."

 

SpoudaZO Team

Δημοσιεύουμε άρθρα που σε ενδιαφέρουν! Έχεις άποψη και αιχμηρή πένα; Γίνε αρθρογράφος με μια απλή εγγραφή στο site και δημοσίευσε τα δικά σου άρθρα και ανταποκρίσεις από τη σχολή σου και την πόλη που σπουδάζεις. Αναφέρουμε πάντα τις πηγές μας αλλά αν κρίνεις ότι το περιεχόμενο μας παραβιάζει πνευματικά δικαιώματα, επικοινώνησε μαζί μας. Θα απαντήσουμε το συντομότερο δυνατόν. Το SpoudaZO.gr δεν υιοθετεί και δεν φέρει ευθύνη για το περιεχόμενο των άρθρων και τις απόψεις των συγγραφέων τους

Το ​SpoudaZO.gr δεν φέρει ουδεμία ευθύνη εκ του νόμου, ​για τα σχόλια που φιλοξενεί μέσω της πλατφόρμας του facebook. Παρακαλούμε να σχολιάζεις με ευγένεια και σεβασμό προς τους συνομιλητές σου. Απόφυγε τις ύβρεις και τους χαρακτηρισμούς. Σε περίπτωση που θεωρείς πως θίγεσαι, ​για οποιονδήποτε λόγο, από κάποιο εξ’ αυτών, ​μπορείς να το αναφέρεις (report) απευθείας στο facebook πατώντας το "x" δεξιά και μετά "αναφορά" καθώς και να επικοινωνήσεις ​μαζί μας, μέσω της φόρμας επικοινωνίας, ώστε να ​προβούμε στις αρμόζουσες ενέργειες.​