Resisting Noise in Pseudo Labels: Audible Video Event Parsing With Evidential Learning
Percepcja zdarzeń czasowych oraz rozróżnianie ich typów modalnych w filmach audio–wideo, określane jako audio-visual video parsing (AVVP), stają się istotnym kierunkiem badań w dziedzinie multimodalnego rozumienia sekwencji obrazów i wideo. Zadanie AVVP jest zazwyczaj realizowane w ustawieniu uczenia słabo nadzorowanego (weakly supervised learning), ponieważ dostępne są jedynie etykiety na poziomie całych nagrań wideo. Większość istniejących metod najpierw generuje pseudo-etykiety dla poszczególnych modalności (audio i wideo), a następnie wykorzystuje je do uczenia modeli rozpoznających lokalne zdarzenia audio lub wizualne.
Tego typu podejście prowadzi jednak do dwóch poważnych problemów: (1) generowane pseudo-etykiety dla każdej modalności nie są w pełni wiarygodne, co może wprowadzać model AI w błąd, jeśli używa się ich jako bezpośredniego sygnału nadzorującego przy rozróżnianiu modalności; (2) brak dokładnych adnotacji czasowych zwiększa niejednoznaczność w lokalizacji zdarzeń wideo, przez co modele stają się bardziej podatne na szum w danych. Aby rozwiązać te problemy, autorzy proponują nowe podejście do AVVP o nazwie NREP (Noise-Resistant Event Parsing), który wykorzystuje uczenie głębokie oparte na dowodach (evidential deep learning), ograniczając wpływ szumu w pseudo-nadzorze.
W szczególności framework NREP składa się z trzech głównych komponentów: (1) modalitywise evidential learning (MEL), które modeluje zależności pomiędzy modalnością (audio/wideo) a klasą zdarzenia; (2) temporalwise evidential learning (TEL), które identyfikuje istotne zdarzenia pierwszoplanowe w czasie; (3) foreground–background consistency learning (FBCL), które wymusza spójność pomiędzy dwiema powyższymi gałęziami uczenia opartymi na dowodach. Dzięki analizie zawartości wideo oraz uczeniu się „dowodów” dla zależności modalnych metoda skutecznie redukuje wpływ szumu w generowanych pseudo-etykietach, osiągając bardzo dobre wyniki niezależnie od przyjętej strategii ich generowania. NREP został oceniony na dwóch benchmarkowych zbiorach danych AVVP, gdzie konsekwentnie uzyskuje wyniki na poziomie aktualnego stanu sztuki lub go przewyższa.
Artykuł:
IEEE Transactions on Neural Networks and Learning Systems
Autorzy z PW:
Andrzej Cichocki
Rok wydania: