TASK	DATASET	MODEL	METRIC NAME	METRIC VALUE	GLOBAL RANK
Action Recognition	HMDB-51	OmniSource (SlowOnly-8x8-R101-RGB + I3D Flow)	Average accuracy of 3 splits	83.8	# 10
Action Classification	Kinetics-400	OmniSource SlowOnly R101 8x8 (Scratch)	Acc@1	80.4	# 93
Action Classification	Kinetics-400	OmniSource SlowOnly R101 8x8 (Scratch)	Acc@5	94.4	# 70
Action Classification	Kinetics-400	OmniSource SlowOnly R101 8x8(ImageNet pretrain)	Acc@1	80.5	# 89
Action Classification	Kinetics-400	OmniSource SlowOnly R101 8x8(ImageNet pretrain)	Acc@5	94.4	# 70
Action Classification	Kinetics-400	OmniSource irCSN-152 (IG-Kinetics-65M pretrain)	Acc@1	83.6	# 59
Action Recognition	UCF101	OmniSource (SlowOnly-8x8-R101-RGB + I3D-Flow)	3-fold Accuracy	98.6	# 5

Badge	Markdown
	`[![PWC](https://img.shields.io/endpoint.svg?url=https://paperswithcode.com/badge/omni-sourced-webly-supervised-learning-for/action-recognition-in-videos-on-ucf101)](https://paperswithcode.com/sota/action-recognition-in-videos-on-ucf101?p=omni-sourced-webly-supervised-learning-for)`
	`[![PWC](https://img.shields.io/endpoint.svg?url=https://paperswithcode.com/badge/omni-sourced-webly-supervised-learning-for/action-recognition-in-videos-on-hmdb-51)](https://paperswithcode.com/sota/action-recognition-in-videos-on-hmdb-51?p=omni-sourced-webly-supervised-learning-for)`
	`[![PWC](https://img.shields.io/endpoint.svg?url=https://paperswithcode.com/badge/omni-sourced-webly-supervised-learning-for/action-classification-on-kinetics-400)](https://paperswithcode.com/sota/action-classification-on-kinetics-400?p=omni-sourced-webly-supervised-learning-for)`

Omni-sourced Webly-supervised Learning for Video Recognition

ECCV 2020 · Haodong Duan, Yue Zhao, Yuanjun Xiong, Wentao Liu, Dahua Lin ·

We introduce OmniSource, a novel framework for leveraging web data to train video recognition models. OmniSource overcomes the barriers between data formats, such as images, short videos, and long untrimmed videos for webly-supervised learning. First, data samples with multiple formats, curated by task-specific data collection and automatically filtered by a teacher model, are transformed into a unified form. Then a joint-training strategy is proposed to deal with the domain gaps between multiple data sources and formats in webly-supervised learning. Several good practices, including data balancing, resampling, and cross-dataset mixup are adopted in joint training. Experiments show that by utilizing data from multiple sources and formats, OmniSource is more data-efficient in training. With only 3.5M images and 800K minutes videos crawled from the internet without human labeling (less than 2% of prior works), our models learned with OmniSource improve Top-1 accuracy of 2D- and 3D-ConvNet baseline models by 3.0% and 3.9%, respectively, on the Kinetics-400 benchmark. With OmniSource, we establish new records with different pretraining strategies for video recognition. Our best models achieve 80.4%, 80.5%, and 83.6 Top-1 accuracies on the Kinetics-400 benchmark respectively for training-from-scratch, ImageNet pre-training and IG-65M pre-training.

PDF Abstract ECCV 2020 PDF ECCV 2020 Abstract

Code

Add Remove Mark official

open-mmlab/mmaction official

1,847

open-mmlab/mmaction2

3,866

MCG-NJU/CPD-Video

Tasks

Add Remove

Action Classification

Action Recognition

Video Recognition

Datasets

UCF101

Kinetics

HMDB51

Kinetics 400

Results from the Paper

Edit

Ranked #5 on Action Recognition on UCF101 (using extra training data)

Get a GitHub badge

Task	Dataset	Model	Metric Name	Metric Value	Global Rank	Benchmark
Action Recognition	HMDB-51	OmniSource (SlowOnly-8x8-R101-RGB + I3D Flow)	Average accuracy of 3 splits	83.8	# 10	Compare
Action Classification	Kinetics-400	OmniSource SlowOnly R101 8x8 (Scratch)	Acc@1	80.4	# 93	Compare
Action Classification	Kinetics-400	OmniSource SlowOnly R101 8x8 (Scratch)	Acc@5	94.4	# 70	Compare
Action Classification	Kinetics-400	OmniSource SlowOnly R101 8x8(ImageNet pretrain)	Acc@1	80.5	# 89	Compare
Action Classification	Kinetics-400	OmniSource SlowOnly R101 8x8(ImageNet pretrain)	Acc@5	94.4	# 70	Compare
Action Classification	Kinetics-400	OmniSource irCSN-152 (IG-Kinetics-65M pretrain)	Acc@1	83.6	# 59	Compare
Action Recognition	UCF101	OmniSource (SlowOnly-8x8-R101-RGB + I3D-Flow)	3-fold Accuracy	98.6	# 5	Compare

Methods

Add Remove

Mixup

Edit Social Preview

Omni-sourced Webly-supervised Learning for Video Recognition

Code Edit Add Remove Mark official

Tasks Edit Add Remove

Datasets Edit

Results from the Paper Edit

Methods Edit Add Remove

Code

Add Remove Mark official

Tasks

Add Remove

Datasets

Results from the Paper

Edit

Methods

Add Remove