Learnable pooling with Context Gating for video classification

来源:互联网 发布:更改防火墙端口 编辑:程序博客网 时间:2024/06/06 05:13

这篇论文是2016年Google Cloud & YouTube-8M Video Understanding Challenge比赛中冠军得主的论文。
文章的两点贡献:

  1. 融合了VLAD, bag-of-visual-words和Fisher Vector三种编码方式,并且每个都做了一定程度的调整。其中,VLAD改为NetRVLAD, bag-of-visual-words改为Soft-DBoW, Fisher Vector改为NetFV。
  2. 提出了一个新的非线性的单元 Context Gating (CG)。CG可以捕获特征之间或者标签之间的依赖性。具体的还要再看一下再补充。

论文框架:
这里写图片描述

实验结果:
这里写图片描述

代码: https://github.com/antoine77340/Youtube-8M-WILLOW
工具:https://github.com/antoine77340/LOUPE.

阅读全文
0 0