# Video Question Answering, Reasoning and Dialogue ## Video Question Answering & Reasoning - [2017 CVPR] **TGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question Answering**, [[paper]](http://zpascal.net/cvpr2017/Jang_TGIF-QA_Toward_Spatio-Temporal_CVPR_2017_paper.pdf), [[bibtex]](/Bibtex/TGIF-QA%20-%20Toward%20Spatio-Temporal%20Reasoning%20in%20Visual%20Question%20Answering.bib), sources: [[YunseokJANG/tgif-qa]](https://github.com/YunseokJANG/tgif-qa). - [2017 ACMMM] **Video Question Answering via Gradually Refined Attention over Appearance and Motion**, [[paper]](https://www.comp.nus.edu.sg/~xiangnan/papers/mm17-videoQA.pdf), [[bibtex]](/Bibtex/Video%20Question%20Answering%20via%20Gradually%20Refined%20Attention%20over%20Appearance%20and%20Motion.bib). - [2018 CVPR] **Motion-Appearance Co-Memory Networks for Video Question Answering**, [[paper]](http://openaccess.thecvf.com/content_cvpr_2018/papers/Gao_Motion-Appearance_Co-Memory_Networks_CVPR_2018_paper.pdf), [[bibtex]](/Bibtex/Motion-Appearance%20Co-Memory%20Networks%20for%20Video%20Question%20Answering.bib). - [2018 CVPR] **Focal Visual-Text Attention for Visual Question Answering**, [[paper]](http://openaccess.thecvf.com/content_cvpr_2018/papers/Liang_Focal_Visual-Text_Attention_CVPR_2018_paper.pdf), [[bibtex]](/Bibtex/Focal%20Visual-Text%20Attention%20for%20Visual%20Question%20Answering.bib), sources: [[JunweiLiang/FVTA_memoryqa]](https://github.com/JunweiLiang/FVTA_memoryqa). - [2018 EMNLP] **TVQA: Localized Compositional Video Question Answering**, [[paper]](https://www.aclweb.org/anthology/D18-1167.pdf), [[bibtex]](/Bibtex/TVQA%20-%20Localized%20Compositional%20Video%20Question%20Answering.bib), [[supplementary]](https://www.aclweb.org/anthology/attachments/D18-1167.Attachment.pdf), [[homepage]](http://tvqa.cs.unc.edu), sources: [[jayleicn/TVQA]](https://github.com/jayleicn/TVQA). - [2019 TPAMI] **Focal Visual-Text Attention for Memex Question Answering**, [[paper]](http://llcao.net/paper/MemexQA_TPAMI.pdf), [[bibtex]](/Bibtex/Focal%20Visual-Text%20Attention%20for%20Memex%20Question%20Answering.bib), [[homepage]](https://memexqa.cs.cmu.edu), sources: [[JunweiLiang/FVTA_memoryqa]](https://github.com/JunweiLiang/FVTA_memoryqa). - [2019 CVPR] **Heterogeneous Memory Enhanced Multimodal Attention Model for Video Question Answering**, [[paper]](http://openaccess.thecvf.com/content_CVPR_2019/papers/Fan_Heterogeneous_Memory_Enhanced_Multimodal_Attention_Model_for_Video_Question_Answering_CVPR_2019_paper.pdf), [[bibtex]](/Bibtex/Heterogeneous%20Memory%20Enhanced%20Multimodal%20Attention%20Model%20for%20Video%20Question%20Answering.bib), [[poster]](http://homes.sice.indiana.edu/fan6/docs/cvpr19_videoqa.pdf), sources: [[fanchenyou/HME-VideoQA]](https://github.com/fanchenyou/HME-VideoQA). - [2019 AAAI] **ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answering**, [[paper]](https://arxiv.org/pdf/1906.02467.pdf), [[bibtex]](/Bibtex/ActivityNet-QA%20-%20A%20Dataset%20for%20Understanding%20Complex%20Web%20Videos%20via%20Question%20Answering.bib), sources: [[MILVLG/activitynet-qa]](https://github.com/MILVLG/activitynet-qa). - [2019 ArXiv] **TVQA+: Spatio-Temporal Grounding for Video Question Answering**, [[paper]](https://arxiv.org/pdf/1904.11574.pdf), [[bibtex]](/Bibtex/TVQA+%20-%20Spatio-Temporal%20Grounding%20for%20Video%20Question%20Answering.bib), [[homepage]](http://tvqa.cs.unc.edu). - [2020 AAAI] **Divide and Conquer: Question-Guided Spatio-Temporal Contextual Attention for Video Question Answering**, [[paper]](https://www.aaai.org/Papers/AAAI/2020GB/AAAI-JiangJ.1655.pdf), [[bibtex]](/Bibtex/Divide%20and%20Conquer%20-%20Question-Guided%20Spatio-Temporal%20Contextual%20Attention%20for%20Video%20Question%20Answering.bib). - [2020 ICLR] **CLEVRER: Collision Events for Video Representation and Reasoning**, [[paper]](https://openreview.net/pdf?id=HkxYzANYDB), [[bibtex]](/Bibtex/CLEVRER%20-%20Collision%20Events%20for%20Video%20Representation%20and%20Reasoning.bib), [[homepage]](http://clevrer.csail.mit.edu/). ## Video Grounded Dialogue - [2019 ACL] **Multimodal Transformer Networks for End-to-End Video-Grounded Dialogue Systems**, [[paper]](https://www.aclweb.org/anthology/P19-1564.pdf), [[bibtex]](/Bibtex/Multimodal%20Transformer%20Networks%20for%20End-to-End%20Video-Grounded%20Dialogue%20Systems.bib), sources: [[henryhungle/MTN]](https://github.com/henryhungle/MTN).