# Other Vision and Language Tasks ## Datasets - [2021 ICASSP] **QuerYD: A Video Dataset with High-Quality Textual and Audio Narrations**, [[paper]](https://arxiv.org/pdf/2011.11071.pdf), [[bibtex]](/Bibtex/QuerYD%20-%20A%20Video%20Dataset%20with%20High-Quality%20Textual%20and%20Audio%20Narrations.bib), [[homepage]](https://www.robots.ox.ac.uk/~vgg/data/queryd/). ## Video and Language Future Event Prediction - [2020 EMNLP] **What is More Likely to Happen Next? Video-and-Language Future Event Prediction**, [[paper]](https://www.aclweb.org/anthology/2020.emnlp-main.706.pdf), [[bibtex]](https://www.aclweb.org/anthology/2020.emnlp-main.706.bib), sources: [[jayleicn/VideoLanguageFuturePred]](https://github.com/jayleicn/VideoLanguageFuturePred). ## Video and Language Inference - [2020 CVPR] **VIOLIN: A Large-Scale Dataset for Video-and-Language Inference**, [[paper]](https://openaccess.thecvf.com/content_CVPR_2020/papers/Liu_Violin_A_Large-Scale_Dataset_for_Video-and-Language_Inference_CVPR_2020_paper.pdf), [[bibtex]](/Bibtex/VIOLIN%20-%20A%20Large-Scale%20Dataset%20for%20Video-and-Language%20Inference.bib), sources: [[jimmy646/violin]](https://github.com/jimmy646/violin). ## Vision-and-Language Navigation - [2018 CVPR] **Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments**, [[paper]](http://openaccess.thecvf.com/content_cvpr_2018/papers/Anderson_Vision-and-Language_Navigation_Interpreting_CVPR_2018_paper.pdf), [[bibtex]](/Bibtex/Vision-and-Language%20Navigation.bib), sources: [[peteanderson80/Matterport3DSimulator]](https://github.com/peteanderson80/Matterport3DSimulator). - [2019 ACL] **Are You Looking? Grounding to Multiple Modalities in Vision-and-Language Navigation**, [[paper]](https://www.aclweb.org/anthology/P19-1655.pdf), [[bibtex]](/Bibtex/Are%20You%20Looking%20Grounding%20to%20Multiple%20Modalities%20in%20Vision-and-Language%20Navigation.bib), [[supplementary]](https://www.aclweb.org/anthology/attachments/P19-1655.Supplementary.pdf).