vqa-winner-cvprw-2017

VQA Model Trainer

Implementations and tools for training and fine-tuning a visual question answering model based on the 2017 CVPR workshop winner's approach.

Pytorch implementation of winner from VQA Chllange Workshop in CVPR'17

GitHub

164 stars
11 watching
38 forks
Language: Python
last commit: over 7 years ago
pytorchvisual-question-answering

Related projects:

RepositoryDescriptionStars
cadene/vqa.pytorchA PyTorch implementation of visual question answering with multimodal representation learning718
hyeonwoonoh/vqa-transfer-externaldataTools and scripts for training and evaluating a visual question answering model using transfer learning from an external data source.20
jayleicn/tvqaPyTorch implementation of video question answering system based on TVQA dataset172
milvlg/prophetAn implementation of a two-stage framework designed to prompt large language models with answer heuristics for knowledge-based visual question answering tasks.270
hitvoice/drqaImplementing reading comprehension from Wikipedia questions to answer open-domain queries using PyTorch and SQuAD dataset401
hengyuan-hu/bottom-up-attention-vqaAn implementation of a VQA system using bottom-up attention, aiming to improve the efficiency and speed of visual question answering tasks.755
jayleicn/clipbertAn efficient framework for end-to-end learning on image-text and video-text tasks709
pasqal-io/pyqtorchA PyTorch-based simulator for quantum machine learning45
penghao-wu/vstarPyTorch implementation of guided visual search mechanism for multimodal LLMs541
gt-vision-lab/vqa_lstm_cnnA Visual Question Answering model using a deeper LSTM and normalized CNN architecture.377
kaiyangzhou/dassl.pytorchA PyTorch toolbox for supporting research and development of domain adaptation, generalization, and semi-supervised learning methods in computer vision.1,236
kunpengli1994/vsrnAn open-source PyTorch implementation of a visual semantic reasoning model for image-text matching294
volcengine/vescaleA PyTorch-based framework for training large language models in parallel on multiple devices679
fartashf/vseppA PyTorch implementation of visual-semantic embedding methods for image-caption retrieval492
vlgiitr/dmn-plusA PyTorch implementation of an improved question answering architecture with dynamic memory networks and attention mechanisms64