MPCCT: Multimodal vision-language learning paradigm with context-based compact Transformer

MPCCT: Multimodal vision-language learning paradigm with context-based compact Transformer | Litlas