Zhe Gan
2009–2026 年に発表
- 167
- 論文数
- 20,364
- 被引用数
- 68
- h 指数
- 140
- i10 指数
被引用数
引用元
国・地域
機関
分野
- Computer Science87.2%
- Engineering3.1%
- Social Sciences1.6%
- Medicine1.5%
- Psychology1%
- Neuroscience0.9%
- その他4.7%
トピック
- Multimodal Machine Learning Applications16.2%
- Topic Modeling10.2%
- Natural Language Processing Techniques6.8%
- Domain Adaptation and Few-Shot Learning6.3%
- Advanced Image and Video Retrieval Techniques5.5%
- Human Pose and Action Recognition4%
- その他51%
共著者
- Jingjing Liu45
- Lawrence Carin41
- Yu Cheng37
- Yinfei Yang32
- Lijuan Wang31
- Linjie Li26
- Zicheng Liu22
- Jianfeng Gao18
- Jianfeng Wang18
- Ricardo Henao17
- Shuohang Wang17
- Haotian Zhang16
- Chunyuan Li15
- Bowen Zhang13
- Yizhe Zhang12
- Zhengyuan Yang12
- Changyou Chen11
- Liqun Chen11
- Yen-Chun Chen11
- Yunchen Pu11
- Guoyin Wang10
- Xianzhi Du10
- Dinghan Shen9
- Ruiyi Zhang9
全論文
- GIT: A Generative Image-to-text Transformer for Vision and Language
著者: Jianfeng Wang, Zhengyuan Yang, Xiaowei Hu, Linjie Li, Kevin Lin, Zhe Gan, Zicheng Liu, Ce Liu, Lijuan Wang - Trans. Mach. Learn. Res. 2022 被引用: 487
- Ferret: Refer and Ground Anything Anywhere at Any Granularity
著者: Haoxuan You, Haotian Zhang, Zhe Gan, Xianzhi Du, Bowen Zhang, Zirui Wang, Liangliang Cao, Shih-Fu Chang, Yinfei Yang - ICLR 2024 被引用: 569
- MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training
著者: Brandon McKinzie, Zhe Gan, Jean-Philippe Fauconnier, Sam Dodge, Bowen Zhang, Philipp Dufter, Dhruti Shah, Xianzhi Du, Futang Peng, Floris Weers, Anton Belyi, Haotian Zhang, Karanjeet Singh, Doug Kang, Ankur Jain, Hongyu Hè, Max Schwarzer, Tom Gunter, Xiang Kong, Aonan Zhang, Jianyu Wang, Chong Wang, Nan Du, Tao Lei, Sam Wiseman, Guoli Yin, Mark Lee, Zirui Wang, Ruoming Pang, Peter Grasch, Alexander Toshev, Yinfei Yang - arXiv (Cornell University), CoRR 2024 被引用: 223
- An Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA
著者: Zhengyuan Yang, Zhe Gan, Jianfeng Wang, Xiaowei Hu, Yumao Lu, Zicheng Liu, Lijuan Wang - AAAI Conference on Artificial Intelligence 2022 被引用: 278
- SwinBERT: End-to-End Transformers with Sparse Attention for Video Captioning
著者: Kevin Lin, Linjie Li, Chung-Ching Lin, Faisal Ahmed, Zhe Gan, Zicheng Liu, Yumao Lu, Lijuan Wang - IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2022 被引用: 269
- Guiding Instruction-based Image Editing via Multimodal Large Language Models
著者: Tsu-Jui Fu, Wenze Hu, Xianzhi Du, William Yang Wang, Yinfei Yang, Zhe Gan - ICLR 2024 被引用: 198
- Patient Knowledge Distillation for BERT Model Compression
著者: Siqi Sun, Yu Cheng, Zhe Gan, Jingjing Liu - Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), EMNLP/IJCNLP (1) 2019 被引用: 297
- SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
著者: Mingze Xu, Mingfei Gao, Zhe Gan, Hong-You Chen, Zhengfeng Lai, Haiming Gang, Kai Kang, Afshin Dehghan - arXiv (Cornell University), CoRR 2024 被引用: 112
- Improve Vision Language Model Chain-of-thought Reasoning
著者: Ruohong Zhang, Bowen Zhang, Yanghao Li, Haotian Zhang, Zhiqing Sun, Zhe Gan, Yinfei Yang, Ruoming Pang, Yiming Yang - Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL (1) 2025 被引用: 110
- Multimodal Foundation Models: From Specialists to General-Purpose Assistants
著者: Chunyuan Li, Zhe Gan, Zhengyuan Yang, Jianwei Yang, Linjie Li, Lijuan Wang, Jianfeng Gao - Foundations and Trends® in Computer Graphics and Vision, Found. Trends Comput. Graph. Vis. 2024 被引用: 134
- Prompting GPT-3 To Be Reliable
著者: Chenglei Si, Zhe Gan, Zhengyuan Yang, Shuohang Wang, Jianfeng Wang, Jordan L. Boyd-Graber, Lijuan Wang - ICLR 2023 被引用: 383
- Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models
著者: Boxin Wang, Chejian Xu, Shuohang Wang, Zhe Gan, Yu Cheng, Jianfeng Gao, Ahmed Hassan Awadallah, Bo Li - NeurIPS Datasets and Benchmarks 2021 被引用: 308
- Scaling Up Vision-Language Pretraining for Image Captioning
著者: Xiaowei Hu, Zhe Gan, Jianfeng Wang, Zhengyuan Yang, Zicheng Liu, Yumao Lu, Lijuan Wang - IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2022 被引用: 206
- Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
著者: Haotian Zhang, Haoxuan You, Philipp Dufter, Bowen Zhang, Chen Chen, Hong-You Chen, Tsu-Jui Fu, William Yang Wang, Shih-Fu Chang, Zhe Gan, Yinfei Yang - arXiv (Cornell University), CoRR 2024 被引用: 87
- HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training
著者: Linjie Li, Yen-Chun Chen, Yu Cheng, Zhe Gan, Licheng Yu, Jingjing Liu - Conference on Empirical Methods in Natural Language Processing (EMNLP), EMNLP (1) 2020 被引用: 389
- VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling
著者: Tsu-Jui Fu, Linjie Li, Zhe Gan, Kevin Lin, William Yang Wang, Lijuan Wang, Zicheng Liu - arXiv (Cornell University), CoRR 2021 被引用: 177
- GRiT: A Generative Region-to-Text Transformer for Object Understanding
著者: Jialian Wu, Jianfeng Wang, Zhengyuan Yang, Zhe Gan, Zicheng Liu, Junsong Yuan, Lijuan Wang - Lecture notes in computer science, ECCV (80) 2024 被引用: 94
- Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs
著者: Keen You, Haotian Zhang, Eldon Schoop, Floris Weers, Amanda Swearngin, Jeffrey Nichols, Yinfei Yang, Zhe Gan - Lecture notes in computer science, ECCV (64) 2024 被引用: 71
- MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
著者: Haotian Zhang, Mingfei Gao, Zhe Gan, Philipp Dufter, Nina Wenzel, Forrest Huang, Dhruti Shah, Xianzhi Du, Bowen Zhang, Yanghao Li, Sam Dodge, Keen You, Zhen Yang, Aleksei Timofeev, Mingze Xu, Hong-You Chen, Jean-Philippe Fauconnier, Zhengfeng Lai, Haoxuan You, Zirui Wang, Afshin Dehghan, Peter Grasch, Yinfei Yang - ICLR 2025 被引用: 73
- FreeLB: Enhanced Adversarial Training for Natural Language Understanding
著者: Chen Zhu, Yu Cheng, Zhe Gan, Siqi Sun, Tom Goldstein, Jingjing Liu - ICLR 2020 被引用: 521
- UNITER: Learning UNiversal Image-TExt Representations
著者: Yen-Chun Chen, Linjie Li, Licheng Yu, Ahmed El Kholy, Faisal Ahmed, Zhe Gan, Yu Cheng, Jingjing Liu - Lecture notes in computer science, ECCV (30) 2020 被引用: 1,847
- Large-Scale Adversarial Training for Vision-and-Language Representation Learning
著者: Zhe Gan, Yen-Chun Chen, Linjie Li, Chen Zhu, Yu Cheng, Jingjing Liu - Neural Information Processing Systems, NeurIPS 2020 被引用: 559
- Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
著者: Yusu Qian, Eli Bocek-Rivele, Liangchen Song, Jialing Tong, Yinfei Yang, Jiasen Lu, Wenze Hu, Zhe Gan - ArXiv.org, CoRR 2025 被引用: 44
- Multimodal Autoregressive Pre-training of Large Vision Encoders
著者: Enrico Fini, Mustafa Shukor, Xiujun Li, Philipp Dufter, Michal Klein, David Haldimann, Sai Aitharaju, Victor G. Turrisi da Costa, Louis Béthune, Zhe Gan, Alexander Toshev, Marcin Eichner, Moin Nabi, Yinfei Yang, Joshua M. Susskind, Alaaeldin El-Nouby - IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025 被引用: 44
