Jan Kautz
Active 1998–2026
- 426
- Papers
- 53,138
- Citations
- 101
- h-index
- 303
- i10-index
Citations
Citation sources
Countries
Institutions
Fields
- Computer Science73.5%
- Engineering15.9%
- Medicine2.6%
- Physics and Astronomy1.5%
- Earth and Planetary Sciences1.1%
- Environmental Science0.9%
- Other4.5%
Topics
- Advanced Vision and Imaging7.1%
- Generative Adversarial Networks and Image Synthesis4.8%
- Computer Graphics and Visualization Techniques4.7%
- Image Enhancement Techniques4.4%
- Advanced Image Processing Techniques4.1%
- Multimodal Machine Learning Applications3.9%
- Other71%
Coauthors
- Pavlo Molchanov86
- Hongxu Yin44
- Sifei Liu44
- Hans-Peter Seidel37
- Zhiding Yu34
- Umar Iqbal31
- Ming-Yu Liu30
- Shalini De Mello30
- Kihwan Kim27
- Ming-Hsuan Yang26
- Orazio Gallo23
- Andrew Tao22
- Jinwei Gu22
- Arash Vahdat20
- Bryan Catanzaro19
- Xiaolong Wang19
- Xueting Li19
- Song Han18
- Wonmin Byeon18
- Deqing Sun17
- Xiaodong Yang17
- Guilin Liu16
- Shizhe Diao16
- Yejin Choi16
All papers
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
Authors: Nvidia Nvidia, :, Johan Björck, Fernando Castañeda, Nikita Cherniadev, Xingye Da, Runyu Ding, Linxi Fan, Fang Yu, Dieter Fox, Fengyuan Hu, Huang, Spencer, Joel Jang, Zhenyu Jiang, Jan Kautz, Kaushil Kundalia, Lao, Lawrence, Z. Y. Li, Zongyu Lin, Kevin Lin, Guilin Liu, Edith Llontop, Loïc Magne, Ajay Mandlekar, Avnish Narayan, Soroush Nasiriany, Scott Reed, You Liang Tan, Guanzhi Wang, Zu Wang, Jing Wang, Qi Wang, Jiannan Xiang, Yuqi Xie, Yinzhen Xu, Zhenjia Xu, Seonghyeon Ye, Zhiding Yu, Ao Zhang, Hao Zhang, Yizhou Zhao, Ruijie Zheng, Yuke Zhu - ArXiv.org, CoRR 2025 cited by 741
- Loss Functions for Image Restoration With Neural Networks
Authors: Hang Zhao, Orazio Gallo, Iuri Frosio, Jan Kautz - IEEE Transactions on Computational Imaging, IEEE Trans. Computational Imaging 2016 cited by 2,633
- LongVILA: Scaling Long-Context Visual Language Models for Long Videos
Authors: Yukang Chen, Fuzhao Xue, Dacheng Li, Qinghao Hu, Ligeng Zhu, Xiuyu Li, Yunhao Fang, Haotian Tang, Shang Yang, Zhijian Liu, Yihui He, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Linxi Fan, Yuke Zhu, Yao Lu, Song Han - ICLR 2025 cited by 307
- Gated Delta Networks: Improving Mamba2 with Delta Rule
Authors: Songlin Yang, Jan Kautz, Ali Hatamizadeh - ICLR 2025 cited by 386
- A-ViT: Adaptive Tokens for Efficient Vision Transformer
Authors: Hongxu Yin, Arash Vahdat, José M. Álvarez, Arun Mallya, Jan Kautz, Pavlo Molchanov - IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2022 cited by 299
- ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
Authors: Mingjie Liu, Shizhe Diao, Ximing Lu, Jian Hu, Xin Dong, Yejin Choi, Jan Kautz, Yi Dong - NeurIPS 2025 cited by 180
- Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
Authors: Zhenxin Li, Kailin Li, Shihao Wang, Shiyi Lan, Zhiding Yu, Yishen Ji, Zhiqi Li, Ziyue Zhu, Jan Kautz, Zuxuan Wu, Yu-Gang Jiang, José M. Álvarez - arXiv (Cornell University), CoRR 2024 cited by 176
- An Empirical Study of Mamba-based Language Models
Authors: Roger Waleffe, Wonmin Byeon, Duncan Riach, Brandon Norick, Vijay Korthikanti, Tri Dao, Albert Gu, Ali Hatamizadeh, Sudhakar Singh, Deepak Narayanan, Garvit Kulshreshtha, Vartika Singh, Jared Casper, Jan Kautz, Mohammad Shoeybi, Bryan Catanzaro - arXiv (Cornell University), CoRR 2024 cited by 168
- Pruning Convolutional Neural Networks for Resource Efficient Transfer Learning
Authors: Pavlo Molchanov, Stephen Tyree, Tero Karras, Timo Aila, Jan Kautz - International Conference on Learning Representations, ICLR (Poster) 2016 cited by 2,293
- FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation
Authors: Zhiqi Li, Zhiding Yu, David Austin, Mingsheng Fang, Shiyi Lan, Jan Kautz, José M. Álvarez - arXiv (Cornell University), CoRR 2023 cited by 147
- NaVILA: Legged Robot Vision-Language-Action Model for Navigation
Authors: An‐Chieh Cheng, Yandong Ji, Zhaojing Yang, Gongye, Zaitian, Xueyan Zou, Jan Kautz, Erdem Bıyık, Hongxu Yin, Sifei Liu, Xiaolong Wang - Robotics: Science and Systems XXI 2025 cited by 130
- CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation
Authors: Dejia Xu, Weili Nie, Chao Liu, Sifei Liu, Jan Kautz, Zhangyang Wang, Arash Vahdat - arXiv (Cornell University), CoRR 2024 cited by 124
- NVILA: Efficient Frontier Visual Language Models
Authors: Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Vishwesh Nath, Jinyi Hu, Sifei Liu, Ranjay Krishna, Daguang Xu, Xiaolong Wang, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, Yao Lu - ArXiv.org, CoRR 2024 cited by 123
- World Action Models are Zero-shot Policies
Authors: Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang - ArXiv.org, CoRR 2026 cited by 116
- MambaVision: A Hybrid Mamba-Transformer Vision Backbone
Authors: Ali Hatamizadeh, Jan Kautz - IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025 cited by 195
- World Simulation with Video Foundation Models for Physical AI
Authors: Nvidia Nvidia, :, Arslan Ali, Junjie Bai, Bala, Maciej, Yogesh Balaji, Blakeman, Aaron, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Y. Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Diamond, Jenna, Yifan Ding, Jiaojiao Fan, Linxi Fan, Feng, Liang, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Hao, Zekun, J. B. Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Y. Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung‐Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Ancheng Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Kien Pham, Morteza Ramezanali, Fitsum A. Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne P. Tchapmi, Wei‐Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Yang, Dinghao, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew X. Zhu, Yuke Zhu - ArXiv.org, CoRR 2025 cited by 113
- SpatialRGPT: Grounded Spatial Reasoning in Vision-Language Models
Authors: An-Chieh Cheng, Hongxu Yin, Yang Fu, Qiushan Guo, Ruihan Yang, Jan Kautz, Xiaolong Wang, Sifei Liu - Advances in Neural Information Processing Systems 37, NeurIPS 2024 cited by 111
- Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
Authors: Min Shi, Fuxiao Liu, Shihao Wang, Shijia Liao, Subhashree Radhakrishnan, Yilin Zhao, De-An Huang, Hongxu Yin, Karan Sapra, Yaser Yacoob, Humphrey Shi, Bryan Catanzaro, Andrew Tao, Jan Kautz, Zhiding Yu, Guilin Liu - ICLR 2025 cited by 152
- VILA: On Pre-training for Visual Language Models
Authors: Ji Lin, Hongxu Yin, Wei Ping, Yao Lu, Pavlo Molchanov, Andrew Tao, Huizi Mao, Jan Kautz, Mohammad Shoeybi, Song Han - arXiv (Cornell University), CoRR 2023 cited by 109
- OmniDrive: A Holistic LLM-Agent Framework for Autonomous Driving with 3D Perception, Reasoning and Planning
Authors: Shihao Wang, Zhiding Yu, Xiaohui Jiang, Shiyi Lan, Min Shi, Nadine Chang, Jan Kautz, Ying Li, José M. Álvarez - IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025 cited by 108
- Online Detection and Classification of Dynamic Hand Gestures with Recurrent 3D Convolutional Neural Networks
Authors: Pavlo Molchanov, Xiaodong Yang, Shalini Gupta, Kihwan Kim, Stephen Tyree, Jan Kautz - IEEE Conference on Computer Vision and Pattern Recognition (CVPR) 2016 cited by 675
- A Variational Perspective on Solving Inverse Problems with Diffusion Models
Authors: Morteza Mardani, Jiaming Song, Jan Kautz, Arash Vahdat - ICLR 2024 cited by 269
- NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model
Authors: NVIDIA, :, Aarti Basant, Abhijit Khairnar, Abhijit Paithankar, Abhinav Khattar, Adithya Renduchintala, Aditya Malte, Akhiad Bercovich, Akshay Hazare, Rico, Alejandra, Aleksander Ficek, Kondratenko, Alex, А. N. Shaposhnikov, Alexander Bukharin, Ali Taghibakhshi, Barton, Amelia, Ameya Sunil Mahabaleshwarkar, Amy Q. Shen, Andrew Tao, Ann Guan, Anna Shors, Anubhav Mandarwal, Mehta, Arham, Arun Venkatesan, Ashton Sharabiani, Ashwath Aithal, Ashwin Poojary, Ayush Dattagupta, Balaram Buddharaju, Banghua Zhu, Barnaby Simkin, Bilal Kartal, Bita Darvish Rouhani, B Chen, Boris Ginsburg, Brandon Norick, Brian Yu, Bryan Catanzaro, Charles Wang, Truong, Charlie, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Christian Munley, Christopher Parisien, Dan Su, Daniel Afrimi, Daniel Korzekwa, Daniel Rohrer, Daria Gitman, David Mosallanezhad, Deepak Narayanan, Dima Rekesh, Dina Yared, Dmytro Pykhtar, Dong Uk Ahn, Duncan Riach, Eileen Long, Elliott Ning, Eric S. Chung, Erick Galinkin, Evelina Bakhturina, Prasad, Gargi, Gerald Shen, Haifeng Qian, Haim Elisha, Harsh Sharma, Hayley Ross, Helen L. Ngo, Herman Sahota, Hexin Wang, Hoo Chang Shin, Hua Huang, Cunningham, Iain, Igor Gitman, Ivan Moshkov, Jaehun Jung, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jian Zhang, Jiaqi Zeng, Jimmy Zhang, Jinze Xue, Jocelyn Huang, J. S. Conway, John Kamalu, Jonathan D. Cohen, Joseph Jennings, J. Vialard, Jiun-Hung Yi, Jupinder Parmar, Kari Briski, Katherine Cheung, Katherine Luna, Keith Wyss, Keshav Santhanam, Kezhi Kong, Krzysztof Pawelec and 117 more - ArXiv.org, CoRR 2025 cited by 91
- Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models
Authors: Nvidia Nvidia, :, Blakeman, Aaron, Aarti Basant, Abhinav Khattar, Adithya Renduchintala, Akhiad Bercovich, Aleksander Ficek, Alexis Bjorlin, Ali Taghibakhshi, Amala Sanjay Deshmukh, Ameya Sunil Mahabaleshwarkar, Andrew Tao, Anna Shors, Ashwath Aithal, Ashwin Poojary, Ayush Dattagupta, Balaram Buddharaju, Chen, Bobby, Boris Ginsburg, Boxin Wang, Brandon Norick, Brian Butterfield, Bryan Catanzaro, Carlo del Mundo, Chengyu Dong, Harvey, Christine, Christopher Parisien, Dan Su, Daniel Korzekwa, Yin, Danny, Daria Gitman, David Mosallanezhad, Deepak Narayanan, Denys Fridman, Dima Rekesh, Ding Ma, Dmytro Pykhtar, Dong H. Ahn, Duncan Riach, Dušan Stošić, Eileen Long, Elad Segal, Ellie Evans, Eric S. Chung, Erick Galinkin, Evelina Bakhturina, Ewa Dobrowolska, Fei Jia, Fuxiao Liu, Prasad, Gargi, Gerald Shen, Guilin Liu, Chen Guo, Haifeng Qian, Helen L. Ngo, Hongbin Liu, Hui Li, Igor Gitman, Ilia Karmanov, Ivan Moshkov, Izik Golan, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jarno Seppänen, Jason Lu, Jason Sewall, Zeng, Jiaqi, You, Jiaxuan, Jimmy Zhang, Jing Zhang, Jining Huang, Jinze Xue, Jocelyn Huang, J. S. Conway, John Kamalu, Jon Barker, Jonathan Cohen, Joseph Jennings, Jupinder Parmar, Karan Sapra, Kari Briski, Kateryna Chumachenko, Katherine Luna, Keshav Santhanam, Kezhi Kong, Kirthi Sivamani, Krzysztof Pawelec, Kumar Anik, Kunlun Li, Lawrence McAfee, Leon Derczynski, Lindsey Pavao, L.A. Vega, Lukas Voegtle, Bala, Maciej, Maer Rodrigues de Melo, Makesh Narsimhan Sreedhar, Marcin Chochowski and 101 more - ArXiv.org, CoRR 2025 cited by 89
