南京大学大模型研究协同创新中心 Large Model Innovation Center
  • Home
  • News
  • Research
  • Publication
  • 中文 (简体)

Will Multimodal Models Be Dazzled by Multi-Image Visual Puzzles?

May 5, 2026·
Zhi Zhu
,
YaoQi Fan
,
Zhe Chen
,
Yue Cao
,
Yangzhou Liu
Tong Lu
Tong Lu
· 0 min read
Cite URL
Type
Conference paper
Publication
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
Last updated on May 5, 2026
Tong Lu
Authors
Tong Lu
Nanjing University

← VMonarch: Efficient Video Diffusion Transformers with Structured Attention May 5, 2026
Arbitrary Generative Video Interpolation Apr 24, 2026 →
Languages:
English
中文 (简体)

© 2026 Large Model Innovation Center, Nanjing University. This work is licensed under CC BY NC ND 4.0

Published with Hugo Blox Builder — the free, open source website builder that empowers creators.