南京大学大模型研究协同创新中心 大模型研究协同创新中心
  • 主页
  • 新闻
  • 研究小组
  • 出版物
  • English

Will Multimodal Models Be Dazzled by Multi-Image Visual Puzzles?

2026年5月5日·
Zhi Zhu
,
YaoQi Fan
,
Zhe Chen
,
Yue Cao
,
Yangzhou Liu
Tong Lu
Tong Lu
· 0 分钟阅读时长
引用 URL
类型
会议文章
出版物
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
最近更新于 2026年5月5日
Tong Lu
Authors
Tong Lu
南京大学

← VMonarch: Efficient Video Diffusion Transformers with Structured Attention 2026年5月5日
Arbitrary Generative Video Interpolation 2026年4月24日 →
语言:
中文 (简体)
English

© 2026 大模型研究协同创新中心, 南京大学. This work is licensed under CC BY NC ND 4.0

由Hugo Blox Builder支持发布——免费开源网站,为创作者赋能。