VMonarch: Efficient Video Diffusion Transformers with Structured Attention2026年5月5日·Cheng Liang,Haoxian Chen,Liang Hou,Qi Fan,Gangshan Wu,Xin TaoLimin Wang· 0 分钟阅读时长 引用 URL类型会议文章出版物Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)最近更新于 2026年5月5日AuthorsLimin Wang南京大学← VideoRealBench: A Chain-of-Thought Realism Evaluation Benchmark for Generated Human-Centric Videos 2026年5月5日Will Multimodal Models Be Dazzled by Multi-Image Visual Puzzles? 2026年5月5日 →