UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions2026年5月5日·Guozhen Zhang,Zixiang Zhou,Teng Hu,Ziqiao Peng,Youliang Zhang,Yi Chen,Yuan Zhou,Qinglin LuLimin Wang· 0 分钟阅读时长 引用 URL类型会议文章出版物Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)最近更新于 2026年5月5日AuthorsLimin Wang南京大学← TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs 2026年5月5日VideoRealBench: A Chain-of-Thought Realism Evaluation Benchmark for Generated Human-Centric Videos 2026年5月5日 →