Balancing the Experts: Unlocking LoRA-MoE for GRPO via Mechanism-Aware RewardsApr 24, 2026·Changlian Ma,Zizheng Huang,Xiangyu Zeng,Yi Wang,Cheng Liang,Kun Tian,Xinhai ZhaoLimin Wang· 0 min read Cite URLTypeConference paperPublicationThe Fourteenth International Conference on Learning RepresentationsLast updated on Apr 24, 2026AuthorsLimin WangNanjing University← Arbitrary Generative Video Interpolation Apr 24, 2026CaReBench: A Fine-grained Benchmark for Video Captioning and Retrieval Apr 24, 2026 →