Tag
Luo Fuli's retrospective on MiMo-V2.6 details Xiaomi's innovations in scaling reinforcement learning for agents, focusing on expanded environments, integrated harnesses, and improved grading systems, leading to significant advancements in agent capabilities.