@_LuoFuli
После почти полугодового молчания автор рассказал о работе над масштабированием RL в рамках текущего запуска MiMo-V2.6. Команда увеличивает вычисления, число сред и инструментов, а также ресурсы для оценки результатов; подробности планируют постепенно публиковать в открытом доступе. RL назван одним из наиболее масштабируемых и эффективных путей к самоулучшению.