@_LuoFuli

Выпуск

2 твитов

После почти полугодового молчания автор рассказал о работе над масштабированием RL в рамках текущего запуска MiMo-V2.6. Команда увеличивает вычисления, число сред и инструментов, а также ресурсы для оценки результатов; подробности планируют постепенно публиковать в открытом доступе. RL назван одним из наиболее масштабируемых и эффективных путей к самоулучшению.

Темы: масштабирование RL · MiMo-V2.6 · агентное обучение · оценка результатов · самоулучшение

Ключевые твиты