@huggingface

Выпуск

1 твитов

Hugging Face представила открытое практическое руководство по обучению с подкреплением сразу в нескольких агентных средах. Предложенный прокси поддерживает четыре API-формата, фиксирует точные ID токенов и logprobs из vLLM и позволяет обучать модели без изменения Claude Code, Codex или OpenCode. Отмечается, что одна и та же модель с одинаковыми весами может показывать 62% в одной среде и 33% в другой.

Темы: мульти-средовое RL · агентные среды · API-прокси · vLLM · открытые разработки

Ключевые твиты