← назад

trl

TRL (Transformer Reinforcement Learning)

Библиотека HuggingFace для обучения LLM с подкреплением. Версия 1.0 вышла 01-04-2026.

TRL реализует RLHF, PPO, DPO, ORPO и другие методы alignment. v1.0 принёс стабильные API, широкие интеграции с экосистемой HuggingFace и архитектуру, рассчитанную на будущие изменения в области.

Ссылки: - GitHub: https://github.com/huggingface/trl - Блог (v1.0): http://hf.co/blog/trl-v1

Источник: @huggingface, 01-04-2026