Hugging Face Blog·· 2026-03-31精选AI 评分77
Hugging Face 发布 TRL v1.0 后训练库
TRL v1.0: Post-Training Library Built to Move with the Field
AI 导读
Hugging Face 发布 TRL v1.0,将 TRL 从研究代码库明确升级为面向生产使用的后训练库,支持超过 75 种后训练方法。新版本让稳定 API 与实验 API 共存,稳定层涵盖 SFT、DPO、Reward modeling、RLOO 和 GRPO 等训练器,最近一个 0.x 版本的迁移工作量较小。
推荐理由
文章解释了 TRL v1.0 如何以稳定与实验并存的契约应对后训练方法快速变化,并给出异步 GRPO 等后续方向。
来源:Hugging Face Blog · huggingface.co