资讯

基于规则的强化学习(RL/RFT)已成为替代 SFT 的高效方案,仅需少量样本即可提升模型在特定任务中的表现。该方法通过预定义奖励函数规避人工标注成本,如 DeepSeek-R1 ...