论文arxiv cs.LG · 2d ago重要

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback

分类释义:学术论文 / 技术报告

TL;DR

Meta 提出 MeRLa 框架,通过元学习在辅助任务上习得任务感知的奖励塑形函数,解决 RLHF 中静态奖励模型信号稀疏、对齐次优的核心问题,在 LLaMA-3-8B 上击败 PPO/DPO/GRPO/DAPO,AlpacaEval 2.0 胜率达 90.8%。

关键要点

  • 01Meta 提出 MeRLa 框架
  • 02通过元学习在辅助任务上习得任务感知的奖励塑形函数
  • 03解决 RLHF 中静态奖励模型信号稀疏、对齐次优的核心问题
  • 04在 LLaMA-3-8B 上击败 PPO/DPO/GRPO/DAPO
为什么值得关注

RLHF 训练不稳定和信号稀疏是工程痛点,MeRLa 通过元学习任务感知塑形函数提供细粒度学习信号,训练不稳定性降低 41%。可借鉴点:在 RLHF pipeline 中预置辅助任务池让 reward model 学习跨任务泛化,或在现有 PPO/DPO 流程中叠加 potential-based shaping 模块。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7
角色你应该做什么
Tech Lead评估在 RLHF pipeline 中引入元学习奖励塑形的可行性,评估切换或叠加到 MeRLa 的迁移成本
应用工程师在现有 PPO/DPO 流程中叠加 potential-based reward shaping 模块,参考论文实现任务感知塑形函数
运维 / 平台暂无直接影响,了解即可
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.LG

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5